Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Kensho új módszerrel méri az AI-pénzügyi keresők teljesítményét

2026. október 6. 15:00Forrás: Kensho (S&P Global)
A Kensho új módszerrel méri az AI-pénzügyi keresők teljesítményét
Kép: Kensho (S&P Global)

A Kensho olyan értékelési módszert dolgozott ki pénzügyi adatokat kereső AI-ügynökeihez, amely a folyamatosan változó dokumentumállományt is figyelembe veszi. A vállalat szerint a hagyományos, rögzített benchmarkok nem elegendők annak megállapítására, hogy egy rendszer valóban a megfelelő bizonyítékot találta-e meg.

A lényeg röviden
  • A Kensho szerint a rögzített benchmarkok nem tükrözik a folyamatosan változó pénzügyi adatokat.
  • Az Adaptive Retrieval a kérdéseket részkérdésekre bontja, majd szakterületi ügynökökhöz irányítja.
  • A keresés minőségét a szövegrészletek, metaadatok, ismételt eredmények és ügynöknyomvonal alapján is mérik.
  • A generált válaszok összevetését ígéretesnek, de egyelőre nem bizonyítottnak tartja a Kensho.
  • A cél a következetesség és a rugalmas, nyitott végű keresés közötti egyensúly.

A pénzügyi adatok folyamatosan változnak

A Kensho, az S&P Global része, október 6-án ismertette értékelési megközelítését. A vállalat olyan környezetben fejleszt keresőügynököket, ahol a strukturált adatok, például a vállalati pénzügyi adatok és piaci adatok mellett strukturálatlan források is szerepelnek. Ide tartoznak a gyorsjelentésekhez kapcsolódó konferenciahívások leiratai, a befektetői prezentációk és a vállalati beadványok.

Az S&P Global AI Data Portal két lekérdezési módszert kínál, amelyek bármilyen AI- és ügynökarchitektúrával használhatók. Az összetettebb, nyitott végű kutatási feladatokhoz készült Adaptive Retrieval a természetes nyelvű kérdéseket részkérdésekre bontja, majd azokat külön, szakterületre szabott ügynökökhöz irányítja. Az ügynökök az S&P Global adatvagyonának megfelelő részében keresnek, és hivatkozásokkal alátámasztott válaszokat adnak.

Több ponton vizsgálják a keresés minőségét

A Kensho strukturálatlan keresőügynökei kész válaszok helyett az alátámasztott dokumentumok szó szerinti részleteit adják vissza. A fejlesztők ezért több különböző felületen is ellenőrzik a teljesítményt.

  • A visszaadott szövegrészlet tartalma: szakértők által kijelölt, úgynevezett aranyrészletekkel vetik össze, hogy a rendszer megtalálta-e a kérdéshez szükséges bizonyítékot.
  • A metaadatok: ellenőrzik többek között az érintett vállalatokat, időszakokat és dokumentumtípusokat. Ezek a szempontok akkor is viszonylag stabilak maradhatnak, amikor új dokumentumok jelennek meg.
  • A visszaadott részletek azonossága: ugyanazt a kérdést többször lefuttatva mérik, mennyire hasonló eredmények születnek. Ez azonban a következetességet mutatja, nem feltétlenül a helyességet.
  • Az ügynök nyomvonala: vizsgálják a lekérdezéseket, eszközhívásokat és keresési döntéseket, azt, hogy az ügynök követte-e az utasításokat, és megfelelő argumentumokat használt-e.

A létrehozott válasz szintén értékelhető, bár az Adaptive Retrieval feladatában az ügynök közvetlen kimenete a bizonyíték, nem a kész válasz. A Kensho szerint a generált válasz így hasznos közvetett jelzője lehet a visszaadott bizonyíték minőségének.

Miért kevés a rögzített benchmark?

A klasszikus információ-visszakeresési tesztek rögzített dokumentumgyűjteményből, kérdésekből és előre meghatározott relevanciaítéletekből indulnak ki. Ilyen környezetben olyan mutatók használhatók, mint a recall@k, a mean reciprocal rank és az nDCG. A Kensho szerint ezek a módszerek fontos kutatási alapot jelentenek, de két feltevésre épülnek: a korpusz változatlan, és előre kijelölhető a helyes eredmény.

A pénzügyi információknál egyik feltétel sem biztosított. Új dokumentumok folyamatosan jelennek meg, ezért a korábbi aranycímkék idővel elavulhatnak. Egy kérdésre több, ésszerű értelmezés és több releváns bizonyíték is létezhet, amelyekről még a szakterületi szakértők sem feltétlenül értenek egyet.

A Kensho vizsgálta az úgynevezett felügyelet nélküli A/B-tesztelést is. Ennek során az egyes rendszerek által visszaadott részletekből egy nyelvi modell válaszokat készít, majd egy bíró összeveti ezeket. A megközelítést azonban torzíthatja a válaszok hossza, formázása, stílusa vagy megjelenítési sorrendje. A vállalat szerint az eljárás ígéretes, de egyelőre nem bizonyított, ezért a gyakorlatban nem támaszkodik rá.

A Kensho értékelési rendszere ezzel a tényszerűség, a változó adatállomány, az ismételt futtatások eltérései és az ügynök döntési folyamata között próbál egyensúlyt teremteni. A vállalat szerint a maximális stabilitás önmagában nem cél, mert a nyitott kérdések többféle ésszerű keresési útvonalat is megengedhetnek.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Kutatás
Kutatás2026. október 2. 00:26

A PyTorch szerint a TLX gyorsabb lett a Blackwell Jagged Flash Attentionjénél

A PyTorch csapata olyan Jagged Flash Attention kernelt mutatott be NVIDIA Blackwell B200 GPU-kra, amely a vállalat mérései szerint a GEM munkaterhelésén gyorsabb volt a…

Kutatás
Kutatás2026. október 2. 00:26

A PyTorch TLX-kernellel gyorsította a Meta hirdetési modelljének figyelmét

A PyTorch olyan Jagged Flash Attention-kernelt mutatott be, amely az NVIDIA Blackwell B200 gyorsítón a Meta Generative Ads Model modelljéhez fontos alakzatokon…

Az RBC 8000 bankár munkájába építette be az ellenőrizhető AI-t
Cégek és üzlet2026. szeptember 10. 17:27

Az RBC 8000 bankár munkájába építette be az ellenőrizhető AI-t

Az RBC Capital Markets az S&P Global pénzügyi adatait és a Kensho Deterministic Retrieval megoldását integrálta saját Aiden AI-platformjába. A rendszer több mint 8000…