A Kensho új módszerrel méri az AI-pénzügyi keresők teljesítményét

A Kensho olyan értékelési módszert dolgozott ki pénzügyi adatokat kereső AI-ügynökeihez, amely a folyamatosan változó dokumentumállományt is figyelembe veszi. A vállalat szerint a hagyományos, rögzített benchmarkok nem elegendők annak megállapítására, hogy egy rendszer valóban a megfelelő bizonyítékot találta-e meg.
- A Kensho szerint a rögzített benchmarkok nem tükrözik a folyamatosan változó pénzügyi adatokat.
- Az Adaptive Retrieval a kérdéseket részkérdésekre bontja, majd szakterületi ügynökökhöz irányítja.
- A keresés minőségét a szövegrészletek, metaadatok, ismételt eredmények és ügynöknyomvonal alapján is mérik.
- A generált válaszok összevetését ígéretesnek, de egyelőre nem bizonyítottnak tartja a Kensho.
- A cél a következetesség és a rugalmas, nyitott végű keresés közötti egyensúly.
A pénzügyi adatok folyamatosan változnak
A Kensho, az S&P Global része, október 6-án ismertette értékelési megközelítését. A vállalat olyan környezetben fejleszt keresőügynököket, ahol a strukturált adatok, például a vállalati pénzügyi adatok és piaci adatok mellett strukturálatlan források is szerepelnek. Ide tartoznak a gyorsjelentésekhez kapcsolódó konferenciahívások leiratai, a befektetői prezentációk és a vállalati beadványok.
Az S&P Global AI Data Portal két lekérdezési módszert kínál, amelyek bármilyen AI- és ügynökarchitektúrával használhatók. Az összetettebb, nyitott végű kutatási feladatokhoz készült Adaptive Retrieval a természetes nyelvű kérdéseket részkérdésekre bontja, majd azokat külön, szakterületre szabott ügynökökhöz irányítja. Az ügynökök az S&P Global adatvagyonának megfelelő részében keresnek, és hivatkozásokkal alátámasztott válaszokat adnak.
Több ponton vizsgálják a keresés minőségét
A Kensho strukturálatlan keresőügynökei kész válaszok helyett az alátámasztott dokumentumok szó szerinti részleteit adják vissza. A fejlesztők ezért több különböző felületen is ellenőrzik a teljesítményt.
- A visszaadott szövegrészlet tartalma: szakértők által kijelölt, úgynevezett aranyrészletekkel vetik össze, hogy a rendszer megtalálta-e a kérdéshez szükséges bizonyítékot.
- A metaadatok: ellenőrzik többek között az érintett vállalatokat, időszakokat és dokumentumtípusokat. Ezek a szempontok akkor is viszonylag stabilak maradhatnak, amikor új dokumentumok jelennek meg.
- A visszaadott részletek azonossága: ugyanazt a kérdést többször lefuttatva mérik, mennyire hasonló eredmények születnek. Ez azonban a következetességet mutatja, nem feltétlenül a helyességet.
- Az ügynök nyomvonala: vizsgálják a lekérdezéseket, eszközhívásokat és keresési döntéseket, azt, hogy az ügynök követte-e az utasításokat, és megfelelő argumentumokat használt-e.
A létrehozott válasz szintén értékelhető, bár az Adaptive Retrieval feladatában az ügynök közvetlen kimenete a bizonyíték, nem a kész válasz. A Kensho szerint a generált válasz így hasznos közvetett jelzője lehet a visszaadott bizonyíték minőségének.
Miért kevés a rögzített benchmark?
A klasszikus információ-visszakeresési tesztek rögzített dokumentumgyűjteményből, kérdésekből és előre meghatározott relevanciaítéletekből indulnak ki. Ilyen környezetben olyan mutatók használhatók, mint a recall@k, a mean reciprocal rank és az nDCG. A Kensho szerint ezek a módszerek fontos kutatási alapot jelentenek, de két feltevésre épülnek: a korpusz változatlan, és előre kijelölhető a helyes eredmény.
A pénzügyi információknál egyik feltétel sem biztosított. Új dokumentumok folyamatosan jelennek meg, ezért a korábbi aranycímkék idővel elavulhatnak. Egy kérdésre több, ésszerű értelmezés és több releváns bizonyíték is létezhet, amelyekről még a szakterületi szakértők sem feltétlenül értenek egyet.
A Kensho vizsgálta az úgynevezett felügyelet nélküli A/B-tesztelést is. Ennek során az egyes rendszerek által visszaadott részletekből egy nyelvi modell válaszokat készít, majd egy bíró összeveti ezeket. A megközelítést azonban torzíthatja a válaszok hossza, formázása, stílusa vagy megjelenítési sorrendje. A vállalat szerint az eljárás ígéretes, de egyelőre nem bizonyított, ezért a gyakorlatban nem támaszkodik rá.
A Kensho értékelési rendszere ezzel a tényszerűség, a változó adatállomány, az ismételt futtatások eltérései és az ügynök döntési folyamata között próbál egyensúlyt teremteni. A vállalat szerint a maximális stabilitás önmagában nem cél, mert a nyitott kérdések többféle ésszerű keresési útvonalat is megengedhetnek.
Kensho (S&P Global): Beyond static benchmarks: How Kensho evaluates AI retrieval across evolving financial data
