Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Automatikus átvilágítási kaput épített az LLM-ek pénzügyi használatához a Langfuse

2026. július 15.Forrás: Langfuse
Automatikus átvilágítási kaput épített az LLM-ek pénzügyi használatához a Langfuse
Kép: Langfuse

A Langfuse automatizált PASS/FAIL ellenőrzési folyamatot épített LLM-ek és AI-ügynökök pénzügyi alkalmazásaihoz. A rendszer tesztadatokon méri többek között a számszerű pontosságot, a forrásokra támaszkodást és a szabályozási megfelelést.

A lényeg röviden
  • A FinanceBench futás 81,3 százalékos számszerű pontossága nem érte el a 85 százalékos küszöböt.
  • A folyamat PASS vagy FAIL ítéletet ad LLM-ek és AI-ügynökök tesztelése után.
  • A rendszer három pénzügyi adathalmazt és többféle automatikus értékelőt használ.
  • A futások, pontszámok és promptverziók későbbi felülvizsgálatra is megmaradnak.
  • A szabályozói és jogi jóváhagyás továbbra is emberi feladat.

Egy hibás szám miatt bukott el a teszt

A Langfuse július 15-én bemutatott projektjének egyik tesztfutása egy 150 elemből álló FinanceBench adathalmazon zajlott Claude Sonnet használatával. A számszerű pontosság küszöbértékét 85 százalékban határozták meg, a futás azonban 81,3 százalékos eredményt ért el, ezért a rendszer piros jelzést adott és megbukott a kapun.

A cég szerint egy ilyen hibát még a bevezetés előtt könnyű kivizsgálni. Üzembe helyezés után viszont egy 10-K összefoglalójában szereplő téves szám már jelentendő incidenssé válhat a pénzügyi szolgáltatások területén.

Hetek helyett automatizált bizonyítékgyűjtés

A kezdeményezés egy, a világ öt legnagyobb bankja közé tartozó pénzintézettel végzett munka során indult. A bank kockázatkezelési folyamata már korábban is megkövetelte a gyártásba kerülés előtti teszteredményeket, jóváhagyásokat és dokumentációt. Ezek kézi előállítása azonban heteket vett igénybe.

A Langfuse szerint az LLM-alapú rendszerek gyorsabban változnak a hagyományos hitelmodelleknél. A promptok új verziói, a lecserélt modellek, valamint az eszközök és a keresési logika módosításai miatt egy kézi jóváhagyás idejére maga a vizsgált rendszer is megváltozhat.

Az ismertetett folyamat egy modellt prompttal, vagy egy teljes, több lépésből álló ügynököt futtat aranyalapú pénzügyi adathalmazokon. Az eredményeket szakterületi értékelők pontozzák, majd egy futásszintű kapu PASS vagy FAIL ítéletet ad. A futás, a nyomkövetés, a pontszámok és a promptverziók a Langfuse-ban maradnak, így egy felülvizsgáló később ellenőrizheti az alapul szolgáló bizonyítékokat.

Három adathalmaz és többféle értékelő

A pipeline három adathalmazt használ. A PatronusAI FinanceBench 150, az amerikai SEC-beadványokból származó pénzügyi kérdés-válasz párt tartalmaz, és a számszerű információk kinyerését, valamint az azokkal végzett következtetést vizsgálja. A ChanceFocus Financial PhraseBank nagyjából 4850 pénzügyi hírszövegen teszteli a hangulatelemzést. Az Advisory Adversarial nevű, a repositoryhoz mellékelt készlet 10 olyan ügyfélfrissítési briefet tartalmaz, amelyek tiltott megfogalmazások használatára csábíthatják a rendszert.

A tesztelt célpontok között modell és prompt kombinációja, valamint három regisztrált ügynök szerepel: 10k-analyst, sentiment-triage és advisory-draft. A determinisztikus ellenőrzések vizsgálják a számok pontosságát, a pontos egyezést, a hangulati címkét, a tiltott kifejezéseket és a válasz szerkezetét. A groundedness, vagyis a forrásokkal való megalapozottság mérésére egy bíróként használt nyelvi modell szolgál, amely a kérdést, a forrásbizonyítékot és a választ együtt értékeli.

A folyamat támogatja a felülvizsgálatot, de nem váltja ki

A Langfuse külön kiemeli, hogy a repository nevében szereplő „certification”, vagyis tanúsítás, csak belső elnevezés. A bemutatott rendszer átvilágítási kapu, amely felülvizsgálható bizonyítékot állít elő, de nem ad ki tanúsítványt.

A szabályozói jóváhagyás, a független validáció, a jogi ellenőrzés és a felelős emberi aláírás továbbra is az emberek feladata. A kisebb, 10 elemes mintafuttatások néhány perc alatt lefuthatnak, de a Langfuse szerint csak a teljes adathalmazon végzett futások számítanak felülvizsgálati bizonyítéknak. A megvalósítás kódja a langfuse-llm-certification-finance repositoryban érhető el.

Kapcsolódó hírek

AI-alapú megfigyelési platformot indított a Palo Alto Networks
Cégek és üzlet2026. október 1.

AI-alapú megfigyelési platformot indított a Palo Alto Networks

A Palo Alto Networks bemutatta a Cortex XCOR AI-alapú megfigyelési platformot, amely a vállalat szerint automatikusan képes az incidensek okának feltárására és a…

A Palo Alto Networks AI-natív megfigyelési platformot indított
Cégek és üzlet2026. október 1.

A Palo Alto Networks AI-natív megfigyelési platformot indított

A Palo Alto Networks bemutatta a Cortex XCOR nevű, AI-natív megfigyelési platformot, amely a vállalat szerint automatikus gyökérokelemzést és válaszlépéseket kínál. A…

Megjelent a Langfuse v4, gyorsabb értékeléssel és multimodális támogatással
Fejlesztőknek2026. augusztus 31.

Megjelent a Langfuse v4, gyorsabb értékeléssel és multimodális támogatással

A Langfuse kiadta a Langfuse v4-et, új értékelőbeállítási folyamatot vezetett be, és kép-, hang-, videó- és PDF-tartalmak elemzésére is alkalmassá tette az értékelőket.…