Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Jev valószínűségei olyan hibákat is jeleznek, amelyeket az LLM-ek elrejtenek

2026. szeptember 28. 19:28Forrás: Arize AI
A Jev valószínűségei olyan hibákat is jeleznek, amelyeket az LLM-ek elrejtenek
Kép: Arize AI

A Jev címkénkénti valószínűségei megbízhatóan jelezték, mikor tévedett az értékelésben, miközben az ismételten futtatott nyelvi modellek sok hibás döntésnél változatlanok maradtak. Az Arize 36 190 döntésen vizsgálta a módszert.

A lényeg röviden
  • A Jev 36 190 döntésen adott valószínűséget a címkéihez.
  • A hibás Jev-döntések medián valószínűsége 0,71 volt.
  • A legalább 99 százalékos valószínűségű 3561 döntés mind helyesnek bizonyult.
  • A Jev drop-in beállításban az esetek 0,97 százalékában változtatott címkét.
  • A 0,5 bites küszöb a példák 11 százalékát jelölte emberi ellenőrzésre.

A Jev egyetlen futtatásból is bizonytalanságot mutat

Az Arize szeptember 28-án közzétett vizsgálata szerint a Jev természetes nyelvű bemenetet dolgoz fel, de szöveg generálása helyett minden címkéhez valószínűséget ad vissza. Ez azért fontos, mert a legtöbb nagy nyelvi modellre épülő értékelő, vagyis LLM-bíró, a gyakorlatban osztályozóként működik: a válaszokat előre meghatározott címkékhez kell igazítani.

A kutatásban öt LLM-et és a Jev két változatát futtatták a Phoenix tíz értékelőjéhez tartozó benchmarkokon, egyenként tízszer. A teszt összesen 36 190 döntést tartalmazott. A Phoenix minden beépített értékelőjéhez ember által címkézett adatsort tart fenn, ezekben együtt 517 példa szerepelt. A feladatok között volt a helyesség, a személyes adatok felismerése, a teljesség, az eszközhasználat, a visszakeresés relevanciája, a hallucináció, az elutasítás és a tömörség vizsgálata.

A Jev ritkábban változtatta meg a címkéit

A Jev drop-in beállításban az esetek 0,97 százalékában változtatta meg a címkét a tíz futtatás valamelyikén, natív API-használat mellett pedig 0,19 százalékban. Ez volt a legalacsonyabb arány a vizsgált bírók között. A Jev nem teljesen determinisztikus, a valószínűségei kissé elmozdulhatnak, de ezek a változások ritkán módosították a végső címkét.

A Jev átlagos pontossága mindkét beállításban 98,3 százalék volt, és az Arize szerint a feladatonkénti különbségek egyike sem bizonyult jelentősnek. A natív használat legnagyobb javulása a teljességet vizsgáló feladaton jelentkezett, 7,1 százalékponttal. Ez a feladat átlagosan mintegy 1950 token hosszúságú beszélgetéseket ellenőrzött.

A teljes mérés költsége 169,84 dollár volt, ebből a Jev részesedése 64 centet tett ki. Az összehasonlításban szereplő LLM-bírók címkéket adtak vissza, címkénkénti valószínűségeket viszont nem.

A valószínűség a hibás döntések kiszűrésében is segíthet

A drop-in Jev helyes döntéseinél a kiválasztott címke medián valószínűsége 1,00 volt, a hibás döntéseknél viszont 0,71. A legalább 99 százalékos valószínűséggel meghozott 3561 döntés mind helyesnek bizonyult. A 70 százalék alatti értékeknél a Jev az esetek 73 százalékában adott helyes választ.

A saját hibák felismerésére a Jev ROC AUC értéke drop-in módban 0,95, natív használat mellett 0,99 volt. Az LLM-ek ismételt válaszai alapján számított bizonytalanság értékei 0,62 és 0,84 közötti ROC AUC-t értek el. Az Arize szerint az LLM-ek hibáinak 27 és 75 százaléka ismételt futtatások során egyáltalán nem változott, így ez a módszer ezeket nem tudta volna jelezni.

A Jev entrópiája az emberi ellenőrzésre váró példák kijelölésében is hasznosnak bizonyult. A közel biztos Jev-döntések mellett az LLM-ek 3 százalékban ingadoztak, a majdnem pénzfeldobásnyi bizonytalanságú példáknál viszont 71 százalékban. Az Arize szerint egy 0,5 bites küszöb a példák 11 százalékát jelöli ki, ezeknél az LLM-ek csaknem kétharmadukban változtatták a válaszukat.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása
Kutatás2026. október 2. 20:01

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása

A promptok gyorsítótárazása csökkentheti az ismétlődő bemenetek feldolgozásának költségét, de az Arize AI tesztje szerint a magas cache újraolvasási arány önmagában nem…

Jev-as-a-Judge értékelés érkezett az Arize AX platformra
Termékek és eszközök2026. szeptember 28. 23:00

Jev-as-a-Judge értékelés érkezett az Arize AX platformra

Az Arize AX közvetlenül integrálta a TypeSafe AI Jev döntési modelljét, így a csapatok natív módon értékelhetik a gyártási nyomokat. A Jev-as-a-Judge strukturált…

Az Arize AX közvetlenül támogatja a Jev-as-a-Judge értékeléseket
Termékek és eszközök2026. szeptember 28. 23:00

Az Arize AX közvetlenül támogatja a Jev-as-a-Judge értékeléseket

Az Arize AX natív integrációt kapott a TypeSafe AI Jev rendszerével, így a csapatok közvetlenül a platformon értékelhetik a gyártásból származó nyomkövetéseket. A Jev…