A LangChain szerint a Jev pontosabb és olcsóbb agentértékelő lehet

A LangChain tesztje szerint a TypeSafe AI Jev modellje stabilabb eredményeket adott agentek értékelésekor, mint a vizsgált nagy nyelvi modellek. A rendszer 0,44 másodperces átlagos válaszidővel és hívásonként 0,00035 dolláros költséggel működött.
- A Jev strukturált döntéseket és valószínűségeket ad vissza szöveggenerálás helyett.
- A tesztben a Jev mind az 500 bináris döntésnél egyezett az emberi értékeléssel.
- A Jev pontszámainak varianciája 92 és 913-szor alacsonyabb volt a vizsgált modellekénél.
- A modell átlagosan 0,44 másodperc alatt és hívásonként 0,00035 dollárért válaszolt.
- A LangChain szerint az eredmények ígéretesek, de a vizsgálat korai és szűk körű.
A Jev nem szöveget generál
A LangChain szeptember 21-én közzétett elemzése szerint a Jev az agentek értékelésének egy új megközelítését képviselheti. A modellt a TypeSafe AI fejlesztette, és a hagyományos nagy nyelvi modellektől eltérően nem szöveges választ állít elő.
A TypeSafe AI ezt a modelltípust „System One” modellnek nevezi. Ezek a rendszerek strukturált döntések gyors meghozatalára készülnek, az eredményt pedig közvetlenül felhasználható, típusos válaszok és valószínűségek formájában adják vissza. A TypeSafe AI szerint a Jev osztályozási feladatokban akár 200-szor gyorsabb következtetést és 400-szor alacsonyabb költséget kínálhat az összehasonlítható modellekhez képest.
Háromféle kérdésre ad értékelést
A Jev három kérdéstípust támogat. A Choice egy lehetőség kiválasztására szolgál, például annak eldöntésére, hogy egy agent megfelelően keresett-e, szükségtelenül keresett-e, vagy nem keresett. A Score egy rendezett értékelési skálán pontoz, például 1-től 5-ig mérheti, mennyire volt hasznos a válasz.
A Noul egy igen vagy nem jellegű döntés valószínűségét adja vissza 0,0 és 1,0 közötti értékként. Ezzel például mérhető, hogy a végső válasz mennyire támaszkodik a lekért bizonyítékokra. Több elemi kérdés párhuzamosan is kiértékelhető ugyanazon állapot alapján.
A LangChain szerint az agentek értékelése jelenleg jellemzően kódalapú ellenőrzéssel vagy LLM-as-a-judge módszerrel történik. A kódalapú megoldások gyorsak, olcsók és megbízhatók, de nehezen kezelik az agentek nyitott végű, változatos viselkedését. A nagy nyelvi modellek rugalmasabban vizsgálhatják a teljes futási nyomot, viszont lassabbak, drágábbak és nem determinisztikusak lehetnek.
A tesztben a Jev kevesebbet ingadozott
A LangChain egy Deep Agents segítségével létrehozott időjárási agentet vizsgált. A tesztkészlet öt időjárási kérést tartalmazott, az agent rögzített válaszait pedig ugyanazon adatok alapján értékelte a Jev, a GPT-5.6 Luna, a GPT-5.6 Terra és a Claude Sonnet 4.6. Minden modellt 100 ismétlésben hasonlítottak össze, az eredményeket pedig emberi értékelők címkéihez viszonyították.
A bináris megfelelt vagy nem felelt meg döntésben a Jev mind az 500 ismételt döntése egyezett az emberi értékeléssel. A Terra 99,8, a Luna 96,4, a Claude pedig 80,0 százalékos egyezést ért el.
A minőségi pontszámok változása szintén a Jevnél volt a legalacsonyabb. Az egy esetre jutó megfigyelt átlagos variancia 0,0000149 volt. A Luna értéke 433-szor, a Terra értéke 913-szor, a Claude-é pedig 92-szer magasabbnak bizonyult. A LangChain hangsúlyozza, hogy a teszt nem bizonyítja, mi okozta az eltérést, és a vizsgálat szűk körű volt.
Olcsóbban futhatnak a gyakori ellenőrzések
A kísérletben a Jev hívásonként 0,00035 dollárba került, a teljes költség 0,34 dollár volt. Összehasonlításként a Claude teljes költsége 28,17 dollárra rúgott. A Jev átlagos válaszideje 0,44 másodperc volt, a LangChain szerint ez a vizsgált értékelők között a leggyorsabb eredmény.
Az alacsonyabb költség és a kisebb ingadozás lehetővé teheti, hogy a fejlesztőcsapatok több ismételt tesztet és gyakoribb regressziós ellenőrzést futtassanak. A LangChain szerint ez a termelési környezetben végzett értékeléseknél is fontos lehet, mivel több agentfutásról gyűjthető visszajelzés, és hamarabb észlelhetők a minőség változásai. A vállalat ugyanakkor korai eredményként írja le a tesztet, amely egyelőre egy szűk feladatra korlátozódott.
LangChain: Can Jev Be a Better Agent Evaluator?


