Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A LangChain szerint a Jev pontosabb és olcsóbb agentértékelő lehet

2026. szeptember 21.Forrás: LangChain
A LangChain szerint a Jev pontosabb és olcsóbb agentértékelő lehet
Kép: LangChain

A LangChain tesztje szerint a TypeSafe AI Jev modellje stabilabb eredményeket adott agentek értékelésekor, mint a vizsgált nagy nyelvi modellek. A rendszer 0,44 másodperces átlagos válaszidővel és hívásonként 0,00035 dolláros költséggel működött.

A lényeg röviden
  • A Jev strukturált döntéseket és valószínűségeket ad vissza szöveggenerálás helyett.
  • A tesztben a Jev mind az 500 bináris döntésnél egyezett az emberi értékeléssel.
  • A Jev pontszámainak varianciája 92 és 913-szor alacsonyabb volt a vizsgált modellekénél.
  • A modell átlagosan 0,44 másodperc alatt és hívásonként 0,00035 dollárért válaszolt.
  • A LangChain szerint az eredmények ígéretesek, de a vizsgálat korai és szűk körű.

A Jev nem szöveget generál

A LangChain szeptember 21-én közzétett elemzése szerint a Jev az agentek értékelésének egy új megközelítését képviselheti. A modellt a TypeSafe AI fejlesztette, és a hagyományos nagy nyelvi modellektől eltérően nem szöveges választ állít elő.

A TypeSafe AI ezt a modelltípust „System One” modellnek nevezi. Ezek a rendszerek strukturált döntések gyors meghozatalára készülnek, az eredményt pedig közvetlenül felhasználható, típusos válaszok és valószínűségek formájában adják vissza. A TypeSafe AI szerint a Jev osztályozási feladatokban akár 200-szor gyorsabb következtetést és 400-szor alacsonyabb költséget kínálhat az összehasonlítható modellekhez képest.

Háromféle kérdésre ad értékelést

A Jev három kérdéstípust támogat. A Choice egy lehetőség kiválasztására szolgál, például annak eldöntésére, hogy egy agent megfelelően keresett-e, szükségtelenül keresett-e, vagy nem keresett. A Score egy rendezett értékelési skálán pontoz, például 1-től 5-ig mérheti, mennyire volt hasznos a válasz.

A Noul egy igen vagy nem jellegű döntés valószínűségét adja vissza 0,0 és 1,0 közötti értékként. Ezzel például mérhető, hogy a végső válasz mennyire támaszkodik a lekért bizonyítékokra. Több elemi kérdés párhuzamosan is kiértékelhető ugyanazon állapot alapján.

A LangChain szerint az agentek értékelése jelenleg jellemzően kódalapú ellenőrzéssel vagy LLM-as-a-judge módszerrel történik. A kódalapú megoldások gyorsak, olcsók és megbízhatók, de nehezen kezelik az agentek nyitott végű, változatos viselkedését. A nagy nyelvi modellek rugalmasabban vizsgálhatják a teljes futási nyomot, viszont lassabbak, drágábbak és nem determinisztikusak lehetnek.

A tesztben a Jev kevesebbet ingadozott

A LangChain egy Deep Agents segítségével létrehozott időjárási agentet vizsgált. A tesztkészlet öt időjárási kérést tartalmazott, az agent rögzített válaszait pedig ugyanazon adatok alapján értékelte a Jev, a GPT-5.6 Luna, a GPT-5.6 Terra és a Claude Sonnet 4.6. Minden modellt 100 ismétlésben hasonlítottak össze, az eredményeket pedig emberi értékelők címkéihez viszonyították.

A bináris megfelelt vagy nem felelt meg döntésben a Jev mind az 500 ismételt döntése egyezett az emberi értékeléssel. A Terra 99,8, a Luna 96,4, a Claude pedig 80,0 százalékos egyezést ért el.

A minőségi pontszámok változása szintén a Jevnél volt a legalacsonyabb. Az egy esetre jutó megfigyelt átlagos variancia 0,0000149 volt. A Luna értéke 433-szor, a Terra értéke 913-szor, a Claude-é pedig 92-szer magasabbnak bizonyult. A LangChain hangsúlyozza, hogy a teszt nem bizonyítja, mi okozta az eltérést, és a vizsgálat szűk körű volt.

Olcsóbban futhatnak a gyakori ellenőrzések

A kísérletben a Jev hívásonként 0,00035 dollárba került, a teljes költség 0,34 dollár volt. Összehasonlításként a Claude teljes költsége 28,17 dollárra rúgott. A Jev átlagos válaszideje 0,44 másodperc volt, a LangChain szerint ez a vizsgált értékelők között a leggyorsabb eredmény.

Az alacsonyabb költség és a kisebb ingadozás lehetővé teheti, hogy a fejlesztőcsapatok több ismételt tesztet és gyakoribb regressziós ellenőrzést futtassanak. A LangChain szerint ez a termelési környezetben végzett értékeléseknél is fontos lehet, mivel több agentfutásról gyűjthető visszajelzés, és hamarabb észlelhetők a minőség változásai. A vállalat ugyanakkor korai eredményként írja le a tesztet, amely egyelőre egy szűk feladatra korlátozódott.

Kapcsolódó hírek

Jev: gyors, strukturált döntéseket hozó modell érkezett az ügynökökhöz
Modellek2026. október 1.

Jev: gyors, strukturált döntéseket hozó modell érkezett az ügynökökhöz

A TypeSafe AI Jev nevű modellje gyors, strukturált döntésekkel egészítheti ki az AI-ügynökök működését. A LangChain szerint a Jev osztályozási feladatokon akár 200-szor…

A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője
Fejlesztőknek2026. szeptember 29.

A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője

A LangSmithben mostantól Jev-alapú értékelő is használható az AI-ügynökök működésének vizsgálatára. A TypeSafe System One modellje strukturált válaszokat ad, és a…

A LangSmithben is elérhető a Jev, az agentek új értékelője
Fejlesztőknek2026. szeptember 29.

A LangSmithben is elérhető a Jev, az agentek új értékelője

A LangSmithben mostantól Jev is használható az agentek teljesítményének értékelésére. A TypeSafe AI rendszerét a LangChain gyors, olcsó és strukturált visszajelzésekhez…