Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A LangSmithben is elérhető a Jev, az agentek új értékelője

2026. szeptember 30. 01:10Forrás: LangChain
A LangSmithben is elérhető a Jev, az agentek új értékelője
Kép: LangChain

A LangSmithben mostantól Jev is használható az agentek teljesítményének értékelésére. A TypeSafe AI rendszerét a LangChain gyors, olcsó és strukturált visszajelzésekhez szánt megoldásként mutatja be.

A lényeg röviden
  • A Jev mostantól értékelőként használható a LangSmithben.
  • A rendszer igen-nem valószínűségeket, választásokat és pontszámokat ad.
  • A TypeSafe AI szerint a Jev akár 450-szer olcsóbb és 200-szor gyorsabb lehet.
  • A LangChain tesztjében a Jev hívásonként átlagosan 0,44 másodperc alatt végzett.
  • A Jev külön visszajelzési kulcsokat hoz létre az egyes értékelési kérdésekhez.

Harmadik megközelítés az agentek értékelésére

Az agentek értékelésére eddig jellemzően két módszert használtak. A kódalapú ellenőrzések gyorsan és megbízhatóan vizsgálják az előre meghatározott feltételeket, például azt, hogy az agent meghívott-e egy eszközt, megfelel-e a kimenet egy mintának, vagy szerepel-e egy szükséges mező a válaszban. Ez a megközelítés ugyanakkor csak az előre pontosan leírható viselkedést tudja ellenőrizni.

Az LLM-as-a-judge értékelők ezzel szemben egy nyelvi modellre bízzák az agent nyomvonalának, vagyis a futás során létrejött állapotnak a vizsgálatát. A modell utasítások és értékelési szempontok alapján döntést hoz, ez azonban lassabb és drágább lehet, ráadásul ugyanarra a bemenetre eltérő eredményt adhat. A szabad szöveges indoklás strukturált eredménnyé alakítása szintén hibaforrást jelenthet.

A LangChain szerint a Jev egy harmadik típusú megoldást képvisel. A TypeSafe AI által System One modellként leírt rendszer nem hagyományos nyelvi modell, és nem szöveget generál. Egy állapothoz, például egy agent nyomvonalához vagy egyetlen üzenethez, típusos válaszokat és valószínűségeket ad.

Igen-nem kérdések, választások és pontszámok

A Jev háromféle kérdésre tud válaszolni. A „noul” egy igen vagy nem valószínűségét adja meg, a choice egy lehetőséget választ ki egy előre megadott listából, a score pedig egy rendezett skálán értékeli az állapotot. A válaszok eleve típusos formában érkeznek, így nincs szükség arra, hogy egy generált szöveget utólag strukturált eredménnyé alakítsanak.

A LangChain példaként a személyes adatok kiszivárgásának vizsgálatát, a felhasználói szándék meghatározását és a felhasználói frusztráció pontozását említi. Egy kérésben több kérdés is megadható, amelyeket a Jev párhuzamosan értékel.

A TypeSafe AI adatai szerint a Jev osztályozási feladatokon akár körülbelül 450-szer olcsóbb és 200-szor gyorsabb lehet az összehasonlított nyelvi modelleknél. A LangChain kiemeli, hogy az alacsonyabb költség lehetővé teheti minden nyomvonal értékelését mintavétel helyett, több szempont egyidejű vizsgálatát, valamint ugyanazon döntés ismételt ellenőrzését.

A gyorsaság különösen az online értékeléseknél számít, ahol a rendszer élő forgalmat vizsgál. A személyes adatok kiszivárgását, promptinjekciót vagy toxicitást jelző visszajelzési kulcsokhoz riasztás és webhookos automatizálás is beállítható a LangSmithben.

A LangChain tesztje és a használat módja

A LangChain a Jev-et GPT-5.6 Luna, GPT-5.6 Terra és Claude Sonnet 4.6 modellekkel hasonlította össze egy agent értékelésében. A vállalat közlése szerint a Jev minden döntésben egyezett az emberi értékelővel, miközben a nyelvi modellekhez képest 92 és 913 közötti faktorral alacsonyabb varianciát mutatott.

A Jev átlagosan 0,44 másodperc alatt végzett egy hívással. Az összehasonlított LLM-eknél ez 2,16 és 2,83 másodperc között volt. A teljes értékelési sorozat költsége a Jevnél 0,34 dollár lett, míg GPT-5.6 Luna esetében 0,39 dollár, GPT-5.6 Terra esetében 2,90 dollár, Claude Sonnet 4.6 használatával pedig 28,17 dollár. A LangChain hangsúlyozza, hogy ez egyetlen agenten végzett teszt volt.

A Jev használatához a LangSmithben TypeSafe API-kulcsot kell hozzáadni a Provider secrets beállításnál. Ezután egy tracing project Evaluators lapján új értékelő hozható létre. A szolgáltatónál a TypeSafe, modellként pedig a jev-latest választható ki. A felhasználó ezután meghatározza az értékelendő állapotot, majd minden vizsgált szempontnak külön kérdést ad meg.

A mentés után az értékelő a beérkező futásokat vagy szálakat pontozza, az egyes kérdések pedig külön visszajelzési kulcsként jelennek meg. Ezekre a LangSmithben szűrés, diagramok, riasztások és automatizálások is építhetők. A LangChain szerint a Jev akkor illeszkedik leginkább a feladathoz, ha nagy mennyiségben kell szűk, típusos döntéseket meghozni. Olyan esetekben, amikor az értékeléshez írásos indoklás is szükséges, továbbra is az LLM-as-a-judge megoldások lehetnek megfelelőbbek.

Kapcsolódó hírek

A LangChain modellirányítóval 64 százalékkal csökkentette a költséget
Fejlesztőknek2026. október 2. 15:31

A LangChain modellirányítóval 64 százalékkal csökkentette a költséget

A LangChain modellirányítót épített nyílt forráskódú Open SWE kódoló ügynökébe, amely a feladat összetettsége alapján választ a modellek között. A vállalat kísérleteiben…

A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője
Fejlesztőknek2026. szeptember 30. 01:10

A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője

A LangSmithben mostantól Jev-alapú értékelő is használható az AI-ügynökök működésének vizsgálatára. A TypeSafe System One modellje strukturált válaszokat ad, és a…

A LangChain szerint a Jev pontosabb és olcsóbb agentértékelő lehet
Fejlesztőknek2026. szeptember 21. 17:29

A LangChain szerint a Jev pontosabb és olcsóbb agentértékelő lehet

A LangChain tesztje szerint a TypeSafe AI Jev modellje stabilabb eredményeket adott agentek értékelésekor, mint a vizsgált nagy nyelvi modellek. A rendszer 0,44…