A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője

A LangSmithben mostantól Jev-alapú értékelő is használható az AI-ügynökök működésének vizsgálatára. A TypeSafe System One modellje strukturált válaszokat ad, és a LangChain szerint alkalmas lehet nagy mennyiségű futás gyors, olcsó elemzésére.
- A Jev elérhetővé vált a LangSmith Evals értékelőjeként.
- A System One modell típusos válaszokat és valószínűségeket ad.
- A TypeSafe szerint a Jev akár 450-szer olcsóbb és 200-szor gyorsabb lehet.
- A tesztben a Jev 0,44 másodperces átlagos hívási időt ért el.
- A Jev több kérdést párhuzamosan értékel ugyanazon ügynökfutáson.
Harmadik megközelítés az ügynökök tesztelésére
A LangChain 2026. szeptember 21-én közzétett bejelentése szerint a Jev elérhetővé vált a LangSmith Evals részeként. A szolgáltatásban az ügynökök futásait, úgynevezett nyomait (trace), lehet értékelni, majd az eredményeket strukturált visszajelzésként követni.
Az ügynökök értékelésére eddig két fő módszer terjedt el. A kódalapú ellenőrzések gyorsak és megbízhatóak, de csak előre pontosan meghatározható feltételeket tudnak vizsgálni. Ilyen lehet például, hogy az ügynök meghívott-e egy eszközt, megfelel-e a kimenet egy mintának, vagy szerepel-e egy szükséges mező.
Az LLM-alapú bírók rugalmasabban kezelik a nyitott végű feladatokat. Egy nyelvi modell megkapja az ügynök futását, az értékelési szempontokat és az osztályozási szabályokat, majd ítéletet hoz. A LangChain szerint ezek a megoldások lassabbak és drágábbak, ráadásul ugyanarra a bemenetre eltérő eredményt adhatnak. A szabad szöveges indoklás strukturált adattá alakítása szintén hibaforrás lehet.
A Jev strukturált válaszokat ad
A Jev nem hagyományos nagy nyelvi modell, és nem szöveggenerálásra szolgál. A TypeSafe AI meghatározása szerint System One modell, amely gyors, strukturált döntéseket hoz, közvetlenül felhasználható típusos válaszokkal és valószínűségekkel.
Az értékelés állapota lehet egy ügynök teljes futása, egyetlen üzenet vagy más vizsgálandó kontextus. A kérdések határozzák meg, milyen szempontok alapján kell dönteni. A Jev háromféle kérdésre tud válaszolni: a noul igen vagy nem valószínűségét adja meg, a choice egy lehetőséget választ a felsorolt opciók közül, a score pedig rendezett skálán értékeli az állapotot.
A LangChain a használati példák között említi a személyes adatok kiszivárgásának felismerését, a felhasználói szándék azonosítását és a felhasználói frusztráció pontozását. Mivel minden válasz eleve típusos, nincs szükség arra, hogy egy szöveges modell kimenetét utólag strukturált formára alakítsák.
A TypeSafe szerint a Jev osztályozási feladatokban akár nagyjából 450-szer olcsóbb és 200-szor gyorsabb lehet az összehasonlított nyelvi modelleknél. Több kérdést párhuzamosan dolgoz fel, ezért ugyanazon futás több szempontú értékelése csak csekély többletköltséggel jár.
A tesztben gyorsabb és olcsóbb volt a bírómodelleknél
A LangChain a Jev-as-a-Judge for Agent Evals tesztben a Jevet a GPT-5.6 Luna, a GPT-5.6 Terra és a Claude Sonnet 4.6 modellekkel vetette össze. A vizsgálatban a Jev pontosabbnak és jelentősen következetesebbnek bizonyult, miközben gyorsabb és olcsóbb volt az összehasonlított LLM-bíróknál.
A vállalat közlése szerint a Jev minden döntésben megegyezett az emberi értékelővel, a varianciája pedig 92 és 913-szor kisebb volt az LLM-bírókénál. Egy hívás átlagos ideje 0,44 másodperc volt, szemben a nyelvi modellek 2,16 és 2,83 másodperc közötti eredményével.
A Jev hívásonként 0,00035 dollárba került, így a teljes tesztelési sorozat 0,34 dollárból jött ki. Ugyanez GPT-5.6 Lunával 0,39 dollár, GPT-5.6 Terrával 2,90 dollár, Claude Sonnet 4.6-tal pedig 28,17 dollár volt. A LangChain hangsúlyozza, hogy ez egyetlen ügynökön végzett vizsgálat volt.
Beállítás a LangSmithben
A Jev használatához a LangSmithben TypeSafe szolgáltatói kulcsot kell hozzáadni a Settings, Provider secrets menüpontban, a TYPESAFE_API_KEY mezőben. Ezután egy tracing project Evaluators lapján új értékelő hozható létre.
A beállításnál a TypeSafe szolgáltatót és a jev-latest modellt kell kiválasztani. A felhasználó ezután megadja az állapotot, vagyis azt a futás- vagy szálváltozókból összeállított kontextust, amelyet a Jev vizsgál. Az értékelési utasítások helyett külön kérdések kerülnek a Feedback Configuration részbe, és mindegyik kérdés saját visszajelzési kulcsot kap.
A mentés után az értékelő a beérkező futásokat vagy szálakat pontozza. Az eredmények szűrhetők, diagramokon megjeleníthetők, illetve riasztások és automatizmusok is beállíthatók rájuk. A megoldás így különösen a nagy mennyiségű, online forgalom folyamatos ellenőrzésére használható, például személyes adatok kiszivárgásának, promptinjektálásnak vagy toxicitásnak a jelzésére. A LangChain szerint a Jev nem váltja ki az LLM-bírókat, mivel az írásos indoklást igénylő, nyitott értékelésekhez továbbra is azok lehetnek megfelelőbbek.
LangChain: Jev is now available in LangSmith Evals


