A Jev gyorsabban és olcsóbban értékelte a kódoló ügynök lépéseit

A TypeSafe AI Jev modellje gyorsabban és alacsonyabb becsült költséggel értékelte egy kódoló ügynök parancsainak kockázatát, mint a tesztben használt két általános célú nyelvi modell. A Jev strukturált eredményeket és valószínűségeket adott, de írásos indoklást nem.
- A Jev medián válaszideje 237 ezredmásodperc volt.
- A tesztben 31 Bash-parancs kockázatát értékelték.
- A Jev becsült költsége körülbelül 0,0016 dollár volt.
- A Jev nem adott írásos indoklást, csak besorolást és valószínűségeket.
- A három bíró 20 parancs értékelésében egyezett meg.
31 parancson hasonlították össze a bírákat
A Fiddler AI szeptember 30-án közzétett elemzésében azt vizsgálta, hogyan teljesít a Jev döntésekre optimalizált megközelítése a kódoló ügynökök műveleteinek értékelésében. A vállalat tizenkét feladatot adott egy kódoló ügynöknek eldobható tesztkörnyezetekben, majd rögzítette a választott parancsokat és azok eredményét.
A vizsgálathoz 31 Bash-hívást választottak ki. Mindegyik parancsot és a hozzá tartozó eredményt három bíró értékelte ugyanazon kockázati besorolási szabályok alapján. A Jev mellett a Gemini 3.5 Flash-Lite és a GPT-5.4 nano kapott szerepet. A két általános célú modellt a legalacsonyabb gondolkodási szintre állították, hogy a válaszköltség és a késleltetés összehasonlíthatóbb legyen.
A Fiddler AI hangsúlyozza, hogy nem állt rendelkezésre függetlenül meghatározott helyes besorolás. Az egyezés ezért csak azt mutatja meg, hol jutottak azonos döntésre a bírák, azt nem, hogy melyikük ítélete volt helyes.
A Jev medián válaszideje 237 ezredmásodperc volt
A 31 parancs mindegyikét egyszer értékelték. A Jev medián válaszideje 237 ezredmásodperc volt, míg a Gemini 3.5 Flash-Lite 898, a GPT-5.4 nano pedig 1106 ezredmásodperc alatt válaszolt. A Jev kockázati szintet és valószínűségeket adott, a két LLM ezen felül írásos indoklást is készített, ezért az összevetés nem azonos tartalmú válaszokra épült.
A Jev 18 alacsony, 7 közepes és 6 magas kockázatú parancsot jelölt, kritikus besorolást egyszer sem adott. A Gemini 22 alacsony, 4 közepes és 5 magas kockázatú eredményt hozott, a GPT-5.4 nano pedig 14 alacsony, 10 közepes és 7 magas kockázatú értékelést adott.
Mindhárom bíró 20 parancsnál értett egyet. Nyolc esetben kettőjük eredménye egyezett, három parancsnál pedig mindhárom különböző kockázati szintet választott. A bírák összesen 11 parancsnál tértek el egymástól.
Alacsonyabb becsült költség, kevesebb magyarázat
A Fiddler AI számítása szerint a Jev 31 hívásának becsült költsége körülbelül 0,0016 dollár volt. A Gemini 3.5 Flash-Lite esetében a szolgáltató által jelzett költség 0,01261760 dollár, a GPT-5.4 nano esetében pedig 0,00813785 dollár volt. A Jev becslése 38 315 bemeneti tokenre és egymillió tokenenként 0,042 dolláros díjra épült, a kimeneti tokenekért a TypeSafe díjszabása szerint nem kellett fizetni. A Fiddler AI szerint ez nagyjából 7,8-szor alacsonyabb költség a Gemininél és 5,1-szer alacsonyabb a GPT-5.4 nanónál.
A vállalat ugyanakkor azt írja, hogy a Jev-hívásokért ténylegesen nem figyeltek meg fizetett számlát, mert a Vercel Gateway promóciója ingyenessé tette ezeket. Az árak változhatnak, és a generatív bírák indoklást is készítettek, így a költségadatok nem tekinthetők teljesen azonos értékű összehasonlításnak.
A Jev egyik korlátja, hogy nem közli, az értékeléshez a bizonyíték mely részleteit használta fel. Meglepő vagy következményekkel járó besorolásnál ezért a felülvizsgálónak vissza kell térnie az eredeti nyomvonalhoz. A modell csak előre meghatározott lehetőségek közül választhat, ezért a Fiddler AI szerint célszerű olyan opciókat is megadni, mint a „felülvizsgálat szükséges” vagy az „egyik sem”.
A végső értékeléshez emberi felülvizsgálat kell
A Fiddler AI szerint az emberi felülvizsgálók feladata eldönteni, hogy egy adott kockázati besorolás megfelel-e a szervezet szabályzatának. Egy szervezet saját szabályai szerint címkézett referencia-adatkészlete azt is lehetővé tenné, hogy az értékeléseket a várt döntésekkel hasonlítsák össze, majd szükség esetén pontosítsák az utasításokat és a felülvizsgálati küszöböket.
A vállalat a Jev 1.13 útmutatására hivatkozva arra is figyelmeztet, hogy a modell szó szerint értelmezheti a kérdéseket, illetve elterelhetik a figyelmét a lényegtelen részletek. A teszt tanulsága ezért a felhasználók számára kettős: a Jev gyors és strukturált előszűrést adhat a kódoló ügynökök műveleteihez, a fontos vagy vitatott esetek megítéléséhez azonban továbbra is szükség van az eredeti bizonyítékok vizsgálatára és emberi döntésre.
Fiddler AI: Testing Jev for Coding Agent Evals: Comparing Speed, Cost, and Rationale


