A Jev gyorsabban és olcsóbban értékelte a kódoló ügynök kockázatait

A TypeSafe AI Jev modellje gyorsabban és alacsonyabb becsült költséggel adott strukturált kockázati értékeléseket, mint a Fiddler AI által vizsgált két általános célú nyelvi modell. A teszt ugyanakkor azt is megmutatta, hogy az indoklás hiánya megnehezítheti a meglepő vagy vitatott döntések kivizsgálását.
- A Jev medián válaszideje 237 ezredmásodperc volt.
- A Jev becsült költsége 31 hívásra körülbelül 0,0016 dollár lett.
- A három értékelő 11 parancsnál nem értett egyet.
- A Jev valószínűségeket ad, de írásos indoklást nem közöl.
- A Fiddler AI szerint emberi bírálók és újratesztelés is szükséges.
Kódolóügynökök műveleteit vizsgálták
A Fiddler AI szeptember 30-án közzétett elemzésében azt vizsgálta, hogyan teljesít a Jev a kódolóügynökök által végrehajtott műveletek kockázatainak értékelésében. Egy ilyen ügynök fájlokat vizsgálhat, teszteket futtathat, kódot módosíthat és parancsokat hajthat végre. A végső válaszából nem feltétlenül derül ki minden lépés, a rögzített eszközhívásokból azonban látható, milyen műveleteket próbált végrehajtani.
A vizsgálathoz egy kódolóügynök tizenkét feladatot kapott eldobható tesztkörnyezetekben. A kutatók rögzítették az ügynök által választott parancsokat, majd ezek közül 31 Bash-hívást, a hozzájuk tartozó eredménnyel együtt, három értékelőnek adtak át. Mindegyik ugyanazt a kockázati rubrikát és utasítást kapta, a lehetséges besorolások pedig az alacsony, közepes, magas és kritikus szintek voltak.
A Jev mellett a Gemini 3.5 Flash-Lite és a GPT-5.4 nano kapott szerepet. A Geminit a Vertexen, a GPT-modellt az OpenAI szolgáltatásán keresztül használták. Mindkét általános célú modellt a legalacsonyabb gondolkodási szinten állították be, hogy a késleltetés és a költség összehasonlítása során hasonlóbb legyen a kimeneti tokenhasználat.
A Jev gyorsabb volt a tesztben
A 31 parancs mindegyikét egyszer értékelte minden bíró. A Jev medián válaszideje 237 ezredmásodperc volt, szemben a Gemini 3.5 Flash-Lite 898 ezredmásodpercével és a GPT-5.4 nano 1106 ezredmásodpercével. A különbség értelmezésénél fontos, hogy a Jev kockázati besorolást és valószínűségeket adott, míg a két nyelvi modell írásos indoklást is készített.
A Jev 18 műveletet alacsony, 7-et közepes, 6-ot magas és egyet sem kritikus kockázatúnak minősített. A Gemini eredménye 22 alacsony, 4 közepes, 5 magas és 0 kritikus besorolás lett. A GPT-5.4 nano 14 alacsony, 10 közepes, 7 magas és 0 kritikus értékelést adott.
Mindhárom bíró 20 parancsnál azonos döntést hozott. További 8 esetben kettő értékelő egyezett, egy pedig eltért, 3 parancsnál pedig mindhárom modell másik kockázati szintet választott. A bírák összesen 11 esetben nem értettek egyet. A Fiddler AI hangsúlyozza, hogy a tesztben nem állt rendelkezésre függetlenül meghatározott helyes besorolás, ezért az egyezés önmagában nem mutatja meg, melyik értékelő döntött helyesen.
Alacsonyabb becsült költség, kevesebb magyarázat
A 31 hívásra a Jev költségét körülbelül 0,0016 dollárra becsülték a TypeSafe közzétett díjszabása alapján. A számítás 38 315 bemeneti tokennel és egymillió tokenenként 0,042 dolláros árral készült, a kimeneti tokenekért pedig nem számoltak fel díjat. A Gemini 3.5 Flash-Lite szolgáltatói jelentés alapján 0,01261760 dollárba, a GPT-5.4 nano 0,00813785 dollárba került.
Ez a Jev becslése szerint nagyjából 7,8-szor alacsonyabb költség a Gemininél és 5,1-szer alacsonyabb a GPT-modellnél. A Fiddler AI ugyanakkor jelzi, hogy a Jev-hívásokért ténylegesen nem figyeltek meg fizetett számlát, mert a Vercel Gateway promóciója miatt ezek a kérések ingyenesek voltak. Az összevetés ezért becsült és megfigyelt költségeket hasonlít össze, ráadásul a két nyelvi modell írásos indoklást is készített.
A Jev strukturált Choice-választ és valószínűségeket ad, amelyeket az alkalmazás például a felülvizsgálatra váró esetek sorba rendezésére használhat. Nem közöl azonban írásos indoklást. Egy meglepő vagy jelentős következményekkel járó besorolásnál így a bírálónak az eredeti bizonyítékokat kell megvizsgálnia. A Jev csak az előre megadott lehetőségek közül választhat, ezért a Fiddler AI szerint indokolt lehet olyan opciókat is felvenni, mint a „felülvizsgálat szükséges” vagy az „egyik sem”.
A végső döntéshez emberi ellenőrzés kell
A Fiddler AI szerint emberi bírálókra van szükség annak eldöntéséhez, hogy egy adott értékelés megfelel-e a szervezet kockázati szabályainak. Egy szervezeti szabályzathoz igazított, felcímkézett referencia-adatkészlet segítségével össze lehetne vetni az értékelő eredményeit az elvárt döntésekkel, majd pontosítani lehetne az utasításokat és a felülvizsgálati küszöböket.
A vállalat arra is figyelmeztet, hogy egy értékelő beállításainak módosítása vagy újabb modellre váltás után a teljes értékelési folyamatot újra kell tesztelni. A korábbi eredmények nem vehetők automatikusan érvényesnek az új konfiguráció mellett. A Jev döntésközpontú, strukturált működése a gyors előszűrésben lehet hasznos, az indoklás hiánya viszont olyan helyzetekben jelent korlátot, amikor a döntés hátterét is ellenőrizni kell.
Fiddler AI: Testing Jev for Coding Agent Evals: Comparing Speed, Cost, and Rationale


