A Jev kiválthatja az LLM-es bírákat? Az MLflow tesztelte
A TypeSafe Jev modellje 30 MLflow-val kapcsolatos kérdés mindegyikén egyezett az emberi értékeléssel, miközben a tesztben ez volt a leggyorsabb és legolcsóbb bíró. A modell szöveges indoklást nem készít, csak strukturált döntést és valószínűséget ad.
- A Jev strukturált döntést és valószínűséget ad, szöveges indoklást nem.
- A 30 MLflow-példából mind a 30-ban egyezett az emberi értékeléssel.
- A tesztben a medián késleltetés 369 ezredmásodperc volt.
- A közzétett bemeneti ár 0,042 dollár egymillió tokenenként.
- Bizonytalan esetek másik modellhez vagy emberi ellenőrzésre irányíthatók.
Strukturált döntések szöveges válaszok helyett
Az MLflow szeptember 22-i bejegyzése szerint a nagy nyelvi modellek bíróként használhatók válaszok értékelésére, promptok összehasonlítására és visszaesések felismerésére. Minden ilyen ellenőrzés újabb modellhívást jelent, ezért nagyobb projektekben az értékelés költsége és időigénye is problémává válhat.
A TypeSafe Jev modellje más megközelítést alkalmaz. Nem szöveget generál tokenenként, hanem előre meghatározott lehetőségek közül ad strukturált kimenetet, döntési valószínűséggel együtt. A TypeSafe ezt System One modellként írja le, Daniel Kahneman gyors döntésekről szóló fogalmára utalva.
A Jev egyik kérdéstípusa, a Noul, például annak valószínűségét adja vissza, hogy egy válasz helyes-e. Ezt a program egy küszöbérték alapján megfelelt vagy nem megfelelő eredménnyé alakíthatja. A modell Choice segítségével kategóriát is választhat, a Score típussal pedig rendezett értékelési skálán osztályozhat.
Alacsony ár, de nincs szöveges indoklás
Az MLflow szerint sok értékelési feladatnál csak egy szűk döntést kell meghozni nagy mennyiségű bemenet alapján. Ilyen lehet annak megállapítása, hogy egy válasz a megfelelő API-t használja-e, figyelembe veszi-e a kérdésben szereplő verziót, vagy ellentmond-e a mellékelt dokumentációnak.
A Jev közzétett ára 0,042 dollár egymillió bemeneti tokenenként, a kimeneti tokenekért pedig nem számít fel díjat. A modell egy kérésben több, egymástól független kérdést is kezelhet ugyanahhoz az állapothoz kapcsolódóan.
A megoldás korlátja, hogy nem ad szöveges magyarázatot. A kimenetben a besorolás mellett valószínűség szerepel, így a felhasználó nem kapja meg, miért minősített hibásnak egy választ. Az MLflow ezért fejlesztés közbeni iterációhoz továbbra is szöveges választ adó modelleket tart megfelelőbbnek.
A Jev minden tesztpéldán egyezett az emberrel
Az MLflow 30, nyomkövetéssel, értékeléssel, promptokkal, adathalmazokkal és értékelésekkel kapcsolatos kérdés-válasz példát vizsgált. A példákat emberi értékelő címkézte, a végleges referencia pedig 15 helyes és 15 helytelen választ tartalmazott.
A Jev 1.13.0 mind a 30 esetben egyezett az emberi címkével. A medián késleltetés 369 ezredmásodperc, a 95. percentilis 411 ezredmásodperc, a becsült költség pedig 1000 értékelésenként 0,0247 dollár volt.
Összehasonlításként a GPT-5.6 Terra és Luna szintén 30/30-as eredményt ért el, 1091, illetve 947 ezredmásodperces medián késleltetéssel. Becsült költségük 1000 értékelésenként 0,8960, illetve 0,0896 dollár volt. A Claude Sonnet 4.6 27/30, az Opus 4.8 28/30, a DeepSeek-V4.1-Flash pedig 29/30 esetben egyezett az emberi címkével. A Claude modellek becsült költsége 1,6721, illetve 3,7750 dollár, a DeepSeeké pedig 0,0624 dollár volt, utóbbi csúcsidőn kívüli árazással.
Nagy léptékű ellenőrzéshez lehet hasznos
Az MLflow hangsúlyozza, hogy a 30 példás teszt eredménye önmagában nem elegendő a bevezetéshez. A használat előtt valódi válaszokat kell gyűjteni, és ellenőrizni kell az adott alkalmazás szempontjából fontos hibákat.
A Jev valószínűségi kimenete lehetővé teszi, hogy a bizonytalan eseteket egy másik értékelőhöz továbbítsák. A bináris Noul kérdés ugyanakkor nem tud tartózkodni. Ha erre szükség van, az MLflow szerint Choice kérdést kell használni külön bizonytalan opcióval, majd ezeket az eseteket másik bíróhoz vagy emberi felülvizsgálóhoz irányítani.
A forrás alapján a Jev fő előnye a nagy léptékű értékelésnél jelentkezhet, például online éles környezet figyelésénél, ahol a minőség, a költség és a késleltetés egyensúlya fontos. Ha a modell hibásnak jelöl egy választ, ugyanaz a vizsgálat később drágább nyelvi modellekkel is lefuttatható, hogy ember által olvasható indoklás készüljön.

