Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Jev kiválthatja az LLM-es bírákat? Az MLflow tesztelte

2026. szeptember 22.Forrás: MLflow

A TypeSafe Jev modellje 30 MLflow-val kapcsolatos kérdés mindegyikén egyezett az emberi értékeléssel, miközben a tesztben ez volt a leggyorsabb és legolcsóbb bíró. A modell szöveges indoklást nem készít, csak strukturált döntést és valószínűséget ad.

A lényeg röviden
  • A Jev strukturált döntést és valószínűséget ad, szöveges indoklást nem.
  • A 30 MLflow-példából mind a 30-ban egyezett az emberi értékeléssel.
  • A tesztben a medián késleltetés 369 ezredmásodperc volt.
  • A közzétett bemeneti ár 0,042 dollár egymillió tokenenként.
  • Bizonytalan esetek másik modellhez vagy emberi ellenőrzésre irányíthatók.

Strukturált döntések szöveges válaszok helyett

Az MLflow szeptember 22-i bejegyzése szerint a nagy nyelvi modellek bíróként használhatók válaszok értékelésére, promptok összehasonlítására és visszaesések felismerésére. Minden ilyen ellenőrzés újabb modellhívást jelent, ezért nagyobb projektekben az értékelés költsége és időigénye is problémává válhat.

A TypeSafe Jev modellje más megközelítést alkalmaz. Nem szöveget generál tokenenként, hanem előre meghatározott lehetőségek közül ad strukturált kimenetet, döntési valószínűséggel együtt. A TypeSafe ezt System One modellként írja le, Daniel Kahneman gyors döntésekről szóló fogalmára utalva.

A Jev egyik kérdéstípusa, a Noul, például annak valószínűségét adja vissza, hogy egy válasz helyes-e. Ezt a program egy küszöbérték alapján megfelelt vagy nem megfelelő eredménnyé alakíthatja. A modell Choice segítségével kategóriát is választhat, a Score típussal pedig rendezett értékelési skálán osztályozhat.

Alacsony ár, de nincs szöveges indoklás

Az MLflow szerint sok értékelési feladatnál csak egy szűk döntést kell meghozni nagy mennyiségű bemenet alapján. Ilyen lehet annak megállapítása, hogy egy válasz a megfelelő API-t használja-e, figyelembe veszi-e a kérdésben szereplő verziót, vagy ellentmond-e a mellékelt dokumentációnak.

A Jev közzétett ára 0,042 dollár egymillió bemeneti tokenenként, a kimeneti tokenekért pedig nem számít fel díjat. A modell egy kérésben több, egymástól független kérdést is kezelhet ugyanahhoz az állapothoz kapcsolódóan.

A megoldás korlátja, hogy nem ad szöveges magyarázatot. A kimenetben a besorolás mellett valószínűség szerepel, így a felhasználó nem kapja meg, miért minősített hibásnak egy választ. Az MLflow ezért fejlesztés közbeni iterációhoz továbbra is szöveges választ adó modelleket tart megfelelőbbnek.

A Jev minden tesztpéldán egyezett az emberrel

Az MLflow 30, nyomkövetéssel, értékeléssel, promptokkal, adathalmazokkal és értékelésekkel kapcsolatos kérdés-válasz példát vizsgált. A példákat emberi értékelő címkézte, a végleges referencia pedig 15 helyes és 15 helytelen választ tartalmazott.

A Jev 1.13.0 mind a 30 esetben egyezett az emberi címkével. A medián késleltetés 369 ezredmásodperc, a 95. percentilis 411 ezredmásodperc, a becsült költség pedig 1000 értékelésenként 0,0247 dollár volt.

Összehasonlításként a GPT-5.6 Terra és Luna szintén 30/30-as eredményt ért el, 1091, illetve 947 ezredmásodperces medián késleltetéssel. Becsült költségük 1000 értékelésenként 0,8960, illetve 0,0896 dollár volt. A Claude Sonnet 4.6 27/30, az Opus 4.8 28/30, a DeepSeek-V4.1-Flash pedig 29/30 esetben egyezett az emberi címkével. A Claude modellek becsült költsége 1,6721, illetve 3,7750 dollár, a DeepSeeké pedig 0,0624 dollár volt, utóbbi csúcsidőn kívüli árazással.

Nagy léptékű ellenőrzéshez lehet hasznos

Az MLflow hangsúlyozza, hogy a 30 példás teszt eredménye önmagában nem elegendő a bevezetéshez. A használat előtt valódi válaszokat kell gyűjteni, és ellenőrizni kell az adott alkalmazás szempontjából fontos hibákat.

A Jev valószínűségi kimenete lehetővé teszi, hogy a bizonytalan eseteket egy másik értékelőhöz továbbítsák. A bináris Noul kérdés ugyanakkor nem tud tartózkodni. Ha erre szükség van, az MLflow szerint Choice kérdést kell használni külön bizonytalan opcióval, majd ezeket az eseteket másik bíróhoz vagy emberi felülvizsgálóhoz irányítani.

A forrás alapján a Jev fő előnye a nagy léptékű értékelésnél jelentkezhet, például online éles környezet figyelésénél, ahol a minőség, a költség és a késleltetés egyensúlya fontos. Ha a modell hibásnak jelöl egy választ, ugyanaz a vizsgálat később drágább nyelvi modellekkel is lefuttatható, hogy ember által olvasható indoklás készüljön.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A LanceDB szerint gyors és versenyképes a Jev újrarangsoroló
Kutatás2026. október 1. 05:58

A LanceDB szerint gyors és versenyképes a Jev újrarangsoroló

A LanceDB öt adathalmazon hasonlította össze a Jev újrarangsorolót 19 konfigurációval. A vállalat szerint a Jev gyors és versenyképes, miközben a találatok relevanciáját…

A LanceDB szerint a Jev gyors és versenyképes reranker
Kutatás2026. október 1. 05:58

A LanceDB szerint a Jev gyors és versenyképes reranker

A LanceDB öt adathalmazon és 19, előre elkészített reranker-konfigurációval vetette össze a TypeSafe Jev modelljét. A vállalat szerint a Jev gyors és versenyképes…

Kutatás
Kutatás2026. szeptember 25.

Az MLflow tesztjén a Jev gyors volt, de hibákat is átengedett

A Jev strukturált döntési modell az MLflow új tesztjén 72 válaszból 64 esetben egyezett az emberi címkézéssel. A modell gyorsabb és olcsóbb volt a GPT-OSS-120B-nél, de…