Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az MLflow tesztjén a Jev gyors volt, de hibákat is átengedett

2026. szeptember 25.Forrás: MLflow

A Jev strukturált döntési modell az MLflow új tesztjén 72 válaszból 64 esetben egyezett az emberi címkézéssel. A modell gyorsabb és olcsóbb volt a GPT-OSS-120B-nél, de több, csaknem helyes választ hibásan elfogadott.

A lényeg röviden
  • A Jev 72 válaszból 64 esetben egyezett az emberi címkékkel.
  • A GPT-OSS-120B mind a 72 választ helyesen címkézte a tesztben.
  • A Jev medián késleltetése 0,20 másodperc, a GPT-OSS-120B-é 1,44 másodperc volt.
  • A bizonytalan Jev-döntések második ellenőrzésével mindkét futásban elérhető lett volna a teljes emberi egyezés.
  • Az MLflow 3.17 a tervek szerint beépített Jev-támogatást kap.

Nehezebb válaszokon vizsgálták a Jevet

Az MLflow szeptember 25-én közzétett beszámolója a korábbi teszt folytatása. Az első részben a Jevet, a GPT-t, a Claude-ot és a DeepSeeket hasonlították össze az MLflow kérdés-válasz feladataira adott válaszok bírájaként. A Jev mind a 30 emberi címkével egyezett, miközben abban a tesztben nála mérték a legalacsonyabb késleltetést és becsült költséget.

A második tesztben 12 kérdést állítottak össze angol és japán nyelven. Mindegyikhez egy helyes és két finoman hibás választ készítettek, így összesen 72 válasz került az adathalmazba. Egyes hibás válaszok a megfelelő API nevét tartalmazták, de tévesen magyarázták annak működését. Mások hibás API-nevet, felcserélt forrás- és célszerepet, hiányzó jogosultságot vagy egy helyes állítást követő hamis kiegészítést tartalmaztak.

A vizsgálatban a typesafe/jev-1.13 modellt a gpt-oss-120b modellel vetették össze. Mindkettőnek azt kellett eldöntenie, hogy a válasz tényszerűen és technikailag helyes-e a dokumentációrészlet alapján. A Jevnél a legalább 0,5-ös valószínűség számított helyesnek.

A GPT-OSS minden választ jól címkézett

A teljes adathalmazt kétszer futtatták le. A Jev mindkét alkalommal 64 válasznál egyezett az emberi címkékkel, nyelvenként pedig 32-ből 36 esetet talált el. A gpt-oss-120b mind a 72 válasz esetében egyezett az emberi értékeléssel.

A Jev minden helyes választ elfogadott, a másképpen megfogalmazott helyes válaszokat is. Emellett több hibát felismert, például egy téves megőrzési időt és egy megfordított igen vagy nem következtetést. A hibái olyan válaszok voltak, amelyek nagyrészt helyesnek tűntek, de egy lényeges részletben tévedtek.

Az egyik elfogadott válasz a WHEN NOT MATCHED THEN INSERT záradékot helyesen nevezte meg, de felcserélte a forrás- és célsorok szerepét. Egy másik szerint a CREATE SECRET és a USE SCHEMA elegendő jogosultság, miközben a séma tulajdonosával nem rendelkező felhasználónál a USE CATALOG engedély is szükséges. Egy harmadik válasz helyesen mondta, hogy a törlésvektorokkal rendelkező táblán végzett DELETE nem írja át azonnal a Parquet-fájlokat, de hibás parancsot adott meg a sorok későbbi fizikai eltávolítására.

Gyorsabb, olcsóbb, és másik modellel ellenőrizhető

A Jev medián késleltetése 0,20 másodperc volt, szemben a GPT-OSS-120B 1,44 másodpercével. Az MLflow szerint ez ebben a beállításban körülbelül hétszeres sebességkülönbség. A két futtatás során bíróként modellenként 144 mérést végeztek.

A Jev becsült következtetési költsége körülbelül 0,020 dollár volt 1000 ítéletenként, a kreditek megvásárlásának díjai nélkül. A GPT-OSS egy ítélethez átlagosan 224 kimeneti tokent állított elő, a gondolkodási tokeneket is beleszámítva.

A Jev valószínűségei alapján az MLflow azt is megvizsgálta, mi történne, ha a bizonytalan döntéseket egy másik modellhez küldenék. A tesztben minden hibás elfogadás nagyjából 0,5 és 0,8 közötti valószínűséget kapott, míg minden helyes válasz legalább 0,91-et. Ha a 0,2 és 0,8 közötti eredményeket a GPT-OSS-nek továbbították volna, az első futásban 12, a másodikban 13 válasz, vagyis kevesebb mint 20 százalék került volna második ellenőrzésre. A kombinált döntés mindkét futásban egyezett az összes emberi címkével.

Az MLflow hangsúlyozza, hogy ez a küszöbtartomány csak kiindulópont, mivel ugyanazon bemenetek ismételt futtatásakor egy hibás elfogadás 0,82-es értéket kapott.

Az MLflow 3.17-ben érkezhet a beépített támogatás

Az MLflow 3.17 még nem jelent meg, de a tervek szerint a Jev beépített értékelőkben és egyedi bírákban is használható lesz a typesafe:/ modellazonosítóval. A make_judge példája egy logikai helyességvizsgálatot készít, majd az MLflow a Jev igaz vagy hamis döntését jev_correctness néven, a valószínűséget pedig a typesafe.probability metaadataiban rögzíti.

A bejegyzés szerint a bemutatott integráció a jelenlegi stabil kiadáson nem futtatható. A teszt a typesafe/jev-1.13 modellt használta, míg a példa a typesafe:/jev-latest modellt és kissé eltérő utasításokat ad meg, ezért az eredmények különbözhetnek.

Az MLflow azt javasolja, hogy a felhasználók saját, címkézett adathalmazon vizsgálják meg a Jevet a jelenlegi bírójuk mellett. Különösen azokat a válaszokat kell ellenőrizni, amelyek helyesnek hangzanak, de hibás parancsot vagy hiányos jogosultságokat tartalmaznak. A küszöbértékeket új példákon is tesztelni kell, mielőtt másik modellhez irányítanák a bizonytalan ítéleteket.

Kapcsolódó hírek

A LanceDB szerint gyors és versenyképes a Jev újrarangsoroló
Kutatás2026. október 1. 05:58

A LanceDB szerint gyors és versenyképes a Jev újrarangsoroló

A LanceDB öt adathalmazon hasonlította össze a Jev újrarangsorolót 19 konfigurációval. A vállalat szerint a Jev gyors és versenyképes, miközben a találatok relevanciáját…

A LanceDB szerint a Jev gyors és versenyképes reranker
Kutatás2026. október 1. 05:58

A LanceDB szerint a Jev gyors és versenyképes reranker

A LanceDB öt adathalmazon és 19, előre elkészített reranker-konfigurációval vetette össze a TypeSafe Jev modelljét. A vállalat szerint a Jev gyors és versenyképes…

Kutatás
Kutatás2026. szeptember 22.

A Jev kiválthatja az LLM-es bírákat? Az MLflow tesztelte

A TypeSafe Jev modellje 30 MLflow-val kapcsolatos kérdés mindegyikén egyezett az emberi értékeléssel, miközben a tesztben ez volt a leggyorsabb és legolcsóbb bíró. A…