Az MLflow tesztjén a Jev gyors volt, de hibákat is átengedett
A Jev strukturált döntési modell az MLflow új tesztjén 72 válaszból 64 esetben egyezett az emberi címkézéssel. A modell gyorsabb és olcsóbb volt a GPT-OSS-120B-nél, de több, csaknem helyes választ hibásan elfogadott.
- A Jev 72 válaszból 64 esetben egyezett az emberi címkékkel.
- A GPT-OSS-120B mind a 72 választ helyesen címkézte a tesztben.
- A Jev medián késleltetése 0,20 másodperc, a GPT-OSS-120B-é 1,44 másodperc volt.
- A bizonytalan Jev-döntések második ellenőrzésével mindkét futásban elérhető lett volna a teljes emberi egyezés.
- Az MLflow 3.17 a tervek szerint beépített Jev-támogatást kap.
Nehezebb válaszokon vizsgálták a Jevet
Az MLflow szeptember 25-én közzétett beszámolója a korábbi teszt folytatása. Az első részben a Jevet, a GPT-t, a Claude-ot és a DeepSeeket hasonlították össze az MLflow kérdés-válasz feladataira adott válaszok bírájaként. A Jev mind a 30 emberi címkével egyezett, miközben abban a tesztben nála mérték a legalacsonyabb késleltetést és becsült költséget.
A második tesztben 12 kérdést állítottak össze angol és japán nyelven. Mindegyikhez egy helyes és két finoman hibás választ készítettek, így összesen 72 válasz került az adathalmazba. Egyes hibás válaszok a megfelelő API nevét tartalmazták, de tévesen magyarázták annak működését. Mások hibás API-nevet, felcserélt forrás- és célszerepet, hiányzó jogosultságot vagy egy helyes állítást követő hamis kiegészítést tartalmaztak.
A vizsgálatban a typesafe/jev-1.13 modellt a gpt-oss-120b modellel vetették össze. Mindkettőnek azt kellett eldöntenie, hogy a válasz tényszerűen és technikailag helyes-e a dokumentációrészlet alapján. A Jevnél a legalább 0,5-ös valószínűség számított helyesnek.
A GPT-OSS minden választ jól címkézett
A teljes adathalmazt kétszer futtatták le. A Jev mindkét alkalommal 64 válasznál egyezett az emberi címkékkel, nyelvenként pedig 32-ből 36 esetet talált el. A gpt-oss-120b mind a 72 válasz esetében egyezett az emberi értékeléssel.
A Jev minden helyes választ elfogadott, a másképpen megfogalmazott helyes válaszokat is. Emellett több hibát felismert, például egy téves megőrzési időt és egy megfordított igen vagy nem következtetést. A hibái olyan válaszok voltak, amelyek nagyrészt helyesnek tűntek, de egy lényeges részletben tévedtek.
Az egyik elfogadott válasz a WHEN NOT MATCHED THEN INSERT záradékot helyesen nevezte meg, de felcserélte a forrás- és célsorok szerepét. Egy másik szerint a CREATE SECRET és a USE SCHEMA elegendő jogosultság, miközben a séma tulajdonosával nem rendelkező felhasználónál a USE CATALOG engedély is szükséges. Egy harmadik válasz helyesen mondta, hogy a törlésvektorokkal rendelkező táblán végzett DELETE nem írja át azonnal a Parquet-fájlokat, de hibás parancsot adott meg a sorok későbbi fizikai eltávolítására.
Gyorsabb, olcsóbb, és másik modellel ellenőrizhető
A Jev medián késleltetése 0,20 másodperc volt, szemben a GPT-OSS-120B 1,44 másodpercével. Az MLflow szerint ez ebben a beállításban körülbelül hétszeres sebességkülönbség. A két futtatás során bíróként modellenként 144 mérést végeztek.
A Jev becsült következtetési költsége körülbelül 0,020 dollár volt 1000 ítéletenként, a kreditek megvásárlásának díjai nélkül. A GPT-OSS egy ítélethez átlagosan 224 kimeneti tokent állított elő, a gondolkodási tokeneket is beleszámítva.
A Jev valószínűségei alapján az MLflow azt is megvizsgálta, mi történne, ha a bizonytalan döntéseket egy másik modellhez küldenék. A tesztben minden hibás elfogadás nagyjából 0,5 és 0,8 közötti valószínűséget kapott, míg minden helyes válasz legalább 0,91-et. Ha a 0,2 és 0,8 közötti eredményeket a GPT-OSS-nek továbbították volna, az első futásban 12, a másodikban 13 válasz, vagyis kevesebb mint 20 százalék került volna második ellenőrzésre. A kombinált döntés mindkét futásban egyezett az összes emberi címkével.
Az MLflow hangsúlyozza, hogy ez a küszöbtartomány csak kiindulópont, mivel ugyanazon bemenetek ismételt futtatásakor egy hibás elfogadás 0,82-es értéket kapott.
Az MLflow 3.17-ben érkezhet a beépített támogatás
Az MLflow 3.17 még nem jelent meg, de a tervek szerint a Jev beépített értékelőkben és egyedi bírákban is használható lesz a typesafe:/ modellazonosítóval. A make_judge példája egy logikai helyességvizsgálatot készít, majd az MLflow a Jev igaz vagy hamis döntését jev_correctness néven, a valószínűséget pedig a typesafe.probability metaadataiban rögzíti.
A bejegyzés szerint a bemutatott integráció a jelenlegi stabil kiadáson nem futtatható. A teszt a typesafe/jev-1.13 modellt használta, míg a példa a typesafe:/jev-latest modellt és kissé eltérő utasításokat ad meg, ezért az eredmények különbözhetnek.
Az MLflow azt javasolja, hogy a felhasználók saját, címkézett adathalmazon vizsgálják meg a Jevet a jelenlegi bírójuk mellett. Különösen azokat a válaszokat kell ellenőrizni, amelyek helyesnek hangzanak, de hibás parancsot vagy hiányos jogosultságokat tartalmaznak. A küszöbértékeket új példákon is tesztelni kell, mielőtt másik modellhez irányítanák a bizonytalan ítéleteket.

