A Jev gyorsabb és olcsóbb, de kevésbé pontos a Claude Opus 5-nél

A Jev 1.13 a Banking77 szándékfelismerési tesztjén 81,0 százalékos pontosságot ért el, a Claude Opus 5 pedig 84,4 százalékot. Az OpenRouter mérése szerint a Jev medián késleltetése 13-szor alacsonyabb volt, költsége pedig a nagy modell árának töredékére jött ki.
- A Jev 1.13 pontossága 81,0, a Claude Opus 5-é 84,4 százalék volt.
- A Jev medián válaszideje 175, az Opusé 2266 ezredmásodperc lett.
- Ezer kérés költsége a Jevnél 0,11, az Opusnál 2,42 dollár volt.
- 0,90-es megbízhatósági küszöbnél a forgalom 75,9 százalékát a Jev kezelte.
- A teszt a Banking77 3080 üzenetét és 77 szándékkategóriáját használta.
Azonos feladaton hasonlították össze a modelleket
Az OpenRouter 2026. szeptember 22-én 3080 Banking77 ügyfélszolgálati üzenetet futtatott le a TypeSafe Jev 1.13 modelljén és a Claude Opus 5-ön. A tesztadatbázis minden üzenete a 77 banki szándék egyikéhez tartozott, és modellenként ugyanazt az egysoros leírást használták az egyes kategóriákhoz.
A Jev a TypeSafe System One döntési modellje. A szolgáltatás egy alkalmazásállapotot és egy típusos kérdést kap, majd típusos választ, megbízhatósági értéket és az egyes lehetőségek valószínűségét adja vissza. Az Opus esetében az OpenRouter nulla hőmérsékletet, kikapcsolt következtetési módot és szigorú JSON-formátumot alkalmazott.
A Jev 81,0 százalékos pontosságot és 80,5 százalékos makro F1 értéket ért el. A Claude Opus 5 eredménye 84,4, illetve 83,6 százalék lett. A két modell az üzenetek 89,3 százalékánál ugyanarra a címkére jutott, és egyik sem adott hibásan formázott választ.
A Jev jelentősen gyorsabb és olcsóbb volt
A Jev medián válaszideje 175 ezredmásodperc volt, a mérések 95. percentilisénél pedig 270 ezredmásodpercet mértek. A Claude Opus 5 ugyanezeken a pontokon 2266, illetve 3004 ezredmásodpercet ért el. Az OpenRouter szerint a Jev leglassabb, körülbelül 1,6 másodperces hívása is gyorsabb volt az Opus leggyorsabb, körülbelül 1,9 másodperces hívásánál.
A teljes Jev-futtatás 0,34 dollárba került, ami ezer kérésenként 0,11 dollárt jelentett. Az Opus költsége 7,44 dollár, ezer kérésenként 2,42 dollár volt. Ez az összeg már figyelembe vette a rendszerüzenet gyorsítótárazását. Gyorsítótárazás nélkül az OpenRouter számítása szerint az Opus listaára körülbelül 19 dollár lett volna ezer kérésenként.
A kategóriák közötti eltérés sem volt egyirányú. Az Opus 35 szándéknál, a Jev 15-nél ért el jobb eredményt, 27 kategóriában döntetlen született. A Jev a compromised_card kategóriában 95,0 százalékot ért el az Opus 70,0 százalékával szemben, míg a receiving_money kategóriában az Opus 80,0 százaléka állt szemben a Jev 52,5 százalékával.
A Jev megbízhatósági értéke alapján lehet továbbítani a nehéz eseteket
Az OpenRouter megvizsgálta azt is, hogy a Jev megbízhatósági értéke használható-e a bizonytalan kérések Claude Opus 5-höz való továbbítására. A vállalat szerint ez az érték nem kalibrált valószínűség, viszont jól rangsorolja a könnyebb és nehezebb eseteket. A legalább 0,99-es értéket kapó üzeneteknél 96,3 százalékos pontosságot mértek, míg a 0,5 alatti csoportban ez 29,6 százalék volt.
0,90-es küszöbnél a forgalom 75,9 százalékát a Jev kezelte, a kombinált rendszer pontossága 84,0 százalék lett, az ezer kérésre jutó költség pedig 0,69 dollár. Ez az Opus önálló használatához képest legfeljebb 0,4 százalékpontos pontosságcsökkenést és 3,5-szeres költségcsökkentést jelentett az OpenRouter mérésében.
A teszt korlátai miatt az eredmény nem általánosítható minden területre. Egyetlen adathalmazt és domént, egy prompttervet, valamint egy rövid mérési időszakot vizsgáltak. Az OpenRouter azt is jelezte, hogy a kaszkád eredménye ugyanazon 3080 üzenet alapján készült, ezért felső becslésként kell kezelni.
OpenRouter: Is Jev as Accurate as Frontier Models at Classification?


