Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Jev gyorsabb és olcsóbb, de kevésbé pontos a Claude Opus 5-nél

2026. szeptember 22.Forrás: OpenRouter
A Jev gyorsabb és olcsóbb, de kevésbé pontos a Claude Opus 5-nél
Kép: OpenRouter

A Jev 1.13 a Banking77 szándékfelismerési tesztjén 81,0 százalékos pontosságot ért el, a Claude Opus 5 pedig 84,4 százalékot. Az OpenRouter mérése szerint a Jev medián késleltetése 13-szor alacsonyabb volt, költsége pedig a nagy modell árának töredékére jött ki.

A lényeg röviden
  • A Jev 1.13 pontossága 81,0, a Claude Opus 5-é 84,4 százalék volt.
  • A Jev medián válaszideje 175, az Opusé 2266 ezredmásodperc lett.
  • Ezer kérés költsége a Jevnél 0,11, az Opusnál 2,42 dollár volt.
  • 0,90-es megbízhatósági küszöbnél a forgalom 75,9 százalékát a Jev kezelte.
  • A teszt a Banking77 3080 üzenetét és 77 szándékkategóriáját használta.

Azonos feladaton hasonlították össze a modelleket

Az OpenRouter 2026. szeptember 22-én 3080 Banking77 ügyfélszolgálati üzenetet futtatott le a TypeSafe Jev 1.13 modelljén és a Claude Opus 5-ön. A tesztadatbázis minden üzenete a 77 banki szándék egyikéhez tartozott, és modellenként ugyanazt az egysoros leírást használták az egyes kategóriákhoz.

A Jev a TypeSafe System One döntési modellje. A szolgáltatás egy alkalmazásállapotot és egy típusos kérdést kap, majd típusos választ, megbízhatósági értéket és az egyes lehetőségek valószínűségét adja vissza. Az Opus esetében az OpenRouter nulla hőmérsékletet, kikapcsolt következtetési módot és szigorú JSON-formátumot alkalmazott.

A Jev 81,0 százalékos pontosságot és 80,5 százalékos makro F1 értéket ért el. A Claude Opus 5 eredménye 84,4, illetve 83,6 százalék lett. A két modell az üzenetek 89,3 százalékánál ugyanarra a címkére jutott, és egyik sem adott hibásan formázott választ.

A Jev jelentősen gyorsabb és olcsóbb volt

A Jev medián válaszideje 175 ezredmásodperc volt, a mérések 95. percentilisénél pedig 270 ezredmásodpercet mértek. A Claude Opus 5 ugyanezeken a pontokon 2266, illetve 3004 ezredmásodpercet ért el. Az OpenRouter szerint a Jev leglassabb, körülbelül 1,6 másodperces hívása is gyorsabb volt az Opus leggyorsabb, körülbelül 1,9 másodperces hívásánál.

A teljes Jev-futtatás 0,34 dollárba került, ami ezer kérésenként 0,11 dollárt jelentett. Az Opus költsége 7,44 dollár, ezer kérésenként 2,42 dollár volt. Ez az összeg már figyelembe vette a rendszerüzenet gyorsítótárazását. Gyorsítótárazás nélkül az OpenRouter számítása szerint az Opus listaára körülbelül 19 dollár lett volna ezer kérésenként.

A kategóriák közötti eltérés sem volt egyirányú. Az Opus 35 szándéknál, a Jev 15-nél ért el jobb eredményt, 27 kategóriában döntetlen született. A Jev a compromised_card kategóriában 95,0 százalékot ért el az Opus 70,0 százalékával szemben, míg a receiving_money kategóriában az Opus 80,0 százaléka állt szemben a Jev 52,5 százalékával.

A Jev megbízhatósági értéke alapján lehet továbbítani a nehéz eseteket

Az OpenRouter megvizsgálta azt is, hogy a Jev megbízhatósági értéke használható-e a bizonytalan kérések Claude Opus 5-höz való továbbítására. A vállalat szerint ez az érték nem kalibrált valószínűség, viszont jól rangsorolja a könnyebb és nehezebb eseteket. A legalább 0,99-es értéket kapó üzeneteknél 96,3 százalékos pontosságot mértek, míg a 0,5 alatti csoportban ez 29,6 százalék volt.

0,90-es küszöbnél a forgalom 75,9 százalékát a Jev kezelte, a kombinált rendszer pontossága 84,0 százalék lett, az ezer kérésre jutó költség pedig 0,69 dollár. Ez az Opus önálló használatához képest legfeljebb 0,4 százalékpontos pontosságcsökkenést és 3,5-szeres költségcsökkentést jelentett az OpenRouter mérésében.

A teszt korlátai miatt az eredmény nem általánosítható minden területre. Egyetlen adathalmazt és domént, egy prompttervet, valamint egy rövid mérési időszakot vizsgáltak. Az OpenRouter azt is jelezte, hogy a kaszkád eredménye ugyanazon 3080 üzenet alapján készült, ezért felső becslésként kell kezelni.

Kapcsolódó hírek

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása
Kutatás2026. október 2. 20:01

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása

A promptok gyorsítótárazása csökkentheti az ismétlődő bemenetek feldolgozásának költségét, de az Arize AI tesztje szerint a magas cache újraolvasási arány önmagában nem…

Az OpenRouter új oldalon hasonlítja össze a modellroutereket
Fejlesztőknek2026. október 2.

Az OpenRouter új oldalon hasonlítja össze a modellroutereket

Az OpenRouter új Model Router Benchmarks oldalt indított, amely különböző területeken méri össze a modellrouterek teljesítményét. A rendszer a válaszminőséget, a…

Az Arize szerint a Jev 300-szor olcsóbban érte el Claude Opus 5 pontosságát
Kutatás2026. szeptember 24. 00:55

Az Arize szerint a Jev 300-szor olcsóbban érte el Claude Opus 5 pontosságát

A Jev a Claude Opus 5-tel azonos, 87 százalékos pontosságot ért el az Arize hallucination detection tesztjén, miközben a vállalat szerint körülbelül 300-szor olcsóbb és…