Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Arize AX közvetlenül támogatja a Jev-as-a-Judge értékeléseket

2026. szeptember 28.Forrás: Arize AI
Az Arize AX közvetlenül támogatja a Jev-as-a-Judge értékeléseket
Kép: Arize AI

Az Arize AX natív integrációt kapott a TypeSafe AI Jev rendszerével, így a csapatok közvetlenül a platformon értékelhetik a gyártásból származó nyomkövetéseket. A Jev strukturált címkéket és megbízhatósági pontszámokat ad vissza eldöntendő, választásos és pontozásos kérdésekre.

A lényeg röviden
  • Az Arize AX natív Jev-as-a-Judge integrációt kapott.
  • A Jev eldöntendő, választásos és pontozásos kérdésekre ad strukturált eredményeket.
  • Egy benchmarkban a hangolt Jev 87 százalékos pontosságot ért el a Claude Opus 5 mellett.
  • A tesztben a Jev nagyjából 1/300 költséggel és 23-szor gyorsabban futott.
  • A széles körű bevezetés előtt emberi címkékkel végzett kalibrálás szükséges.

Strukturált kérdésekre készült értékelő

Az Arize AI szeptember 28-i bejelentése szerint az Arize AX közvetlenül integrálódik a TypeSafe AI rendszerével. Az integráció a Jev-as-a-Judge értékeléseket natívan beépíti az Arize értékelési munkafolyamatába.

A Jev a TypeSafe AI System One döntési modellje, amelyet strukturált döntésekhez, nem pedig szöveggeneráláshoz terveztek. A nyomkövetésből származó közös állapot és egy vagy több típusos kérdés alapján egyetlen hívásban ad strukturált eredményeket.

A rendszerrel többek között az vizsgálható, hogy egy ügynök megoldotta-e a felhasználó kérését, a megfelelő eszközt választotta-e, megfelel-e a válasz egy meghatározott szabályzatnak, illetve melyik kategóriába tartozik az interakció.

A beállítás és a kalibrálás kulcsfontosságú

Az Arize szerint nem minden értékelési feladathoz van szükség általános célú, magyarázatot készítő nagy nyelvi modellre. A Jev olyan feladatokra használható, amelyeknél egyértelműek a kritériumok és rögzített a lehetséges kimenetek köre. A csapatok először reprezentatív példákon, emberi címkékkel vethetik össze a Jev döntéseit, majd ez alapján mérhetik fel, hogy a pontosság, a költség és a késleltetés megfelel-e az elvárásaiknak.

Az Arize egyik hallucinációészlelési benchmarkjában a küszöbértékkel hangolt Jev 87 százalékos pontossággal egyezett a Claude Opus 5 eredményével. Ugyanebben a tesztben a Jev nagyjából a költség 1/300-ad részéért futott, és 23-szor gyorsabb volt. A vállalat ugyanakkor kiemelte, hogy a küszöbérték hangolása meghatározó: a Jev alapértelmezett határértéke lényegesen gyengébben teljesített.

Ezért a széles körű használat előtt emberi címkékkel végzett kalibrálást javasolnak. Ha írásos magyarázatra van szükség, egy LLM-alapú bíró lehet megfelelőbb, míg egy ügynökbíró további kontextust gyűjthet vagy vizsgálatot végezhet a döntés előtt.

Közvetlenül az Arize AX-ben használható

Az Arize korábban távoli értékelőn keresztül is bemutatta a Jev használatát valós idejű védelmi szabályokhoz. A natív támogatás megszünteti az ehhez szükséges külön szolgáltatási réteget, és a munkafolyamatot közvetlenül az AX-be helyezi.

A használathoz a TypeSafe AI API-kulcsot a Settings, AI Providers, TypeSafe AI menüpontban kell megadni. Ezután új Jev-as-a-Judge értékelő hozható létre, megadható, hogy mely nyomkövetési adatokat vizsgálja, és milyen kérdésekre válaszoljon. A beállítás emberi címkékkel ellátott példákon tesztelhető, majd az értékelő online értékelési feladathoz kapcsolható a beérkező gyártási nyomkövetések vizsgálatához.

Az Arize szerint az alacsonyabb értékelési költség lehetővé teheti több gyártási forgalom elemzését. Így a csapatok több példát kaphatnak arról, hol hibáznak az ügynökök, és min érdemes javítani.

Kapcsolódó hírek

Jev-as-a-Judge értékelés érkezett az Arize AX platformra
Termékek és eszközök2026. szeptember 28.

Jev-as-a-Judge értékelés érkezett az Arize AX platformra

Az Arize AX közvetlenül integrálta a TypeSafe AI Jev döntési modelljét, így a csapatok natív módon értékelhetik a gyártási nyomokat. A Jev-as-a-Judge strukturált…

A Jev valószínűségei olyan hibákat is jeleznek, amelyeket az LLM-ek elrejtenek
Kutatás2026. szeptember 28.

A Jev valószínűségei olyan hibákat is jeleznek, amelyeket az LLM-ek elrejtenek

A Jev címkénkénti valószínűségei megbízhatóan jelezték, mikor tévedett az értékelésben, miközben az ismételten futtatott nyelvi modellek sok hibás döntésnél…

Az Arize szerint a Jev 300-szor olcsóbban érte el Claude Opus 5 pontosságát
Kutatás2026. szeptember 23.

Az Arize szerint a Jev 300-szor olcsóbban érte el Claude Opus 5 pontosságát

A Jev a Claude Opus 5-tel azonos, 87 százalékos pontosságot ért el az Arize hallucination detection tesztjén, miközben a vállalat szerint körülbelül 300-szor olcsóbb és…