Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Olcsóbb tömeges AI-értékelést kínál a Jev és a Pydantic Evals

2026. szeptember 23.Forrás: Pydantic
Olcsóbb tömeges AI-értékelést kínál a Jev és a Pydantic Evals
Kép: Pydantic

A TypeSafe Jev strukturált döntéseket és valószínűségeket ad vissza, így a Pydantic Evals segítségével nagy mennyiségű AI-válasz értékelhető magyarázat generálása nélkül. A Pydantic példája szerint egymillió értékelés három eredménnyel 42 dollárba kerülhet a Jev inferenciájában és 20 dollárba a Logfire telemetriájában.

A lényeg röviden
  • A TypeSafe Jev kategóriákat, pontszámokat és valószínűségeket ad vissza.
  • A Pydantic AI 2.46.0 beépített Jev-támogatást tartalmaz.
  • Egymillió, három eredményt adó értékelés példaköltsége 42 dollár Jevben és 20 dollár Logfire-ban.
  • A Pydantic példája külön méri a szabálykövetést, a teljességet és a titkok bekérését.
  • A Pydantic Evals LLMJudge és GEval értékelői is használhatják a Jevet.

Strukturált döntések magyarázatok helyett

A Pydantic szeptember 23-án közzétett bemutatója szerint egy értékelő rendszernek gyakran kategóriát, igen vagy nem választ, illetve egy értékelési skálán elfoglalt helyet kell visszaadnia. Ilyenkor nem feltétlenül szükséges minden egyes produkciós válaszhoz részletes indoklást készíteni.

A TypeSafe Jev erre a feladatra készült. Szöveget és előre meghatározott válaszú kérdéseket fogad, majd döntéseket és valószínűségeket ad vissza. A szolgáltatás közzétett bemeneti ára 0,042 dollár egymillió tokenenként, kimeneti tokenek után pedig nem számít fel díjat.

A Pydantic AI 2.46.0 verziója leírt enumokat és beépített Jev-bíró támogatást tartalmaz. Ez lehetővé teszi, hogy a Jev egy Pydantic Evals értékelő részeként fusson, az eredmények pedig a Pydantic Logfire rendszerében jelenjenek meg.

Három külön mérés egy támogatási válaszon

A Pydantic példája egy támogatási asszisztenst vizsgál. A rövid szabályzat szerint a duplikált terheléseket számlázási ellenőrzésre kell továbbítani, bejelentkezési problémáknál jelszó-visszaállítást kell javasolni, az asszisztens pedig soha nem kérhet jelszót, és nem ígérhet visszatérítést.

Az értékelés három külön mérésből áll. Az első a szabálykövetést vizsgálja, amelynek eredménye compliant, violates_policy vagy insufficient_context lehet. A második a teljességet méri háromszintű skálán: a válasz nem foglalkozik a kéréssel, foglalkozik vele, de nem ad világos következő lépést, vagy konkrét következő lépést is megad. A harmadik mérés annak valószínűségét adja meg, hogy a válasz jelszót vagy egyszer használatos belépési kódot kér.

A mérések szétválasztása láthatóvá teszi az eltérő hibákat. Egy válasz például adhat világos következő lépést, miközben megsérti a szabályzatot azzal, hogy a felhasználó jelszavát kéri. A teljes példaszkript nyolc szintetikus választ használ, köztük hasznos válaszokat, visszatérítést ígérő és jelszót kérő szövegeket, homályos bocsánatkérést, valamint a szabályzaton kívüli kérdésekre adott válaszokat. Ezek a bíró működésének vizsgálatára készített tesztesetek, nem produkciós ügynök mért eredményei.

A pontszámok naplózhatók és összehasonlíthatók

A Jev a vizsgált szöveget és a hozzá tartozó kérdéseket külön kezeli. A Pydantic egyedi értékelőjében a bemenet tartalmazza a szabályzatot, az ügyfél üzenetét és az asszisztens válaszát, a kimeneti típus pedig rögzíti a kategóriákat és a rubrikát.

A három kérdés egyetlen TypeSafe-kérésben fut. A Jev a teljességi rubrika pontszámát a szintek valószínűséggel súlyozott átlagaként számítja ki. A Pydantic AI a legközelebbi enumértéket adja vissza, miközben a tört pontszám és az eloszlások a szolgáltatói részletek között is elérhetők.

A teljes szkript a modellverziót, a tokenhasználatot, a bizonyosságot és az eloszlásokat is Logfire-naplóban rögzíti. A Jev modellverziója rögzített, így egy változó modellalias nem módosítja észrevétlenül a bíró működését az egyes kísérletek között. A bemutató külön kiemeli az insufficient_context kategóriát, amely lehetőséget ad a hiányzó bizonyíték jelzésére, de önmagában nem garantálja, hogy a modell minden ilyen helyzetben tartózkodik a döntéstől.

A költségkülönbség nagy adatmennyiségnél válik láthatóvá

A Pydantic által megadott feltételezések mellett egymillió értékelés, értékelésenként három eredménnyel, 42 dollár Jev-inferencia- és 20 dollár Logfire-telemetriai költséget jelent. Összehasonlításként a Braintrust Pro hárommillió pont rögzítéséért 4500 dollár határköltséget számít fel, az inferencia díja előtt.

A Pydantic Evals 2.46.0 egyszerűbb esetekhez beépített LLMJudge és GEval értékelőket is kínál, amelyek közvetlenül hívhatják a Jevet. A helyi példa legfeljebb két esetet futtat párhuzamosan, jelentést készít, és a jev-report.json fájlba menti az eredményeket. A hibák nem nulla kilépési kódot eredményeznek, így egy sikertelen kérés nem jelenhet meg sikeres értékelésként.

A felhasználók a Logfire AI Evaluations felületén az egyes eseteket a hozzájuk tartozó nyomokkal együtt vizsgálhatják. Az alacsony teljességi pontszám megmutathatja, melyik válasz érdemel további figyelmet, a szabályzati címke pedig jelzi, hogy a bíró talált-e szabálysértést. A Pydantic bemutatója alapján ez a felépítés elsősorban nagy volumenű, strukturált értékelések költségét és ellenőrizhetőségét célozza.

Kapcsolódó hírek

A Jev gépi döntéseket ad az alkalmazások kezébe szöveg nélkül
Fejlesztőknek2026. október 1.

A Jev gépi döntéseket ad az alkalmazások kezébe szöveg nélkül

A TypeSafe Jev nevű AI-modellje osztályozási, pontozási és útválasztási feladatokra készült. A rendszer szöveges válasz helyett közvetlenül felhasználható, típusos…

A Pydantic AI már Jevvel is osztályozza az ügynökök döntéseit
Fejlesztőknek2026. szeptember 29.

A Pydantic AI már Jevvel is osztályozza az ügynökök döntéseit

A Pydantic AI 2.50.0 támogatja a TypeSafe Jev döntési modelljét, amely szöveges válaszok generálása helyett előre meghatározott kérdésekre ad típusos válaszokat. A…

A Pydantic AI már Jevvel is megmutatja, hogyan döntött az ügynök
Fejlesztőknek2026. szeptember 29.

A Pydantic AI már Jevvel is megmutatja, hogyan döntött az ügynök

A Pydantic AI 2.50.0 támogatja a TypeSafe Jev döntési modelljét, amely szövegből strukturált válaszokat választ ki generált szöveg nélkül. A Pydantic Logfire új nézete…