Az Arize AX minden csomagban elérhetővé tette az Agent-as-a-Judge funkciót

Az Arize AX szeptemberi frissítései a teljes beszélgetéseket önálló munkafolyamattá emelik, és minden csomagban elérhetővé teszik az Agent-as-a-Judge értékelőt. A platform emellett képeket és hangokat is megjelenít az értékelési folyamatokban, valamint új modellekkel bővült.
- A teljes session önállóan annotálható, értékelhető és ellenőrzési sorba küldhető.
- Az Agent-as-a-Judge most minden Arize AX-csomagban elérhető.
- Az Alyx képes felhasználni a Signal által rögzített problémákat.
- A vision evals közvetlenül képeket is értékelhetnek.
- A trace-ekből feltöltött adathalmazok minden egyező rekordot megőriznek.
A session önálló objektummá vált
Az Arize AI szeptember 22-i bejegyzése szerint az augusztus 6. és szeptember 18. között megjelent frissítések egyik fő eleme, hogy az Arize AX-ben a session, vagyis egy teljes beszélgetés, önállóan kezelhető egységgé vált. A session magában foglalja az összes hozzá tartozó trace-t és span-t.
A felhasználók a session részletes nézetében az egész beszélgetést felcímkézhetik. A címke session_annotation.<name> formában tárolódik, és később bárhol lehet rá szűrni. A sessionök a Sessions táblázatból vagy API-n keresztül ellenőrzési sorba is küldhetők, ilyenkor a felülvizsgáló a teljes beszélgetést látja, nem csak egy kiválasztott span-t.
Az értékelők beállításakor az eredmények előnézete szintén session szinten jelenik meg. Az Alyx pedig természetes nyelvű kérés alapján szűrőt készít a Sessions nézetben.
Az Alyx a Signal megállapításait is felhasználja
Az Alyx mostantól hozzáfér a Signal által az adott munkaterülethez rögzített problémákhoz. A felhasználó megkérdezheti, hogy a Signal milyen hibákat talált egy projekten belül, illetve a @ menüből egy konkrét problémát is csatolhat részletes vizsgálathoz.
Ha valaki olyan trace hibakeresését kéri az Alyxtól, amelyet a Signal már megvizsgált, a rendszer a kapcsolódó problémához irányítja a felhasználót, így nem kezdi újra ugyanazt a munkát. A Signal rangsorolt problémákat rögzít az éles környezetből származó trace-ek alapján.
Az Agent-as-a-Judge minden csomagban elérhető
Az Agent-as-a-Judge egy ügynökalapú értékelő, amely megvizsgálja a trace-eket, megtalálja a releváns spanokat, majd felcímkézi a problémákat. Az Arize AI leírása szerint az értékelő a produkcióban megjelenő hibákhoz igazítja a vizsgálati szempontjait.
A funkció korábban csak Enterprise ügyfelek számára volt elérhető, mostantól viszont minden Arize AX-csomag része. Új értékelőként az evaluator gallery New Evaluator menüjéből indítható.
A Playground és az értékelők modellválasztéka is bővült. Elérhető a claude-fable-5-1 Anthropic, Bedrock és Vertex AI környezetben, az OpenAI gpt-6-astra, valamint a gemini-3.7-flash. Az AWS Bedrockön hosztolt Mistral-modellek, köztük a Mistral Large 3 és a Pixtral Large, a modellválasztóban a Mistral AI alatt szerepelnek.
Képekkel és hangokkal is működnek a vision evals
Az Arize AX mostantól megjeleníti a feltöltött médiát a trace- és span-nézetekben, az adathalmazokban, a kísérletek összehasonlításában, a Playgroundban és az annotációs sorokban. A megoldás a Google Cloud, az AWS és az Azure tárhelyeiről érkező tartalmakat is kezeli.
Az LLM-as-a-judge sablonok képoszlopra hivatkozhatnak, így a vision evals közvetlenül a tényleges képet értékelhetik, nem annak szöveges helyettesítőjét. Az adathalmazok trace-ekből történő feltöltésekor a rendszer most minden egyező rekordot beír, és nem alkalmaz olyan mintavételi korlátot, amely sorokat hagyhatna ki. A teljes hozzáfűzés 2-7-szer gyorsabb lett, és ez minden fiókszinten érvényes.
A Python SDK-ban a client.traces.list() egy projekt trace-eit listázza teljes spanlistával és összesített metaadatokkal. A lekérdezés projekt névvel vagy azonosítóval, időtartománnyal, szűrőkifejezéssel és korláttal szűkíthető, az oldalak pedig a szerver által visszaadott kurzorral tölthetők be. A funkció béta állapotú.


