Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Arize AI új módszerrel keresné az ügynökök rejtett hibáit

2026. szeptember 17.Forrás: Arize AI
Az Arize AI új módszerrel keresné az ügynökök rejtett hibáit
Kép: Arize AI

A produkcióban futó AI-ügynökök olyan hibákat is elkövethetnek, amelyekre a fejlesztők előre nem készítettek tesztet. Az Arize AI Signal nevű rendszere a futási nyomok elemzésével keresi a visszatérő problémákat, majd ezekből új tesztesetek és javítási javaslatok készülhetnek.

A lényeg röviden
  • A végső válasz pontszáma önmagában nem mutatja meg az ügynök teljes működését.
  • A Signal produkciós nyomok között keres visszatérő és új hibamintázatokat.
  • A rendszer rangsorolt vizsgálatokat készít bizonyítékokkal és következő lépésre vonatkozó javaslattal.
  • A felismert hibákból regressziós adatkészlet és célzott értékelés készíthető.
  • A példák kiválasztása, a mérési feltételek meghatározása és a kiadási döntés továbbra is emberi feladat.

A jó végső válasz is elfedheti a hibát

Az Arize AI szeptember 17-én közzétett írása szerint a hagyományos értékelések elsősorban azokat a kockázatokat mérik, amelyeket a fejlesztők már előre meg tudtak határozni. A produkciós ügynökök közben olyan problémákat is létrehozhatnak, amelyek nem szerepelnek az értékelési készletben.

Ilyen lehet, ha egy eszköz hibás argumentumot kap, egy újrapróbálkozási ciklus többletköltséget okoz előrelépés nélkül, vagy az ügynök helyesnek tűnő végső választ ad annak ellenére, hogy a kért művelet valójában nem történt meg.

Az ügynök pályája, vagyis a trajectory, a kérés és a kontextus mellett a modellhívásokat, a keresést, az eszközhívásokat és azok válaszait, a hibákat, az újrapróbálkozásokat, az engedélykéréseket, az állapotváltozásokat, a létrehozott eredményeket és a végső választ is magában foglalja. Az Arize szerint a produkció megbízhatósága ezért nem ítélhető meg kizárólag az utolsó válasz alapján.

A Signal a futások között keres mintázatokat

Az Arize egy kontrollált benchmarkban hét modellt futtatott ugyanazon az ügynöki keretrendszeren, 19 GitHub-műveleti feladattal, modellenként tíz alkalommal. A helyességi eredmény 79,6 és 85,1 százalék között maradt, miközben a késleltetés, az eszközhívások száma, az újrapróbálkozások és az időtúllépés kockázata jóval nagyobb eltéréseket mutatott. A cég tanulsága szerint a végső válasz pontszáma hasonlónak mutathat rendszereket, miközben a működésük költsége és hibakitettsége jelentősen eltér.

A Signal az Arize AX része, és a vállalat leírása szerint folyamatosan működő AI-munkatársként vizsgálja a produkciós nyomokat. Ütemezetten ellenőrzi a futásokat, összekapcsolja a hasonló eseteket, nyilvántartja a korábban azonosított problémákat, majd rangsorolt vizsgálati jelentést készít.

A jelentés összefoglalót, valószínűsíthető kiváltó okot, hatást, bizonyítékokat és következő lépésre vonatkozó javaslatot tartalmazhat. Az Arize szerint a rendszer a releváns eszközhívásokat, kereséseket, hibákat, újrapróbálkozásokat és eredményeket is figyelembe veszi, így a mérnököknek nem egy véletlenszerű nyomból kell kiindulniuk.

A felfedezett hibából regressziós teszt lehet

Az Arize négy értékelési réteget különít el. A kódalapú értékelők az egyértelmű feltételeket, például a sémákat, a kötelező lépéseket és az állapotváltozásokat ellenőrzik. Az LLM-alapú bírák stabil szempontrendszerrel vizsgálhatják a megalapozottságot, a relevanciát vagy az utasítások követését. Az Agent-as-a-Judge összetett, több lépésből álló viselkedést elemezhet, míg a Signal a produkcióban ismétlődő és újonnan megjelenő mintázatokat keresi.

A Signal és az Agent-as-a-Judge az Arize AX szerint kiegészíti egymást. A Signal azt mutatja meg, mely mintázatok fontosak a produkciós futások nagyobb csoportjában, az Agent-as-a-Judge pedig összetett ítéletet alkalmazhat egy-egy futás nyomaira.

Amikor egy hiba ismertté válik, a csapat reprezentatív példákat adhat egy adatkészlethez, meghatározhatja az elvárt viselkedést, majd kódalapú értékelőt, LLM-bírót vagy Agent-as-a-Judge vizsgálatot rendelhet hozzá. A fejlesztők ezután a rögzített példákon összevetik az alapállapotot és a jelölt javítást, figyelve többek között a válaszokra, az eszközhasználatra, a keresésre, a késleltetésre, a költségre, a pályára és az értékelési eredményekre.

Az Arize ezeket az adatkészleteket „élő tesztfixturesként” írja le, amelyek a produkciós hibák újabb példáival bővülhetnek. A folyamatban azonban továbbra is szükség van mérnöki munkára: az emberek választják ki a példákat, határozzák meg az elvárt viselkedést, állítják be az értékeléseket, és döntenek arról, hogy egy módosítás kiadható-e.

Kapcsolódó hírek

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása
Kutatás2026. október 2.

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása

A promptok gyorsítótárazása csökkentheti az ismétlődő bemenetek feldolgozásának költségét, de az Arize AI tesztje szerint a magas cache újraolvasási arány önmagában nem…

Az Anthropic Claude-ja éles ügynökök nyomaiból épít teszteket
Fejlesztőknek2026. október 2.

Az Anthropic Claude-ja éles ügynökök nyomaiból épít teszteket

Az Anthropic Claude-ja két új paranccsal támogatja az AI-ügynökök tesztelését és fokozatos javítását. Az Arize AI szerint a módszer akkor válik igazán használhatóvá, ha…

Az Arize és a MongoDB együtt készítené fel az AI-ügynököket a termelésre
Cégek és üzlet2026. szeptember 30.

Az Arize és a MongoDB együtt készítené fel az AI-ügynököket a termelésre

Az Arize AI launch partnerként csatlakozik a MongoDB Atlas Agent Engine platformjához, hogy az AI-ügynökök futtatása mellett azok részletes megfigyelését és értékelését…