Az AI-agent egyszer már megoldotta. De megteszi újra is?

Egy AI-agent egyszeri sikeres teljesítménye még nem jelenti azt, hogy ugyanazt a feladatot újra is megbízhatóan megoldja. Az IBM Research az ismételt futások közötti eltérések mérésére és csökkentésére fejlesztett módszert az ALTK-Evolve rendszerhez.
- A GPT-4.1-re épülő ReAct-agent Mean@5 értéke 77,4 százalék, Pass^5 értéke 53,0 százalék volt.
- A Consistency Analyzer a döntési pontok közötti változékonyságot vizsgálja.
- Az ALTK-Evolve célzott irányelveket készít a bizonytalan lépések stabilizálására.
- Az AppWorld tesztben a konzisztenciarés 24,4 százalékpontról 12,0 százalékpontra csökkent.
- A Pass^5 értéke 53,0 százalékról 69,0 százalékra emelkedett.
Az átlagos pontosság elrejti az ismétlési problémát
Az IBM Research szeptember 15-én a Hugging Face-en bemutatott írásában arra hívta fel a figyelmet, hogy az AI-agentek teljesítményét gyakran olyan mutatóval értékelik, amely nem mutatja meg, mi történik ugyanazzal a feladattal több egymást követő futtatásban.
Az AppWorld tesztjeiben egy GPT-4.1-re épülő ReAct-agent öt ismétlés átlagában a feladatok 77,4 százalékát oldotta meg sikeresen. Mind az öt futásban azonban csak a feladatok 53,0 százalékánál volt sikeres. A két érték közötti 24,4 százalékpontos eltérést a kutatók konzisztenciarésnek nevezik.
A Mean@k mutató azt méri, hogy az agent átlagosan milyen arányban sikeres k futás során. A Passk ezzel szemben azt mutatja meg, hogy a feladatok mekkora részét oldja meg minden egyes ismétlésben. Ez különbözik a Pass@k értéktől, amely azt kérdezi, hogy legalább egy próbálkozás sikeres volt-e. Az IBM Research szerint a három mutató között mindig ez az összefüggés áll fenn: Passk ≤ Mean@k ≤ Pass@k.
A Consistency Analyzer a bizonytalan döntési pontokat keresi
Az IBM Research szerint az eltérés oka sok esetben az agent döntési folyamatának egyes, különösen bizonytalan lépéseiben keresendő. Ilyen döntés lehet például, hogy melyik API-t hívja meg, milyen argumentumot ad át, vagy megpróbálja-e újra a műveletet.
A Consistency Analyzer egy már rögzített munkamenet minden döntési pontját kontrollált újramintavételezéssel vizsgálja. Alapértelmezésben egy döntési ponthoz öt kimenetet kér egyetlen modellhívásban, majd méri, mennyire változatosak a válaszok. A folyamat döntési lépésenként egy további modellhívást igényel, egyszer, offline. A rendszer a korábban rögzített kontextust játssza vissza, és nem indít új eszközhívásokat, környezeti interakciókat vagy teljes feladatfuttatást.
A módszer feketedobozos, vagyis nem igényel hozzáférést a modell logitjaihoz vagy belső működéséhez. Egyetlen rögzített nyomvonalból képes azonosítani azokat a pontokat, ahol a modell kis eltérés hatására más döntést hozhat.
Az ALTK-Evolve irányelvekkel stabilizálja a működést
Az elemzés eredményeit az ALTK-Evolve használja fel. A rendszer az agent korábbi nyomvonalait újrahasznosítható irányelvekké alakítja, majd ezeket a következtetés, vagyis az inference során visszaadja az agentnek.
Az új, konzisztenciára vonatkozó irányelvek a megjelölt döntési pontokhoz készülnek. Az IBM Research példája egy olyan AppWorld-feladat, amelyben az agentnek egy SimpleNote-jegyzet alapján kellett megszámolnia a teendőlistában elkészült elemeket. A létrehozott irányelvek szerint a jelöléseket sor elejéhez kötött reguláris kifejezéssel kell keresni, továbbá a keresési eredményeket több találat ellenőrzésével és a megfelelő jegyzet azonosításával kell validálni.
A kutatók szerint ezek az irányelvek nem egyetlen feladatra szabott apróságokat rögzítenek. Olyan bizonytalan döntési helyzeteket céloznak, amelyek több AppWorld-feladatban is előfordulhatnak.
A tesztben csökkent a rés, miközben az átlagos pontosság javult
Az értékelést az AppWorld test_normal részén, 168 feladaton végezték, GPT-4.1-re épülő ReAct-agenttel. Feladatonként egyetlen kiinduló nyomvonalból készítettek konzisztencia-irányelveket, majd öt új futásban tesztelték a rendszert.
Az összesített Pass5 érték 53,0 százalékról 69,0 százalékra emelkedett, míg a Mean@5 77,4 százalékról 81,0 százalékra nőtt. Ennek eredményeként a konzisztenciarés 24,4 százalékpontról 12,0 százalékpontra szűkült. Az IBM Research szerint a korábban inkonzisztens feladatok közel egyharmada olyan feladattá vált, amelyet az agent mind az öt futásban sikeresen teljesített.
A javulás a közepes és nehéz feladatoknál volt a legnagyobb relatív értelemben. A közepes nehézségű feladatoknál 22,9 százalékpontos, a nehéz feladatoknál 14,3 százalékpontos, a könnyű feladatoknál pedig 12,2 százalékpontos növekedést mértek. A kutatás alapján az agentek értékelésében külön kell kezelni azt, hogy egy rendszer átlagosan mire képes, és azt, hogy ugyanazt a feladatot mennyire következetesen teljesíti.
Hugging Face: Your Agent Aced the Task. Will It Do It Again?


