Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az AI-agent egyszer már megoldotta. De megteszi újra is?

2026. szeptember 15. 18:00Forrás: Hugging Face
Az AI-agent egyszer már megoldotta. De megteszi újra is?
Kép: Hugging Face

Egy AI-agent egyszeri sikeres teljesítménye még nem jelenti azt, hogy ugyanazt a feladatot újra is megbízhatóan megoldja. Az IBM Research az ismételt futások közötti eltérések mérésére és csökkentésére fejlesztett módszert az ALTK-Evolve rendszerhez.

A lényeg röviden
  • A GPT-4.1-re épülő ReAct-agent Mean@5 értéke 77,4 százalék, Pass^5 értéke 53,0 százalék volt.
  • A Consistency Analyzer a döntési pontok közötti változékonyságot vizsgálja.
  • Az ALTK-Evolve célzott irányelveket készít a bizonytalan lépések stabilizálására.
  • Az AppWorld tesztben a konzisztenciarés 24,4 százalékpontról 12,0 százalékpontra csökkent.
  • A Pass^5 értéke 53,0 százalékról 69,0 százalékra emelkedett.

Az átlagos pontosság elrejti az ismétlési problémát

Az IBM Research szeptember 15-én a Hugging Face-en bemutatott írásában arra hívta fel a figyelmet, hogy az AI-agentek teljesítményét gyakran olyan mutatóval értékelik, amely nem mutatja meg, mi történik ugyanazzal a feladattal több egymást követő futtatásban.

Az AppWorld tesztjeiben egy GPT-4.1-re épülő ReAct-agent öt ismétlés átlagában a feladatok 77,4 százalékát oldotta meg sikeresen. Mind az öt futásban azonban csak a feladatok 53,0 százalékánál volt sikeres. A két érték közötti 24,4 százalékpontos eltérést a kutatók konzisztenciarésnek nevezik.

A Mean@k mutató azt méri, hogy az agent átlagosan milyen arányban sikeres k futás során. A Passk ezzel szemben azt mutatja meg, hogy a feladatok mekkora részét oldja meg minden egyes ismétlésben. Ez különbözik a Pass@k értéktől, amely azt kérdezi, hogy legalább egy próbálkozás sikeres volt-e. Az IBM Research szerint a három mutató között mindig ez az összefüggés áll fenn: Passk ≤ Mean@k ≤ Pass@k.

A Consistency Analyzer a bizonytalan döntési pontokat keresi

Az IBM Research szerint az eltérés oka sok esetben az agent döntési folyamatának egyes, különösen bizonytalan lépéseiben keresendő. Ilyen döntés lehet például, hogy melyik API-t hívja meg, milyen argumentumot ad át, vagy megpróbálja-e újra a műveletet.

A Consistency Analyzer egy már rögzített munkamenet minden döntési pontját kontrollált újramintavételezéssel vizsgálja. Alapértelmezésben egy döntési ponthoz öt kimenetet kér egyetlen modellhívásban, majd méri, mennyire változatosak a válaszok. A folyamat döntési lépésenként egy további modellhívást igényel, egyszer, offline. A rendszer a korábban rögzített kontextust játssza vissza, és nem indít új eszközhívásokat, környezeti interakciókat vagy teljes feladatfuttatást.

A módszer feketedobozos, vagyis nem igényel hozzáférést a modell logitjaihoz vagy belső működéséhez. Egyetlen rögzített nyomvonalból képes azonosítani azokat a pontokat, ahol a modell kis eltérés hatására más döntést hozhat.

Az ALTK-Evolve irányelvekkel stabilizálja a működést

Az elemzés eredményeit az ALTK-Evolve használja fel. A rendszer az agent korábbi nyomvonalait újrahasznosítható irányelvekké alakítja, majd ezeket a következtetés, vagyis az inference során visszaadja az agentnek.

Az új, konzisztenciára vonatkozó irányelvek a megjelölt döntési pontokhoz készülnek. Az IBM Research példája egy olyan AppWorld-feladat, amelyben az agentnek egy SimpleNote-jegyzet alapján kellett megszámolnia a teendőlistában elkészült elemeket. A létrehozott irányelvek szerint a jelöléseket sor elejéhez kötött reguláris kifejezéssel kell keresni, továbbá a keresési eredményeket több találat ellenőrzésével és a megfelelő jegyzet azonosításával kell validálni.

A kutatók szerint ezek az irányelvek nem egyetlen feladatra szabott apróságokat rögzítenek. Olyan bizonytalan döntési helyzeteket céloznak, amelyek több AppWorld-feladatban is előfordulhatnak.

A tesztben csökkent a rés, miközben az átlagos pontosság javult

Az értékelést az AppWorld test_normal részén, 168 feladaton végezték, GPT-4.1-re épülő ReAct-agenttel. Feladatonként egyetlen kiinduló nyomvonalból készítettek konzisztencia-irányelveket, majd öt új futásban tesztelték a rendszert.

Az összesített Pass5 érték 53,0 százalékról 69,0 százalékra emelkedett, míg a Mean@5 77,4 százalékról 81,0 százalékra nőtt. Ennek eredményeként a konzisztenciarés 24,4 százalékpontról 12,0 százalékpontra szűkült. Az IBM Research szerint a korábban inkonzisztens feladatok közel egyharmada olyan feladattá vált, amelyet az agent mind az öt futásban sikeresen teljesített.

A javulás a közepes és nehéz feladatoknál volt a legnagyobb relatív értelemben. A közepes nehézségű feladatoknál 22,9 százalékpontos, a nehéz feladatoknál 14,3 százalékpontos, a könnyű feladatoknál pedig 12,2 százalékpontos növekedést mértek. A kutatás alapján az agentek értékelésében külön kell kezelni azt, hogy egy rendszer átlagosan mire képes, és azt, hogy ugyanazt a feladatot mennyire következetesen teljesíti.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kutatás2026. október 1.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és…

Az Apple kutatása szerint kevésbé számít az ügynökök körítése
Kutatás2026. október 1.

Az Apple kutatása szerint kevésbé számít az ügynökök körítése

Az Apple kutatói szerint a gépi tanulási feladatokra fejlesztett ügynököknél az alapul szolgáló nagy nyelvi modell teljesítménye fontosabb lehet az ügynök köré épített…

Az Apple SCLATE rendszere hónapnyi ügynöki munkát órákra sűrít
Kutatás2026. szeptember 30.

Az Apple SCLATE rendszere hónapnyi ügynöki munkát órákra sűrít

Az Apple bemutatta a SCLATE nevű végrehajtási réteget, amely a folyamatos tanulásra képes AI-ügynökök képzését és értékelését támogatja. A rendszer egy hónapnyi…