Az IBM kutatói szerint az AI-ügynök memóriáját modellenként kell adagolni

Az IBM Research kutatói 2026. augusztus 18-án a Hugging Face-en tették közzé elemzésüket arról, mennyi memóriát érdemes adni egy AI-ügynöknek. A nyolc modellen végzett vizsgálat szerint az ALTK-Evolve hatása erősen függ a modell képességeitől.
- Az IBM Research nyolc modellen vizsgálta az ALTK-Evolve ügynöki memóriát.
- A módszer irányelveket bányász korábbi futásokból, modell-súlyfrissítés és emberi annotáció nélkül.
- A DeepSeek-V3.2 teljes irányelvkészlettel 9,5 százalékpontos TGC-javulást ért el.
- A gpt-oss-120b curated retrieval mellett 16,1 százalékponttal javult, 5 százalékos tokennövekedéssel.
- A GLM-5 a kutatók futtatásaiban nem mutatott mérhető javulást.
Nem kapcsoló, hanem adagolási kérdés
Az IBM Research bejegyzése szerint az ügynöki memória akkor működik jól, ha a modellhez igazítják. A kutatók az ALTK-Evolve módszert vizsgálták, amely az ügynök korábbi futásaiból újrahasznosítható irányelveket állít elő, majd ezeket következtetéskor visszaadja az ügynöknek. A módszer nem frissíti a modell súlyait, és nem használ emberi annotációt.
A cikk fő állítása, hogy az ügynöki memória nem egyszerűen bekapcsolható funkció, hanem a modellhez kalibrálandó mennyiség. A vizsgálatban nyolc modell szerepelt, a 30B sűrű modelltől a zárt, élvonalbeli rendszerekig. A kutatók három mintázatot azonosítottak.
Az erős, még tartalékkal rendelkező modellek a teljes irányelvkészletből profitáltak a legtöbbet. Ide tartozott például a DeepSeek-V3.2 (671B MoE), amely a teljes, saját futásokból bányászott irányelvkészlettel 9,5 százalékponttal javította a feladatteljesítést. A kisebb vagy gyengébb modellek ezzel szemben túlterhelődhetnek a nagy irányelvkészlettől. Náluk egy tömör, nagy megbízhatóságú alap és néhány feladatspecifikusan visszakeresett irányelv működött a legjobban.
A gpt-oss-120b (117B MoE) esetében ez a szelektív megközelítés 16,1 százalékpontos javulást hozott, miközben a teljes irányelvkészlet kevesebb javulást adott, és körülbelül 50 százalékkal több tokent használt. A harmadik mintázatot a kutatók telítettnek nevezik: ezeknél a modelleknél nem mértek javulást. A GLM-5 (745B MoE) ebbe a csoportba került a futtatásaikban.
Hogyan tanul az ALTK-Evolve a modell módosítása nélkül
A bejegyzés hangsúlyozza, hogy a memória itt nem korábbi beszélgetések visszajátszását jelenti. A rendszer az ügynök saját korábbi trajektóriáiból irányelveket készít: olyan stratégiákat, amelyek működtek, olyan hibákat, amelyeket el kell kerülni, valamint szélső esetekre vonatkozó tanulságokat.
A folyamat négy lépésből áll. Az ügynök feladatokat próbál megoldani és trajektóriákat hoz létre. Az ALTK-Evolve a sikeres és sikertelen futásokból viselkedési irányelveket nyer ki. Ezeket újrahasználható készletté rendezi. Következtetéskor az ügynök vagy a teljes irányelvkészletet kapja meg, vagy annak egy feladathoz illeszkedő válogatását.
Az IBM Research szerint a tanulási kör így nem a modell belsejét változtatja meg, hanem azt az útmutatást, amely az ügynök rendelkezésére áll. A kutatók ezt tartják az egyik oknak arra, hogy a megközelítés olcsón bevezethető és hordozható legyen a vizsgált nyolc modell között.
AppWorld-tesztek: TGC és SGC alapján mért javulás
A kutatók az AppWorld környezetben értékelték a módszert. Ez 585 többlépéses feladatot tartalmaz, ebből 168 a test_normal, 417 a test_challenge részben szerepel, 9 szimulált alkalmazáson át, például naptárakon, üzenetküldésen és fizetéseken.
Két mérőszámot használtak. A TGC, vagyis Task Goal Completion azt méri, hogy az ügynök teljesen megoldja-e az adott feladatot. Az SGC, vagyis Scenario Goal Completion szigorúbb mérce, mert azt nézi, hogy egy forgatókönyv minden variánsa átmegy-e.
A baseline konfigurációban az ügynök nem kapott memóriát. A teljes irányelvkészlet esetén minden bányászott irányelvet minden ReAct lépésben beillesztettek. A curated retrieval konfigurációban ugyanebből az irányelvkészletből egy fix, nagy megbízhatóságú mag és néhány feladathoz kapcsolódóan visszakeresett irányelv került a kontextusba. A cikk szerint az irányelveket csak az AppWorld tanító részéből bányászták, tesztadat nem került az építésükbe.
A test_normal részen a gpt-oss-120b baseline TGC/SGC értéke 39,9/21,4 volt, a legjobb memóriás beállítással 56,0/37,5 lett, curated retrieval mellett. A DeepSeek-V3.2 79,8/64,3-ról 89,3/80,4-re javult a teljes irányelvkészlettel. A Claude Opus 4.6 90,5/87,5-ről 94,6/94,6-re, a GPT-5.5 pedig 92,3/82,1-ről 95,2/89,3-ra javult, mindkettőnél a teljes irányelvkészlet volt a legjobb konfiguráció. A GLM-5 értéke 87,5/80,4 maradt, a mért javulás 0,0 volt.
Költségben a válogatott memória lehet a kedvezőbb
A teljes irányelvkészlet minden ReAct lépésnél növeli a bemeneti mennyiséget, mert az irányelveket újra elküldik. A tokenhasználat ezért fontos gyakorlati kérdés volt a vizsgálatban.
A DeepSeek-V3.2 baseline átlagos tokenhasználata feladatonként 148K volt, teljes irányelvkészlettel 263K, ami 78 százalékos többlet. A gpt-oss-120b teljes irányelvkészlettel 110K-ról 166K-ra nőtt, ez 51 százalékos többlet. Ugyanennél a modellnél a curated retrieval 110K-ról csak 116K-ra emelte a feladatonkénti átlagot, ami 5 százalékos többlet.
A kutatók szerint a gpt-oss-120b példája azt mutatja, hogy a válogatott visszakeresés egyszerre lehet pontosabb és olcsóbb: 16,1 százalékpontos TGC-javulást ért el mindössze 5 százalékos tokennövekedés mellett. A DeepSeek esetében a cikk szerint a memóriával nagyjából ugyanannyi ReAct lépés futott, mint nélküle, átlagosan körülbelül 18, illetve 19, így a többletköltséget a bemeneti tokenek növekedése okozta, nem hosszabb trajektóriák.
A bejegyzés a prompt-gyorsítótárazást is fontos hatékonysági eszközként említi, mert az irányelvkészlet statikus része lépésről lépésre azonos lehet. A szerzők szerint a gyorsítótárbarát prompttervezés, vagyis a közös irányelvprefix stabilan tartása, mérnöki figyelmet érdemel.
Mit jelent ez a felhasználóknak és a piacnak
A kutatás gyakorlati üzenete az, hogy az ügynöki memória bevezetésekor nem elég egyetlen általános beállítást választani. A forrás alapján a megfelelő stratégia függ a modell képességeitől, a benchmarkon meglévő mozgástértől, a kontextusablak méretétől, az architektúrától, az irányelvek minőségétől és a feladateloszlástól. A szerzők hozzáteszik, hogy e tényezők szétválasztása még folyamatban van.
Azoknál a rendszereknél, ahol a modellnek még vannak célozható hibamódjai, a memória a szigorúbb SGC mérőszámon is jelentős javulást hozhatott. A DeepSeek-V3.2 SGC-je 16,1 százalékponttal nőtt, miközben TGC-ben 9,5 százalékpont volt a javulás. A GPT-5.5 és a Claude Opus 4.6 a TGC alapján a felső tartomány közelében voltak, mégis 7,2, illetve 7,1 százalékpontos SGC-javulást értek el.
A cikkből az következik, hogy vállalati vagy termékbe épített ügynököknél a memória mennyiségét és szállítási módját érdemes külön mérni. Erősebb modelleknél a teljes irányelvkészlet lehet kedvező, gyengébb modelleknél a kompakt mag és a feladatspecifikus visszakeresés adhat jobb pontosságot alacsonyabb tokenköltség mellett.
Hugging Face: How Much Memory Does Your Agent Actually Need?

