Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az IBM szerint az ALTK-Evolve kevesebb tokennel éri utol az ACE-t

2026. augusztus 11.Forrás: Hugging Face
Az IBM szerint az ALTK-Evolve kevesebb tokennel éri utol az ACE-t
Kép: Hugging Face

Az IBM Research 2026. augusztus 11-én a Hugging Face-en közölt bejegyzésben hasonlította össze ALTK-Evolve nevű megközelítését az ACE, vagyis Agentic Context Engineering rendszerrel. A cég szerint mindkettő az AI-ügynökök saját korábbi futásaiból tanul, de az ALTK-Evolve kevesebb tokent küld a modellnek következtetés közben.

A lényeg röviden
  • Az IBM Research 2026. augusztus 11-én közölte az ALTK-Evolve és az ACE összehasonlítását.
  • Mindkét rendszer az ügynök saját korábbi trajektóriáiból készít újrahasznosítható tanulságokat.
  • Az ACE minden lépésnél a teljes playbookot adja át, az ALTK-Evolve feladathoz és modellhez igazítja a kézbesítést.
  • DeepSeek-V3.2 modellen az ALTK-Evolve 89.3 TGC és 80.4 SGC eredményt ért el 263K token/feladat mellett.
  • gpt-oss-120b modellen az ALTK-Evolve 116K token/feladat mellett ért el 56.0 TGC és 37.5 SGC eredményt.

Ügynökmemória emberi címkék és súlyfrissítés nélkül

Az IBM Research bejegyzése szerint az ALTK-Evolve és az ACE ugyanarra az alapötletre épít: egy AI-ügynök korábbi feladatmegoldási útvonalaiból, vagyis trajektóriáiból újrahasznosítható tanulságokat készít. Ezeket a tanulságokat később, következtetéskor visszaadják a modellnek, anélkül, hogy a modell súlyait frissítenék vagy emberi címkéket használnának.

A szerzők szerint az ilyen ügynökök sokszor nem azért hibáznak több lépéses, reális feladatokban, mert hiányzik belőlük a szükséges tudás. A példák között szerepel számla felosztása, dal keresése és rendelés egyeztetése kilenc szimulált alkalmazáson keresztül. A hibák inkább abból adódhatnak, hogy az ügynök rosszul lapoz egy API-ban, rossz személyt azonosít, vagy értéket ad vissza akkor is, amikor erre nem kérték.

Az IBM Research az ALTK-Evolve és az ACE közös pontjaként azt emeli ki, hogy egyik rendszer sem akarja rövid, általános összefoglalóvá tömöríteni az ügynök által megszerzett tapasztalatot. Az ACE egy átfogó, folyamatosan fejlődő playbookban tartja a tanulságokat, minden ponthoz hasznos és káros számlálóval. Az ALTK-Evolve ezzel szemben külön visszakereshető irányelvekbe rendezi őket, és minden irányelvhez támogatási számot rendel, amely azt mutatja, hány független epizód hozta létre az adott tanulságot.

A különbség a kézbesítésben van

A bejegyzés szerint a két rendszer fő eltérése abban áll, hogyan építik fel és hogyan adják át a memóriát a modellnek. Az ACE egy Generator, Reflector, Curator ciklusban növeszt egyetlen playbookot, inkrementális módosításokkal és beágyazásalapú deduplikációval.

Az ALTK-Evolve ezzel szemben közel azonos tanulságokat klaszterez, majd a klaszteren belül összevonja őket úgy, hogy a támogatási szám megmaradjon. Ha több tanulság egyesül, a megmaradó irányelv örökli az összevont támogatási számot. Az IBM Research szerint a rendszer tipizált irányelveket is kinyer, stratégia, helyreállítás és optimalizálás kategóriákban, oksági hozzárendeléssel és az eredeti trajektóriához kötött eredettel, részfeladat szintjén.

A tokenköltség szempontjából a szerzők szerint a döntő eltérés a következtetéskori átadás. Az ACE minden lépésnél a teljes playbookot adja a modellnek, feladattól és modelltől függetlenül. Az ALTK-Evolve ehelyett egy kisebb, nagy támogatottságú fix magot használ, amelyet az adott feladathoz kiválasztott néhány irányelv egészíthet ki. A kiválasztás történhet koszinusz hasonlósággal vagy LLM-vezérelt, prioritással súlyozott módon. Ha a modell képes kezelni, a teljes konszolidált készlet is átadható.

AppWorld mérés: jobb vagy hasonló pontosság kevesebb tokenből

Az IBM Research az AppWorld benchmarkon, ugyanazzal az alap ReAct ügynökkel futtatta házon belül mindkét rendszert. A bejegyzés szerint DeepSeek-V3.2 modellen az ACE 80.4 TGC és 73.2 SGC eredményt ért el 634K token/feladat mellett, míg az ALTK-Evolve 89.3 TGC és 80.4 SGC eredményt 263K token/feladat mellett.

gpt-oss-120b modellen az ACE 54.8 TGC és 35.7 SGC eredményt kapott 777K token/feladat mellett. Az ALTK-Evolve 56.0 TGC és 37.5 SGC értéket ért el 116K token/feladat mellett. Az IBM Research szerint az erősebb modellen mindkét metrikában jobb eredményt értek el az ACE következtetési költségének nagyjából 40 százalékával. A gyengébb modellen a szerzők a 56.0 és 54.8 közötti különbséget pontosságban döntetlenközelinek nevezik, miközben a tokenköltség körülbelül hetede volt az ACE-ének.

A módszertani megjegyzések szerint az AppWorld test_normal készlet 168 feladatot tartalmazott. Az ügynök ReAct kódügynök volt, amely minden lépésben Pythont ír, a környezet pedig visszaadja a kimenetet. A TGC a Task Goal Completion, az SGC a Scenario Goal Completion rövidítése, utóbbi azt követeli meg, hogy egy forgatókönyv minden változata sikeres legyen. A memóriát csak train/dev adatokból bányászták, az eredmények egyszeri futások, pass@1 értékek.

A szerzők azt is közlik, hogy az ACE számait saját futtatásokból kapták, ugyanazokon az AppWorld felosztásokon és ugyanazokkal az alapmodellekkel, mint az ALTK-Evolve esetében, vagyis DeepSeek-V3.2 és gpt-oss-120b modellekkel. Az ACE tanulmánya másik alapmodellen, DeepSeek-V3.1-en közöl eredményeket, ezért az IBM Research szerint a saját futtatás kontrolláltabb összehasonlítást adott modell és tesztkörnyezet szerint.

Mit jelent ez a felhasználóknak és a piacnak?

A bejegyzésből az következik, hogy az ügynökmemória hasznossága nem csak azon múlik, milyen tanulságokat őriz meg a rendszer, hanem azon is, mennyit ad át belőlük a modellnek egy adott feladatnál. Az IBM Research állítása szerint az ALTK-Evolve kalibrált kézbesítése ugyanazokat a tanulságokat kisebb promptterheléssel tudja hasznosítani.

Ez gyakorlati szempontból azért fontos, mert az ügynökök több lépéses használatánál a következtetéskori tokenmennyiség gyorsan nőhet. A forrásban közölt mérések alapján az ALTK-Evolve a vizsgált AppWorld beállításokban kevesebb tokennel ért el az ACE-hez hasonló vagy annál jobb eredményeket.

Az IBM Research szerint a gyengébb modellen különösen számított a szelektív visszakeresés, mert a nagy kontextus inkább túlterhelheti a modellt, mint segítené. A szerzők azt írják, hogy az ALTK-Evolve könyvtár tartalmazza a cikkben használt kinyerési, konszolidációs és visszakeresési folyamatot, a teljes módszer és az ablatív vizsgálatok pedig a technikai jelentésben olvashatók.

Kapcsolódó hírek

Kutatás
Kutatás2026. augusztus 28.

IBM Research: Granite 4.2 natív érvelést hoz vállalati ügynökökbe

Az IBM Research oldalán 2026. augusztus 28-i dátummal megjelent bejegyzéshez kapcsolódó forrásszöveg több friss IBM Research-hírt sorol fel. Ezek közül az AI-területet…

Modellek
Modellek2026. augusztus 25.

IBM Research: Granite 4.2 natív érvelést hoz vállalati ügynököknek

Az IBM Research 2026. augusztus 25-i bejegyzésének címe szerint a Granite 4.2 natív érvelést hoz a vállalati ügynökökbe. A rendelkezésre álló forrásszöveg azonban nem…

Az IBM kutatói szerint az AI-ügynök memóriáját modellenként kell adagolni
Kutatás2026. augusztus 18.

Az IBM kutatói szerint az AI-ügynök memóriáját modellenként kell adagolni

Az IBM Research kutatói 2026. augusztus 18-án a Hugging Face-en tették közzé elemzésüket arról, mennyi memóriát érdemes adni egy AI-ügynöknek. A nyolc modellen végzett…