Új módszerrel tanítanák az AI-t, hogy jobban kezelje a hosszú feladatokat

A Berkeley BAIR kutatói ABBEL néven olyan keretrendszert mutattak be, amely a teljes beszélgetési előzmény helyett természetes nyelvű „hiedelmi állapotokkal” segíti a nagy nyelvi modelleket hosszú feladatok végrehajtásában. A módszer a tömörített információ tartalmát külön is értékeli, így a kutatók szerint hatékonyabban tanítható, mint a hagyományos összefoglalás.
- Az ABBEL a teljes előzmény helyett természetes nyelvű hiedelmi állapotokat használ.
- A belief grading külön értékeli, hogy mennyi hasznos információ marad meg.
- A CollabBench tesztben az ABBEL-rec-BG 50 tanítási lépést igényelt 100 helyett.
- A módszer kisebb csúcskontextust használt, mint a teljes kontextusú modell.
- A Berkeley BAIR több hosszú feladaton vizsgálta az ABBEL működését.
A hosszú interakciók problémája
A Berkeley BAIR 2026. július 26-án közzétett tanulmánya szerint a nagy nyelvi modellek nem tudják korlátlanul a teljes interakciós előzményt a kontextusban tartani. Ez különösen az olyan feladatoknál jelent problémát, amelyek több száz vagy akár több ezer lépésből állnak, például a szoftverfejlesztésben.
Az eddigi gyakori megoldás az összefoglalás, más néven kontextustömörítés volt. A kutatók szerint ez rövidebb és értelmezhetőbb kontextust ad, ugyanakkor teljesítményveszteséget okozhat. A Berkeley BAIR a Cursor composer 2.5 modelljét és a Grandcode rendszerét is példaként említi olyan megoldásokra, amelyeknél szükség van a kontextus összefoglalására.
A tanulmányban bemutatott Combination Lock tesztben az összefoglalást használó modellek a megerősítéses tanulás során javultak, de nem érték utol a teljes kontextussal működő modelleket. A szerzők szerint a saját összefoglalás megtanulása önmagában összetettebbé teszi a tanulási feladatot.
Az ABBEL működése
Az ABBEL a korábbi összefoglaló helyett explicit, természetes nyelvű hiedelmi állapotokat használ. Ezek a modell aktuális munkamemóriáját jelentik, és a teljes előzmény helyét veszik át. A modell egy korábbi hiedelmi állapotból, a végrehajtott műveletből és az új megfigyelésből hozza létre a következő állapotot. Ezután a következő művelet kiválasztásakor már csak erre a frissített állapotra támaszkodik.
A módszer egyik központi eleme a belief grading, vagyis a hiedelmi állapotok értékelése. A rendszer jutalmazza azokat az állapotokat, amelyekből a modell képes rekonstruálni a legutóbbi megfigyeléshez szükséges információkat. A kutatók ezt egy automatikus kódolóhoz és dekódolóhoz hasonlítják, ahol a hiedelmi állapot az információs kód.
Programozási feladatoknál például az lehet jó állapot, amely rövid, de továbbra is elegendő információt tartalmaz a git diff rekonstruálásához. Ha egy területen nehéz kézzel meghatározni a megfelelő szabályokat, az ABBEL általános, rekonstrukción alapuló értékelést használhat.
Kisebb memóriaigény, gyorsabb tanítás
A CollabBench együttműködéses programozási környezetben az ABBEL rekonstrukciós értékeléssel a Berkeley BAIR szerint körülbelül 50 százalékkal csökkentette a teljes kontextusú modellekhez képest fennmaradó teljesítménykülönbséget. A módszer 50 tanítási lépés alatt ért el eredményt, miközben a belief grading nélküli változatnak 100 lépésre volt szüksége.
A tesztpasszolási arány a teljes kontextusú modellnél 0,52±0,02, az ABBEL belief grading nélküli változatánál 0,46±0,02, az ABBEL-rec-BG változatánál pedig 0,48±0,01 volt. A sikerességi arány rendre 0,39±0,02, 0,31±0,02 és 0,36±0,01 lett.
A csúcskontextus tokenhossza a teljes kontextusú beállításnál 14,08±0,55, az ABBEL nélküli értékelésnél 4,20±0,37, az ABBEL-rec-BG esetén pedig 6,01±0,33 volt, a tanulmány táblázatának skáláján. A Combination Lock feladatban a tartományi tudásra építő értékeléssel az ABBEL megközelítette, illetve bizonyos esetekben meghaladta a teljes kontextusú modellek tanulási hatékonyságát.
Mit jelenthet ez az AI-asszisztensek számára?
A kutatók egy többcélú kérdésválaszolási környezetben azt is bemutatták, hogy a hiedelmi állapot hosszának külön büntetése csökkentheti a memóriahasználatot jelentős teljesítményromlás nélkül. Ez eltérhet attól, amit a gondolkodási folyamat hosszának büntetésénél figyeltek meg.
Az ABBEL célja így olyan tömör munkamemória létrehozása, amely kisebb erőforrásigény mellett megőrzi a hosszú feladatokhoz szükséges információt. A Berkeley BAIR szerint az explicit hiedelmi állapotok később többügynökös kommunikációban, a felfedezés irányításában és további memória-megoldások kiegészítéseként is használhatók.
Berkeley BAIR: Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction


