A modellek átvehetik az ügynöki keretek egy részét

Egy új kutatás szerint az ügynöki keretek, vagyis a modelleket eszközökkel és szabályokkal segítő rendszerek egyes részei közvetlenül betaníthatók a modellbe. A keretek ettől nem tűnnek el, viszont minden új modellgenerációval változhat a szerepük.
- A Harness-Zero a keret működését javított futásokon keresztül tanította be a Qwen3.5-9B modellbe.
- A finomhangolt modell átlagos feladatsikere 21 ponttal nőtt.
- Kémiában a kerettel működő változat 8 ponttal jobban teljesített.
- Az eszközök, adatok, felhasználók és környezetek továbbra is a keretek fontos részei maradhatnak.
- Az új modellek miatt a kereteket rendszeresen felül kell vizsgálni és át kell alakítani.
A Harness-Zero kísérletben a modell kapta meg a keret tudását
Az Arize AI által ismertetett Harness-Zero kutatásban Haoran Ye és a Pekingi Egyetem munkatársai azt vizsgálták, hogyan lehet egy speciális ügynöki keret működését modellbe sűríteni. A módszer lényege, hogy a modellt olyan viselkedésre tanítják, amelyet korábban egy különálló keret biztosított.
A kutatók először egy kis modellt, a Qwen3.5-9B-t látták el egy úgynevezett fejlesztett kerettel. Egy Kimi K3 által működtetett automatizált folyamat elemezte, hol hibázik a modell a feladatok során, majd egyedi eszközökkel, kockázatos műveleteket blokkoló köztes szabályokkal, készségfájlokkal és memóriával egészítette ki a rendszert.
Ezután a keret segítségével tanítási adatokat készítettek. Egy erősebb modell, a GPT-5.6 Sol minden lépést ellenőrzött. Ha a kis modell jó javaslatot tett, változtatás nélkül továbbengedte, eltérés esetén pedig a lehető legkisebb javítást hajtotta végre. A kutatók a kis modellt ezekkel a javított futásokkal finomhangolták, majd eltávolították a fejlesztett keretet és az ellenőrző modellt.
A javított futások hozták a legnagyobb eredményt
A finomhangolt modellt táblázatszerkesztési, több alkalmazást használó és kémiai feladatokon vetették össze az eredeti modellel, illetve a teljes kerettel működő változattal. A modell átlagos feladatsikere 21 ponttal nőtt a tanítatlan elődhöz képest. Az Arize AI beszámolója szerint ez nagyobb javulás volt annál, mint amit az eredeti modell a teljes fejlesztett keret használatával elért.
A módszer azonban nem minden területen működött egyformán. Kémiában, ahol azt kellett megjósolni, mely molekulákból állítható elő egy célvegyület, a kerettel működő változat 8 ponttal jobban teljesített. A keret itt kémiai ismereteket, jelöltvegyületek előállítására szolgáló logikát és molekulákat ellenőrző eszközt biztosított.
A kutatók szerint az olyan lépésről lépésre követhető eljárások, mint az ellenőrzés szerkesztés előtt vagy a végeredmény hitelesítése, könnyebben betaníthatók. A mélyebb szaktudás és a hosszú kontextus kezelése kevésbé adható át teljesen a modellnek.
A tanítás módja szintén döntőnek bizonyult. Az erősebb modell saját sikeres futásai, a keretben elvégzett futások és a helyes válaszokat kapó ellenőrző modell adatai nem javították érdemben a teljesítményt, vagy túltanuláshoz vezettek. A kis modellhez hasonló, de kisebb javításokat tartalmazó futások viszont 21 pontos növekedést eredményeztek.
A keretek kisebbek lehetnek, de nem válnak feleslegessé
Az Arize AI szerint a modellek idővel átvehetik a keretekben rögzített, általánosítható eljárások egy részét. Ez összhangban áll azzal a korábbi megfigyeléssel, hogy a kézzel kódolt tudás rövid távon hasznos lehet, de a tanulásra és keresésre épülő általános módszerek később felülmúlhatják.
A felhasználók és fejlesztők számára ez azt jelenti, hogy továbbra is szükség lesz ügynöki keretekre, de ezeknek folyamatosan változniuk kell. A keretben maradhatnak az adott alkalmazáshoz kötődő eszközök, adatok, felhasználók és környezetek, miközben az általánosabb működési szabályok átkerülhetnek a modellbe.
Az Arize által idézett példák szerint az ARC Prize ARC-AGI-3 eredményeiben a Gemini 3.8 Flash egyik kerettel 3,4-szer magasabb pontszámot ért el, mint egy másikkal. A jobb keret megőrizte a modell gondolkodási állapotát a kérések között, és tömörítette a hosszú beszélgetéseket. Ez olyan kontextuskezelési feladat, amelyet a Harness-Zero nem tudott teljesen betanítani.
Az Anthropic Opus 5.5 útmutatója közben arra utal, hogy bizonyos korábbi keretelemek veszíthetnek a jelentőségükből, például elhagyhatóvá válhatnak a fokozott gondolkodásra felszólító utasítások. Ugyanakkor új elemek is megjelenhetnek, például a hosszú futások leállását megelőző emlékeztetők és a több ügynököt használó rendszerek időkeretei. A keretek fejlesztése ezért várhatóan ismétlődő, részben automatizált folyamat lesz.
Arize AI: Are agent harnesses dying? What harness distillation changes


