Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A modellek átvehetik az ügynöki keretek egy részét

2026. szeptember 29.Forrás: Arize AI
A modellek átvehetik az ügynöki keretek egy részét
Kép: Arize AI

Egy új kutatás szerint az ügynöki keretek, vagyis a modelleket eszközökkel és szabályokkal segítő rendszerek egyes részei közvetlenül betaníthatók a modellbe. A keretek ettől nem tűnnek el, viszont minden új modellgenerációval változhat a szerepük.

A lényeg röviden
  • A Harness-Zero a keret működését javított futásokon keresztül tanította be a Qwen3.5-9B modellbe.
  • A finomhangolt modell átlagos feladatsikere 21 ponttal nőtt.
  • Kémiában a kerettel működő változat 8 ponttal jobban teljesített.
  • Az eszközök, adatok, felhasználók és környezetek továbbra is a keretek fontos részei maradhatnak.
  • Az új modellek miatt a kereteket rendszeresen felül kell vizsgálni és át kell alakítani.

A Harness-Zero kísérletben a modell kapta meg a keret tudását

Az Arize AI által ismertetett Harness-Zero kutatásban Haoran Ye és a Pekingi Egyetem munkatársai azt vizsgálták, hogyan lehet egy speciális ügynöki keret működését modellbe sűríteni. A módszer lényege, hogy a modellt olyan viselkedésre tanítják, amelyet korábban egy különálló keret biztosított.

A kutatók először egy kis modellt, a Qwen3.5-9B-t látták el egy úgynevezett fejlesztett kerettel. Egy Kimi K3 által működtetett automatizált folyamat elemezte, hol hibázik a modell a feladatok során, majd egyedi eszközökkel, kockázatos műveleteket blokkoló köztes szabályokkal, készségfájlokkal és memóriával egészítette ki a rendszert.

Ezután a keret segítségével tanítási adatokat készítettek. Egy erősebb modell, a GPT-5.6 Sol minden lépést ellenőrzött. Ha a kis modell jó javaslatot tett, változtatás nélkül továbbengedte, eltérés esetén pedig a lehető legkisebb javítást hajtotta végre. A kutatók a kis modellt ezekkel a javított futásokkal finomhangolták, majd eltávolították a fejlesztett keretet és az ellenőrző modellt.

A javított futások hozták a legnagyobb eredményt

A finomhangolt modellt táblázatszerkesztési, több alkalmazást használó és kémiai feladatokon vetették össze az eredeti modellel, illetve a teljes kerettel működő változattal. A modell átlagos feladatsikere 21 ponttal nőtt a tanítatlan elődhöz képest. Az Arize AI beszámolója szerint ez nagyobb javulás volt annál, mint amit az eredeti modell a teljes fejlesztett keret használatával elért.

A módszer azonban nem minden területen működött egyformán. Kémiában, ahol azt kellett megjósolni, mely molekulákból állítható elő egy célvegyület, a kerettel működő változat 8 ponttal jobban teljesített. A keret itt kémiai ismereteket, jelöltvegyületek előállítására szolgáló logikát és molekulákat ellenőrző eszközt biztosított.

A kutatók szerint az olyan lépésről lépésre követhető eljárások, mint az ellenőrzés szerkesztés előtt vagy a végeredmény hitelesítése, könnyebben betaníthatók. A mélyebb szaktudás és a hosszú kontextus kezelése kevésbé adható át teljesen a modellnek.

A tanítás módja szintén döntőnek bizonyult. Az erősebb modell saját sikeres futásai, a keretben elvégzett futások és a helyes válaszokat kapó ellenőrző modell adatai nem javították érdemben a teljesítményt, vagy túltanuláshoz vezettek. A kis modellhez hasonló, de kisebb javításokat tartalmazó futások viszont 21 pontos növekedést eredményeztek.

A keretek kisebbek lehetnek, de nem válnak feleslegessé

Az Arize AI szerint a modellek idővel átvehetik a keretekben rögzített, általánosítható eljárások egy részét. Ez összhangban áll azzal a korábbi megfigyeléssel, hogy a kézzel kódolt tudás rövid távon hasznos lehet, de a tanulásra és keresésre épülő általános módszerek később felülmúlhatják.

A felhasználók és fejlesztők számára ez azt jelenti, hogy továbbra is szükség lesz ügynöki keretekre, de ezeknek folyamatosan változniuk kell. A keretben maradhatnak az adott alkalmazáshoz kötődő eszközök, adatok, felhasználók és környezetek, miközben az általánosabb működési szabályok átkerülhetnek a modellbe.

Az Arize által idézett példák szerint az ARC Prize ARC-AGI-3 eredményeiben a Gemini 3.8 Flash egyik kerettel 3,4-szer magasabb pontszámot ért el, mint egy másikkal. A jobb keret megőrizte a modell gondolkodási állapotát a kérések között, és tömörítette a hosszú beszélgetéseket. Ez olyan kontextuskezelési feladat, amelyet a Harness-Zero nem tudott teljesen betanítani.

Az Anthropic Opus 5.5 útmutatója közben arra utal, hogy bizonyos korábbi keretelemek veszíthetnek a jelentőségükből, például elhagyhatóvá válhatnak a fokozott gondolkodásra felszólító utasítások. Ugyanakkor új elemek is megjelenhetnek, például a hosszú futások leállását megelőző emlékeztetők és a több ügynököt használó rendszerek időkeretei. A keretek fejlesztése ezért várhatóan ismétlődő, részben automatizált folyamat lesz.

Kapcsolódó hírek

Az Open Jarvis helyi modellekből épít megbízható AI-ügynököket
Fejlesztőknek2026. szeptember 30.

Az Open Jarvis helyi modellekből épít megbízható AI-ügynököket

A Lambda bemutatta az Open Jarvist, amely a helyben futó nyelvi modellekhez igazítja az AI-ügynökök működési keretét. A vállalat szerint a megfelelően hangolt…

Az Open Jarvis helyi modelleket alakít megbízható AI-ügynökké
Fejlesztőknek2026. szeptember 30.

Az Open Jarvis helyi modelleket alakít megbízható AI-ügynökké

A Lambda bemutatta az Open Jarvist, egy nyílt forrású keretrendszert, amely a helyi nagy nyelvi modellekhez igazítja az AI-ügynökök működését. A vállalat szerint a…

Az agent harnesses nem tűnnek el, de gyorsabban kell fejlődniük
Kutatás2026. szeptember 29.

Az agent harnesses nem tűnnek el, de gyorsabban kell fejlődniük

Egy új kutatás szerint az agent harnesses, vagyis az ügynöki rendszereket eszközökkel, szabályokkal és memóriával támogató rétegek bizonyos részei betaníthatók magába a…