Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az agent harnesses nem tűnnek el, de gyorsabban kell fejlődniük

2026. szeptember 29.Forrás: Arize AI
Az agent harnesses nem tűnnek el, de gyorsabban kell fejlődniük
Kép: Arize AI

Egy új kutatás szerint az agent harnesses, vagyis az ügynöki rendszereket eszközökkel, szabályokkal és memóriával támogató rétegek bizonyos részei betaníthatók magába a modellbe. Ez nem szünteti meg a harness szerepét, de megváltoztatja, mit kell tartalmaznia és milyen gyakran kell újraépíteni.

A lényeg röviden
  • A Harness-Zero egyes harness-funkciókat modellbe tanított.
  • A javított futásokkal tanított modell átlagos feladatsikere 21 ponttal nőtt.
  • Kémiában a distilled model 8 ponttal gyengébb maradt a harness-szel futó változatnál.
  • A kontextuskezelés és a szaktudás kevésbé vihető át a modellbe.
  • A harness szerepe szűkülhet, de az egyedi eszközök és környezet miatt továbbra is szükséges marad.

A Harness-Zero modellbe tanította a harness működését

Az Arize AI szeptember 29-i elemzése a Peking University Haoran Ye és munkatársai által készített Harness-Zero kutatásra épít. A tanulmány a harness distillation módszerét vizsgálja, amelynek célja, hogy egy modell megtanulja reprodukálni azokat a viselkedéseket, amelyeket korábban egy külön agent harness biztosított.

A kutatók először egy kisebb, Qwen3.5-9B modellhez készítettek specializált harness-t. Egy Kimi K3-mal futtatott automatizált ciklus megvizsgálta, hol hibázik a modell a tanítási feladatokban, majd egyedi eszközöket, kockázatos műveleteket blokkoló köztes szabályokat, skillfájlokat és memóriát adott hozzá. Ezt nevezték evolved harnessnek.

Ezután a harness segítségével tanítási adatokat hoztak létre. A Qwen3.5-9B minimális környezetben hajtott végre feladatokat, miközben egy erősebb modell, a GPT-5.6 Sol minden javasolt lépést ellenőrzött. Ha a lépés megfelelő volt, változtatás nélkül továbbengedte. Ha eltérés volt, a lehető legkisebb javítást hajtotta végre.

A javított futások 21 ponttal emelték a sikerességet

A kutatók a javított futásokon finomhangolták a kisebb modellt, majd eltávolították az evolved harness-t, az ellenőrző modellt és a többi kiegészítő elemet. A létrejött distilled modelt és az eredeti modellt a harness-szel együtt három területen hasonlították össze: táblázatszerkesztésben, több alkalmazást használó eszközhasználatban és kémiában.

A distilled model átlagos feladatsikere 21 ponttal nőtt a tanítatlan elődjéhez képest. Az Arize értelmezése szerint ez nagyobb javulás volt annál, mint amit az eredeti modell a teljes evolved harness használatával elért.

A módszer azonban nem minden területen működött egyformán. Kémiában a distilled model 8 ponttal elmaradt a harness-szel futó változattól. A harness ezen a területen kémiai tudást, jelöltek létrehozására szolgáló logikát és molekulák ellenőrzésére használható eszközt biztosított.

A kutatók szerint a lépésről lépésre követhető eljárások, például az ellenőrzés szerkesztés előtti elvégzése vagy a befejezés előtti validálás, könnyebben betaníthatók. A mély szaktudás és a kontextus kezelése kevésbé jól került át a modellbe. A modell továbbra is egy minimális ciklusban futott, benne egy Bash eszközzel, ezért a módszer szűkíti a harness feladatát, de nem szünteti meg teljesen.

Nem minden tanítási adat javított a modellen

A kutatás egyik fontos megállapítása az volt, hogy a tanítás eredménye nagyban függött a felhasznált futások típusától. Ha a kisebb modellt az erősebb modell sikeres futásaival finomhangolták, a pontszám változatlan maradt. Ugyanez történt azokkal a futásokkal, amelyeket a kisebb modell az evolved harness segítségével teljesített.

Az sem hozott érdemi fejlődést, amikor az ellenőrző modell kész válaszokat adott. Ez a megoldás a kutatók szerint túltanuláshoz vezetett. A javított futások ezzel szemben olyan lépéseket mutattak a kisebb modellnek, amelyek hasonlítottak a saját működésére, de kis, számára még elérhető korrekciókat tartalmaztak.

Az Arize szerint ez a különbség azért lényeges, mert a harness egyes általánosítható működési mintái idővel a modell részévé válhatnak. Rich Sutton 2019-es, The Bitter Lesson című esszéjének logikája alapján a kézzel beépített szaktudás rövid távon segíthet, de a tanuláson és számítási kapacitáson alapuló általános módszerek később átvehetik a szerepét.

Az egyedi eszközök és a környezet továbbra is a harnessben maradnak

Az Arize által idézett példák alapján az agent harnesses nem tűnnek el, viszont minden új modellgenerációval változhat, mi marad bennük. Az ARC Prize ARC-AGI-3 eredményeiben a Gemini 3.8 Flash egyik harness-szel 3,4-szer magasabb pontszámot ért el, mint egy másikkal. A jobb megoldás megőrizte a modell gondolkodási állapotát a kérések között, és tömörítette a hosszú beszélgetéseket.

Az Anthropic Opus 5.5 prompting guide-ja szintén a harness zsugorodására utaló példákat tartalmaz. A dokumentum szerint érdemes törölni a „gondolkodj alaposan” típusú utasításokat, mert a modell már maga állítja be a gondolkodás mértékét. Ugyanakkor új elemek is megjelennek, például a felügyelet nélkül futó ügynökök korai leállását megakadályozó rendszerszintű utasítás, a hosszú futás esetén küldött emlékeztető és a több ügynököt használó rendszerek időkerete.

Az Arize következtetése szerint a fejlesztőknek továbbra is harness-t kell építeniük, de fel kell készülniük annak rendszeres eldobására és újjáépítésére. A tartósan fontos részek várhatóan azok lesznek, amelyek egy adott alkalmazás saját eszközeihez, adataihoz, felhasználóihoz és működési környezetéhez kapcsolódnak.

Kapcsolódó hírek

Az Open Jarvis helyi modellekből épít megbízható AI-ügynököket
Fejlesztőknek2026. szeptember 30.

Az Open Jarvis helyi modellekből épít megbízható AI-ügynököket

A Lambda bemutatta az Open Jarvist, amely a helyben futó nyelvi modellekhez igazítja az AI-ügynökök működési keretét. A vállalat szerint a megfelelően hangolt…

Az Open Jarvis helyi modelleket alakít megbízható AI-ügynökké
Fejlesztőknek2026. szeptember 30.

Az Open Jarvis helyi modelleket alakít megbízható AI-ügynökké

A Lambda bemutatta az Open Jarvist, egy nyílt forrású keretrendszert, amely a helyi nagy nyelvi modellekhez igazítja az AI-ügynökök működését. A vállalat szerint a…

A modellek átvehetik az ügynöki keretek egy részét
Kutatás2026. szeptember 29.

A modellek átvehetik az ügynöki keretek egy részét

Egy új kutatás szerint az ügynöki keretek, vagyis a modelleket eszközökkel és szabályokkal segítő rendszerek egyes részei közvetlenül betaníthatók a modellbe. A keretek…