Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az AI21 szerint az ügynökök fejlesztésének kulcsa az ellenőrizhetőség

2026. október 6. 10:06Forrás: AI21 Labs
Az AI21 szerint az ügynökök fejlesztésének kulcsa az ellenőrizhetőség
Kép: AI21 Labs

Az AI21 szerint az AI-ügynökök fejlesztésénél az első kérdés nem az, hogy több számítási kapacitást kell-e biztosítani, hanem az, hogy az ügynök képes-e felismerni a helyes eredményt. Az ellenőrizhető feladatoknál a kiválasztás és a hitelesítés, az ellenőrizhetetleneknél a változatos próbálkozások és az eredmények összesítése lehet a hatékonyabb stratégia.

A lényeg röviden
  • Az AI21 szerint az ügynök fejlesztését az ellenőrizhetőség vizsgálatával kell kezdeni.
  • Ellenőrizhető feladatoknál a hitelesítés és a jelöltek kiválasztása lehet hatékony.
  • A BrowseComp-Plus teszten az AI21 95,18 százalékos pontosságról számolt be.
  • A saját 8B ellenőrző 3,2-szer alacsonyabb költség mellett érte el egy csúcskategóriás ellenőrző minőségét.
  • Deep research esetén több jelentés összevonása jobb eredményt adott, mint egyetlen jelentés kiválasztása.

A skálázás előtt az architektúrát kell megvizsgálni

Az AI21 október 6-án közzétett elemzése szerint az ügynökök teljesítményének javítására adott kézenfekvő válasz gyakran a skálázás: több próbálkozás, hosszabb vagy bővített kontextus, illetve erősebb modell használata. Ez azonban azt feltételezi, hogy az architektúra megfelelő, csak kevés erőforrást kap.

A vállalat több mint egyéves ügynökoptimalizálási kutatására hivatkozva azt írja, hogy ez a feltételezés sokszor téves. A problémát jelezheti például, ha minden feladat azonos költségkeretet kap, ha a rendszer olyan jeleket és futtatásokat állít elő, amelyeket később eldob, vagy ha csúcskategóriás modellt használ ott, ahol egy nyílt modell is hasonlóan teljesítene.

Az AI21 javasolt egyszerű tesztje az, hogy egy jelölt választ össze lehet-e vetni valamilyen ellenőrizhető feltétellel. Ha igen, az erőforrásokat a hitelesítésre és a kiválasztásra érdemes fordítani. Ha nem, a rendszernek többféle próbálkozásból kell dolgoznia, majd össze kell vonnia azok eredményeit.

Az agentic search esetében működhet a hitelesítés

Az AI21 szerint a több lépésből álló agentic search feladatoknál gyakran ellenőrizhető, hogy az ügynök megtalálta-e a helyes választ. A kérdés ilyenkor egyetlen entitásra, például egy személyre vonatkozik, a feltételek pedig előre meg vannak adva. Egy jelölt ellenőrzése ezért szűkebb feladat, mint az eredeti keresés.

A helyzet megváltozik, ha a kérdés minden megfelelő entitás megtalálását várja el. Az AI21 példája szerint az egyes Nobel-díjasok ellenőrizhetők, de annak megállapítása, hogy a lista teljes-e, már nem. A pontosság így ellenőrizhető marad, a lefedettség viszont nem.

A vállalat úgynevezett oracle kísérletet is végzett, amelyben az ismert, helyes válaszok alapján választott a jelöltek közül. A BrowseComp-Plus tesztjén a kalibrált modellbizalmi értékek elég jól követték a pontosságot ahhoz, hogy kiválasztásra lehessen használni őket. Modellek olyan együttesével, amelyek eltérő kérdéseken hibáztak, az eredmény 95,18 százalékos pontosság és az AI21 szerint legjobb eredmény lett.

A vállalat egy saját, 8B paraméteres ellenőrzőt is betanított. Ez egy nyílt és zárt modelleket kombináló együttesen a csúcskategóriás ellenőrző minőségét 3,2-szer alacsonyabb költség mellett érte el. Egy teljesen nyílt forrású együttesben az ellenőrző 28 százalékkal javította a pontosságot az egyszerű többségi szavazáshoz képest, azonos jelöltek mellett.

A mély kutatásnál az eredmények összevonása lehet a megoldás

A deep research feladatoknál az ügynök nem tudja biztosan megállapítani, hogy teljes jelentést készített-e. Egy-egy állítás ellenőrizhető, a jelentés teljessége azonban nem, mivel előre nem lehet felsorolni minden releváns tényt, megállapítást és fontos kiegészítést.

Az AI21 a DeepResearch Bench II eredményeit hozza példaként. A teszt szakértők által készített értékelési szempontok alapján pontozza a jelentéseket, különös súllyal kezelve azokat a tényeket, amelyeknek szerepelniük kellene a válaszban. Ezeket a szempontokat azonban csak utólag lehetett összeállítani.

Az AI21 oracle kísérletében még a legjobb jelentés kiválasztása sem érte el a korábbi legjobb eredményt. Több jelentés összevonásával viszont magasabb teljesítményt lehetett elérni. A vállalat hét, a ranglistán alacsonyabban szereplő ügynök jelentéseit egy algoritmussal egyesítette, az így létrehozott jelentés pedig első helyezést ért el, megelőzve az azt előállító ügynököket és a korábbi legjobb eredményt is.

Az AI21 következtetése szerint az ügynökök fejlesztésénél először azt kell meghatározni, hogy a feladat eredménye ellenőrizhető-e. Ez dönti el, hogy a rendszernek egyetlen jelölt kiválasztására és a többi elvetésére, vagy több részleges eredmény összegyűjtésére és egyesítésére kell épülnie.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A Google szerint a mesterséges intelligencia ügynökeinek kontextust kell érteniük
Biztonság és etika2026. október 5. 23:08

A Google szerint a mesterséges intelligencia ügynökeinek kontextust kell érteniük

A Google Research új workshop-jelentése szerint a mesterséges intelligencia ügynökeinek nem elég az utasításokat végrehajtaniuk, azt is fel kell mérniük, hogy egy adott…

A tapasztalatokból tanuló LLM-ügynökök módszerét mutatta be a NAVER
Kutatás2026. október 4. 13:41

A tapasztalatokból tanuló LLM-ügynökök módszerét mutatta be a NAVER

A NAVER LABS Europe kutatói olyan nagy nyelvi modellekre épülő ügynökök betanítási módszerét mutatták be, amely a korábbi tapasztalatok visszakeresését és a felügyelt…

A jogi szakmában már minden második szakember használ generatív AI-t
Kutatás2026. október 3. 10:27

A jogi szakmában már minden második szakember használ generatív AI-t

A jogi szakemberek 49 százaléka már aktívan használ generatív AI-t a munkájában, derül ki az Everlaw, az ACEDS és az ILTA közös jelentéséből. A technológia egyre…