Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az AI21 Labs olcsóbban futtatná a kódoló ügynököket

2026. július 7. 17:46Forrás: AI21 Labs
Az AI21 Labs olcsóbban futtatná a kódoló ügynököket
Kép: AI21 Labs

Az AI21 Labs olyan futtatási stratégiákat vizsgált szoftverfejlesztő ügynökökhöz, amelyek a feladat nehézségéhez igazítják a felhasznált számítási keretet. A vállalat szerint a módszerrel a könnyebb feladatoknál korábban leállítható a feldolgozás, miközben a nehezebb problémák több erőforrást kaphatnak.

A lényeg röviden
  • Az AI21 Labs a feladat nehézségéhez igazított SWE-ügynök-futtatást vizsgált.
  • A lépcsőzetes stratégia több mint 50 százalékban korai leállást eredményezett.
  • A döntéshez Resolve-Now és Resolve-Later előrejelzéseket használnak.
  • A rendszer teszteredményeket, javításokat és ügynökmetaadatokat is figyelembe vesz.
  • A vállalat szerint a tesztadaton azonos minőség mellett alacsonyabb költséget mértek.

Eddig minden feladat ugyanakkora keretet kapott

Az AI21 Labs július 7-i kutatási beszámolója szerint a SWE-ügynökök, vagyis szoftverfejlesztési feladatokra használt mesterséges intelligencia ügynökök optimalizálásánál gyakran egységes számítási keretet alkalmaznak minden problémára. Ez azonban nem tükrözi a feladatok tényleges nehézségét, amely a vállalat szerint nehéz eloszlást követ.

Az AI21 Labs egy korábbi, SWE-rebench benchmarkkal kapcsolatos munkájára hivatkozva azt írja, hogy a mintában szereplő feladatok körülbelül 50 százalékát a GPT-5.2 egyetlen futtatása megoldotta. Ennek ellenére a korábbi szabályzat minden feladathoz öt futtatást rendelt, így az egyszerűbb problémák esetében fölöslegesen használtak fel erőforrást.

A most bemutatott megközelítés célja, hogy csak akkor növelje a számítási ráfordítást, amikor arra szükség van. Az AI21 Labs két stratégiát vizsgált: a költségre optimalizált, lépcsőzetes futtatást és a várakozási időt csökkentő párhuzamos végrehajtást. Mindkettő korai leállítással egészül ki.

A rendszer jelölt javításokból választ

Az AI21 Labs SWE-ügynökének alapfolyamatában egy lekérdezéshez több, egymástól független jelölt javítás készül párhuzamosan. Minden futtatás végén az ügynök önbizalmi pontszámot ad, miközben egy tesztügynök összegyűjti azokat a teszteket, amelyeknek egy helyes javítás esetén teljesülniük kell.

A teszteken elbukó jelölteket kiszűrik, majd a rendszer kinyeri a megmaradt megoldásokhoz kapcsolódó forráskódot. Végül egy kiválasztó ügynök, más néven LLM Judge, a jelöltek teljes készletét és a releváns forráskódot vizsgálva választja ki a végső megoldást.

Ez azért fontos, mert az AI21 Labs korábbi eredményei szerint az egyes jelöltek önbizalmi értékei önmagukban gyengébb döntési alapot adnak, mint a teljes jelöltkészlet közös értékelése. Emiatt a korai leállításnál nem azt kell megbecsülni, hogy egyetlen megoldás elég jó-e, hanem azt, hogy rendelkezésre áll-e egy elég erős jelöltcsoport a kiválasztó sikeres működéséhez.

Két előrejelzés dönt a további futtatásokról

A kutatók két osztályozót használatba vevő előrejelzési jelet vezettek be. A Resolve-Now azt becsüli meg, hogy a jelenlegi jelöltlista kiválasztó általi feldolgozása megoldja-e a feladatot. A Resolve-Later azt jelzi, hogy egy nagyobb jelöltkészlet előállítása és kiválasztása várhatóan sikeres lenne-e. Ez utóbbit a kutatók a nagyobb készlet várható eredményéből a jelenlegi eredmény levonásával használják a további futtatások várható hasznának becslésére.

A rendszer kalibrált küszöbértékek alapján dönt. A magasabb biztonsági küszöb ritkább, de drágább korai leállást eredményez, míg az alacsonyabb küszöb több megtakarítást tehet lehetővé, nagyobb pontatlansági kockázat mellett.

Az önbizalmi értékek mellett a döntéshez felhasználják a tesztügynök eredményeit, a teljesült tesztek és a minden teszten átjutó jelöltek számát, a git-javítások eltérését, a repositoryban keresett útvonalak változatosságát és lefedettségét, továbbá az ügynök lépésszámát és eszközhibáinak arányát. A tesztügynök ehhez GPT-5-Mini modellt használ.

A tesztben a feladatok több mint felénél korán leálltak

A költségre optimalizált lépcsőzetes stratégia előre meghatározott futtatási számokkal dolgozik. Az AI21 Labs példájában a rendszer először egy futtatást indít, majd az előrejelzők alapján eldönti, hogy megálljon-e, vagy három futtatásra bővítse a készletet. Szükség esetén öt, végül tíz futtatásig léphet tovább.

Az AI21 Labs a SWE-rebench korábbi munkájában használt adatszeleten értékelte a módszert. Ez a 2025 decembere és 2026 márciusa közötti időszakból származó 123 problémát tartalmazta, amelyekből külön tanító- és tesztadatkészletet vettek.

Az N értékekre épülő, [1, 3, 5, 10] beállításnál a feladatok több mint 50 százalékánál korán leállt a rendszer, és csak a teljes keret egy részét használta fel. A küszöbértékek változtatásával különböző költség, késleltetés és minőség közötti kompromisszumok alakíthatók ki. Az AI21 Labs szerint a tanítóadaton kiválasztott beállítások a tesztadaton nem működtek tökéletesen, de a módszer így is általánosított, és a kiinduló stratégiához képest azonos minőség mellett alacsonyabb költséget mutatott.

A megközelítés a felhasználók és az üzemeltetők számára azt jelentheti, hogy az SWE-ügynökök futtatása a feladat egyszerűségéhez vagy összetettségéhez igazítható. A vállalat eredményei alapján a költségcsökkentéshez a könnyebb feladatoknál elég lehet kevesebb jelölt javítást előállítani, míg a nehezebb problémák továbbra is nagyobb keretet kaphatnak.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A jogi szakmában már minden második szakember használ generatív AI-t
Kutatás2026. október 3. 10:27

A jogi szakmában már minden második szakember használ generatív AI-t

A jogi szakemberek 49 százaléka már aktívan használ generatív AI-t a munkájában, derül ki az Everlaw, az ACEDS és az ILTA közös jelentéséből. A technológia egyre…

A CoreWeave bemutatta az ARIA kutatási és iterációs ügynököt
Termékek és eszközök2026. október 2. 19:23

A CoreWeave bemutatta az ARIA kutatási és iterációs ügynököt

Általánosan elérhetővé vált a CoreWeave ARIA, egy kutatási és iterációs AI-ügynök, amely a CoreWeave Forge részeként segít modellek és AI-ügynökök fejlesztésében. Az…

Az Anaconda MCP ellenőrzi a csomagokat a kódoló ügynökök helyett
Termékek és eszközök2026. október 2. 19:06

Az Anaconda MCP ellenőrzi a csomagokat a kódoló ügynökök helyett

Általánosan elérhetővé vált az Anaconda MCP, amely csomagadatokkal, sérülékenységi információkkal és szervezeti házirendekkel segíti a kódoló ügynököket. A távoli…