Az AI21 Labs olcsóbban futtatná a kódoló ügynököket

Az AI21 Labs olyan futtatási stratégiákat vizsgált szoftverfejlesztő ügynökökhöz, amelyek a feladat nehézségéhez igazítják a felhasznált számítási keretet. A vállalat szerint a módszerrel a könnyebb feladatoknál korábban leállítható a feldolgozás, miközben a nehezebb problémák több erőforrást kaphatnak.
- Az AI21 Labs a feladat nehézségéhez igazított SWE-ügynök-futtatást vizsgált.
- A lépcsőzetes stratégia több mint 50 százalékban korai leállást eredményezett.
- A döntéshez Resolve-Now és Resolve-Later előrejelzéseket használnak.
- A rendszer teszteredményeket, javításokat és ügynökmetaadatokat is figyelembe vesz.
- A vállalat szerint a tesztadaton azonos minőség mellett alacsonyabb költséget mértek.
Eddig minden feladat ugyanakkora keretet kapott
Az AI21 Labs július 7-i kutatási beszámolója szerint a SWE-ügynökök, vagyis szoftverfejlesztési feladatokra használt mesterséges intelligencia ügynökök optimalizálásánál gyakran egységes számítási keretet alkalmaznak minden problémára. Ez azonban nem tükrözi a feladatok tényleges nehézségét, amely a vállalat szerint nehéz eloszlást követ.
Az AI21 Labs egy korábbi, SWE-rebench benchmarkkal kapcsolatos munkájára hivatkozva azt írja, hogy a mintában szereplő feladatok körülbelül 50 százalékát a GPT-5.2 egyetlen futtatása megoldotta. Ennek ellenére a korábbi szabályzat minden feladathoz öt futtatást rendelt, így az egyszerűbb problémák esetében fölöslegesen használtak fel erőforrást.
A most bemutatott megközelítés célja, hogy csak akkor növelje a számítási ráfordítást, amikor arra szükség van. Az AI21 Labs két stratégiát vizsgált: a költségre optimalizált, lépcsőzetes futtatást és a várakozási időt csökkentő párhuzamos végrehajtást. Mindkettő korai leállítással egészül ki.
A rendszer jelölt javításokból választ
Az AI21 Labs SWE-ügynökének alapfolyamatában egy lekérdezéshez több, egymástól független jelölt javítás készül párhuzamosan. Minden futtatás végén az ügynök önbizalmi pontszámot ad, miközben egy tesztügynök összegyűjti azokat a teszteket, amelyeknek egy helyes javítás esetén teljesülniük kell.
A teszteken elbukó jelölteket kiszűrik, majd a rendszer kinyeri a megmaradt megoldásokhoz kapcsolódó forráskódot. Végül egy kiválasztó ügynök, más néven LLM Judge, a jelöltek teljes készletét és a releváns forráskódot vizsgálva választja ki a végső megoldást.
Ez azért fontos, mert az AI21 Labs korábbi eredményei szerint az egyes jelöltek önbizalmi értékei önmagukban gyengébb döntési alapot adnak, mint a teljes jelöltkészlet közös értékelése. Emiatt a korai leállításnál nem azt kell megbecsülni, hogy egyetlen megoldás elég jó-e, hanem azt, hogy rendelkezésre áll-e egy elég erős jelöltcsoport a kiválasztó sikeres működéséhez.
Két előrejelzés dönt a további futtatásokról
A kutatók két osztályozót használatba vevő előrejelzési jelet vezettek be. A Resolve-Now azt becsüli meg, hogy a jelenlegi jelöltlista kiválasztó általi feldolgozása megoldja-e a feladatot. A Resolve-Later azt jelzi, hogy egy nagyobb jelöltkészlet előállítása és kiválasztása várhatóan sikeres lenne-e. Ez utóbbit a kutatók a nagyobb készlet várható eredményéből a jelenlegi eredmény levonásával használják a további futtatások várható hasznának becslésére.
A rendszer kalibrált küszöbértékek alapján dönt. A magasabb biztonsági küszöb ritkább, de drágább korai leállást eredményez, míg az alacsonyabb küszöb több megtakarítást tehet lehetővé, nagyobb pontatlansági kockázat mellett.
Az önbizalmi értékek mellett a döntéshez felhasználják a tesztügynök eredményeit, a teljesült tesztek és a minden teszten átjutó jelöltek számát, a git-javítások eltérését, a repositoryban keresett útvonalak változatosságát és lefedettségét, továbbá az ügynök lépésszámát és eszközhibáinak arányát. A tesztügynök ehhez GPT-5-Mini modellt használ.
A tesztben a feladatok több mint felénél korán leálltak
A költségre optimalizált lépcsőzetes stratégia előre meghatározott futtatási számokkal dolgozik. Az AI21 Labs példájában a rendszer először egy futtatást indít, majd az előrejelzők alapján eldönti, hogy megálljon-e, vagy három futtatásra bővítse a készletet. Szükség esetén öt, végül tíz futtatásig léphet tovább.
Az AI21 Labs a SWE-rebench korábbi munkájában használt adatszeleten értékelte a módszert. Ez a 2025 decembere és 2026 márciusa közötti időszakból származó 123 problémát tartalmazta, amelyekből külön tanító- és tesztadatkészletet vettek.
Az N értékekre épülő, [1, 3, 5, 10] beállításnál a feladatok több mint 50 százalékánál korán leállt a rendszer, és csak a teljes keret egy részét használta fel. A küszöbértékek változtatásával különböző költség, késleltetés és minőség közötti kompromisszumok alakíthatók ki. Az AI21 Labs szerint a tanítóadaton kiválasztott beállítások a tesztadaton nem működtek tökéletesen, de a módszer így is általánosított, és a kiinduló stratégiához képest azonos minőség mellett alacsonyabb költséget mutatott.
A megközelítés a felhasználók és az üzemeltetők számára azt jelentheti, hogy az SWE-ügynökök futtatása a feladat egyszerűségéhez vagy összetettségéhez igazítható. A vállalat eredményei alapján a költségcsökkentéshez a könnyebb feladatoknál elég lehet kevesebb jelölt javítást előállítani, míg a nehezebb problémák továbbra is nagyobb keretet kaphatnak.
AI21 Labs: Improving Best-of-N with Budget-Aware Execution for SWE Agents


