Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az NVIDIA tesztje szerint sok kódolóügynök elbukik éles kiszolgálásban

2026. szeptember 23. 18:00Forrás: NVIDIA Developer
Az NVIDIA tesztje szerint sok kódolóügynök elbukik éles kiszolgálásban
Kép: NVIDIA Developer

Az NVIDIA új SWE-Serve benchmarkja azt vizsgálja, hogy az AI-kódolóügynökök javításai működnek-e valódi modellkiszolgálás közben. A 19, éles szervert indító feladatnál a javítások teljes ellenőrzéssel 45,9 százalékban mentek át, míg az élő kiszolgálási tesztek nélkül ez az arány 69,4 százalék volt.

A lényeg röviden
  • A SWE-Serve 53, SGLang-alapú inferenciamérnöki feladatot tartalmaz.
  • Az élő kiszolgálási tesztekkel a javítások 45,9 százaléka ment át.
  • Élő tesztek nélkül az átlagos teljesítési arány 69,4 százalékra nőtt.
  • A több futtatási területet érintő feladatok 21,3 százalékponttal rosszabbul teljesítettek.
  • A legjobb eredményt a Claude Opus 5 és a GPT-5.6 Sol érte el, 75 százalékkal.

Az éles szerver sok hibát láthatóvá tesz

Az NVIDIA Developer szeptember 23-án bemutatott SWE-Serve benchmarkja az AI-kódolóügynökök teljesítményét méri az inferenciakiszolgálásban. A teszt az SGLang nyílt forráskódú rendszerhez kapcsolódó, korábban összeolvadt változtatásokból épül fel.

A benchmark 83 SGLang-pull requestből 53 végrehajtható feladatot alakított ki. Ezek hat területet fednek le: a modellek és háttérrendszerek támogatását, a dekódolást, a gyorsítótárazást, az ütemezést, a kiszolgálási API-kat, valamint az elosztott végrehajtást.

A feladatok közül 19 valódi szervert indít, majd a módosítást a teljes kiszolgálási útvonalon ellenőrzi. Az NVIDIA által vizsgált 627 javítás közül 45,9 százalék felelt meg a teljes ellenőrzésnek. Amikor az élő kiszolgálási teszteket kihagyták, az arány 69,4 százalékra nőtt. Ez azt jelenti, hogy 147 javítás átment volna az egyéb ellenőrzéseken, de az éles kiszolgálási teszteken elbukott.

Modellbetöltést és valódi kéréseket is vizsgálnak

A SWE-Serve feladatai konténerizált SGLang-kóddal indulnak, még a célváltoztatás előtti állapotból. A javítás akkor számít sikeresnek, ha megfelel a rejtett ellenőrzőnek a feladathoz kijelölt hardveren. A 53 feladat közül 12 CPU-n fut, 41 pedig egyetlen NVIDIA H100-at használ. A benchmark első kiadása más inferenciamotorokat, több GPU-s végrehajtást és több csomópontos kiszolgálást nem vizsgál.

A referencia-megoldás mediánja 553 módosított sor hét fájlban. Egy tipikus ellenőrző hét, az új viselkedést vizsgáló tesztet és tíz regressziós tesztet tartalmaz. Tizenkilenc feladat valódi modellt tölt be, három pedig kalibrált teljesítményhatárt érvényesít H100-on.

Az egyik feladatban a kódolóügynöknek a sűrű és a mixture-of-experts, vagyis MoE architektúrájú Qwen3.5 modellek kiszolgálását kell hozzáadnia. Az ellenőrzés kiterjed a modellregisztrációra, a konfigurációra, a súlyok betöltésére, kép- és videóbemenetekre, az OpenAI-kompatibilis kérésekre, a kötegelt generálásra, a logaritmikus valószínűségekre és az MoE-modell szakértőinek végrehajtására.

A Gemma 4 MoE feladatnál 33 javításból 16 minden más ellenőrzésen átment, legalább egy élő kiszolgálási teszten mégis megbukott. Ezek a tesztek modellbetöltést, szakértőválasztást, szöveges és képes kiszolgálást, valamint helyes sorrendű kötegelt generálást vizsgáltak.

A több futtatási területet érintő feladatok nehezebbek

Az NVIDIA a kérés és a válasz közötti folyamatot négy futtatási területre bontotta: kéréskezelés és bemenet-kimenet, ütemezés és a kérések életciklusa, modellvégrehajtás, valamint a KV-gyorsítótár és a futási erőforrások kezelése.

A legjobb beállítással mért 11 modell esetében az egyetlen futtatási területre korlátozott 26 feladat átlagos teljesítési aránya 69,0 százalék volt. A több területet érintő 27 feladatnál ez 47,7 százalékra csökkent. A különbség 21,3 százalékpont, és az NVIDIA szerint minden vizsgált modellnél ugyanebbe az irányba mutatott.

Az eredmények szerint az egyes részfunkciók külön-külön történő ellenőrzése nem feltétlenül mutatja meg, hogy egy módosítás működik-e a teljes rendszerben. A valódi szerver indítása és a publikus felületen küldött kérések vizsgálata olyan hibákat is felszínre hozhat, amelyek a hagyományos teszteken rejtve maradnak.

Nagy különbség van a modellek teljesítménye és költsége között

A 11 vizsgált modell legjobb tesztelt beállításai között a pass@1 érték 34,6 és 75,5 százalék között alakult. A legmagasabb eredményt a Claude Opus 5 és a GPT-5.6 Sol érte el, egyaránt 75 százalékkal. Az NVIDIA ugyanakkor kiemeli, hogy a hasonló pontszámú modellek költsége és futási ideje jelentősen eltérhet.

A mini-swe-agent nevű, csak Bash-t használó szoftvermérnöki ügynökkel, zárt könyves körülmények között végezték a mérést. Minden konfiguráció háromszor futott végig az 53 feladaton. Egy munkamenet legfeljebb 210 percig és 350 lépésig tarthatott. Egy feladat csak akkor számított megoldottnak, ha a javítás a teljes ellenőrzőn és a kijelölt hardveren is átment.

Az NVIDIA hangsúlyozza, hogy a SWE-Serve teljesítése szűk jelentésű: a javítás megfelel a benchmark ellenőrzőjének. Ez önmagában nem bizonyítja, hogy a módosítás telepíthető, összeolvasztható vagy az SGLang karbantartói által támogatott. A benchmark a fejlesztőknek és a modellkészítőknek azt mutatja meg, hogy az inferenciakód javítását érdemes a teljes kiszolgálási útvonalon is ellenőrizni.

Kapcsolódó hírek

A Salesforce szerint az ügyfélszolgálatot cselekvő AI-ügynökök alakítják át
Termékek és eszközök2026. október 2. 19:00

A Salesforce szerint az ügyfélszolgálatot cselekvő AI-ügynökök alakítják át

A Salesforce olyan ügyfélélményt képzel el, amelyben az AI-ügynökök nemcsak válaszolnak a kérdésekre, hanem értelmezik az ügyfél helyzetét, engedélyezett műveleteket…

NVIDIA Blackwell GPU-kon gyorsul az OpenAI GPT-6 Astra Ultrafast
Modellek2026. október 2. 01:44

NVIDIA Blackwell GPU-kon gyorsul az OpenAI GPT-6 Astra Ultrafast

Az NVIDIA 2026. október 1-jén közölte, hogy az OpenAI GPT-6 Astra Ultrafast módja NVIDIA Blackwell GPU-kon fut, és már elérhető az OpenAI API-ban, valamint jogosult…

A GPT-5.6 Sol vezeti a régi rendszerekre szabott tesztet
Kutatás2026. szeptember 24.

A GPT-5.6 Sol vezeti a régi rendszerekre szabott tesztet

A GPT-5.6 Sol érte el a legjobb eredményt a Factory Legacy-Bench nevű tesztjén, amely a COBOL, a Java 7, a BASIC, a C89, a Fortran és az Assembly kezelését vizsgálja. A…