Az NVIDIA AVO 100 százalékot ért el az ARC-AGI-3 nyilvános tesztjén

Az NVIDIA Developer 2026. augusztus 21-én közölte, hogy az Agentic Variation Operators, röviden AVO kutatási projekt 100.00 RHAE pontszámot ért el az ARC-AGI-3 nyilvános tesztkészletén. A vállalat szerint az eredmény azt mutatja, hogy a hosszú távú autonóm teljesítmény nem csak a modell képességén múlik, hanem az ügynökrendszer egészén.
- Az NVIDIA AVO 100.00 RHAE pontszámot ért el az ARC-AGI-3 nyilvános készletén.
- A rendszer mind a 25 környezetet és mind a 183 szintet teljesítette.
- Az AVO körülbelül 12 százalékkal kevesebb környezeti akciót használt, mint a VISTA ugyanazzal az alapmodellel.
- A hét napos GPU-kernel futás során több mint 500 optimalizálási irányt vizsgált és 40 kernelverziót készített.
- Az NVIDIA szerint az eredmény a teljes ügynökrendszer, köztük a memória, eszközök, visszajelzés és helyreállás szerepét emeli ki.
Mit jelent az AVO az NVIDIA szerint?
Az NVIDIA leírása alapján az AVO egy általános célú kódoló ügynökrendszer. Képes kódot vizsgálni és módosítani, parancsokat futtatni, dokumentációt használni, majd futtatással ellenőrizni a saját munkáját. A projekt központi célja a hosszú távon fenntartható autonóm működés.
A cég szerint egy fejlett nyelvi modell csak az AI-ügynök egyik eleme. A körülötte lévő rendszer, vagyis a harness határozza meg, hogyan kap kontextust a modell, hogyan használ eszközöket, hogyan tart fenn állapotot, hogyan reagál visszajelzésre, miként áll helyre hibák után, és hogyan halad tovább hosszú, több lépésből álló feladatokban.
Az AVO két fontos mechanizmusa a tartós memória és a felügyelet. A tartós memória megőrzi a korábbi implementációkat, értékelési eredményeket, fordító és profilozó kimeneteket, valamint a felhalmozott következtetéseket. A felügyelő komponens azt figyeli, ha a keresés megreked vagy ismétlődően terméketlen ciklusokba fut, és ilyenkor más stratégiák felé terelheti a fő ügynököt.
Hét napos GPU-kernel optimalizálás volt az első próba
Az NVIDIA a rendszert először szoftvermérnöki és GPU-kernel optimalizálási feladatokon mutatta be. A cég szerint ezeknél a feladatoknál nem elég egyetlen válaszban kódot generálni: az ügynöknek meglévő megoldásokat kell átnéznie, hipotéziseket kell alkotnia, módosításokat kell végrehajtania, hardveren alapuló teszteket kell futtatnia, majd a visszajelzés alapján újra kell dolgoznia a megközelítést.
Az attention-kernel vizsgálatban az AVO hét napon át működött folyamatosan, több mint 500 optimalizálási irányt próbált ki, és 40 elfogadott kernelverziót készített. NVIDIA DGX B200 rendszereken az így létrejött multihead attention kernelek a vizsgált konfigurációkban legfeljebb 3,5 százalékkal múlták felül a cuDNN-t, és legfeljebb 10,5 százalékkal a FlashAttention-4-et.
A forrás szerint az ügynök később körülbelül 30 perc további autonóm munkával alkalmazta a továbbfejlesztett kernelt grouped-query attention feladatra. Az NVIDIA ezt annak bizonyítékaként értékeli, hogy az AVO sok iteráción át képes fenntartani egy termelékeny mérnöki ciklust anélkül, hogy minden lépést előre kézzel kellene meghatározni.
100.00 RHAE az ARC-AGI-3 nyilvános készletén
Az NVIDIA ugyanazt az alapvető AVO architektúrát alkalmazta az ARC-AGI-3 interaktív érvelési benchmarkon is. Ebben az ügynökök ismeretlen, játékszerű környezetekbe kerülnek, ahol nincsenek instrukciók, kimondott szabályok vagy előre megadott célok. Az ügynöknek interakció útján kell feltárnia a környezet dinamikáját és céljait, majd hatékonyan kell cselekednie egyre nehezebb szinteken.
Az AVO 100.00 RHAE pontszámot ért el az ARC-AGI-3 nyilvános készletének mind a 25 környezetében, és teljesítette mind a 183 szintet. A Relative Human Action Efficiency, vagyis RHAE olyan mutató, amely a feladat teljesítését és az egyes szinteken mért akcióhatékonyságot kapcsolja össze az első próbálkozásos emberi alapértékekhez viszonyítva.
A bejegyzés szerint az AVO nagyjából 12 százalékkal kevesebb környezeti akcióval teljesítette az ARC-AGI-3 nyilvános készletét, mint a VISTA rendszer ugyanazzal az alapmodellel. A forrás azt is kiemeli, hogy a Claude Opus 5 modell önálló, 30 százalékos baseline eredményéről a teljes AVO ügynökrendszer részeként 100 százalékra jutott.
Miért fontos ez a felhasználóknak és a piacnak?
Az NVIDIA fő állítása, hogy a hosszú távú ügynöki képesség a teljes rendszerből alakul ki. Ide tartozik a memória, az eszközhasználat, a visszajelzés feldolgozása, a felügyelet és a hibákból való helyreállás. A modell képessége továbbra is fontos, de a vállalat szerint önmagában nem mutatja meg, mire képes egy autonóm ügynök.
A GPU-kernel optimalizálás és az ARC-AGI-3 feladat látszólag eltérő terület. Az egyik forráskódot, fordítókat, profilozókat és teljesítménymérést használ, a másik ismeretlen interaktív környezeteket. Az NVIDIA értelmezése szerint a közös minta mégis hasonló: az ügynöknek hiányos bizonyítékokból kell hipotéziseket építenie, cselekednie, megfigyelnie a következményeket, megőriznie a hasznos állapotot, és hosszú távon továbbhaladnia.
A hír a piac számára azt jelzi, hogy az ügynökrendszerek értékelése nem merül ki az alapmodellek összehasonlításában. Az NVIDIA szerint az is döntő, hogyan épül fel a modell körüli ügynöki architektúra, és mennyire képes tartósan, visszajelzések alapján dolgozni.

