Az NVIDIA szerint az ügynökök felépítése is sokat számít

Az NVIDIA Labs Object-Oriented Agents, röviden NOOA, olyan nyílt forráskódú kutatási előzetes, amely egyetlen Python-osztályként kezeli az AI-ügynököt. Az NVIDIA szerint az ügynök köré épített architektúra a modell kiválasztásához hasonlóan fontos a teljesítmény és a költség szempontjából.
- A NOOA egyetlen Python-osztályként modellezi az AI-ügynököt.
- A keretrendszer hat modelloldali interfészötletre épít.
- GPT-5.5-tel 82,2 százalékot ért el a SWE-bench Verified teszten.
- A hosszú távú memória ember által olvasható SQLite-fájlban marad meg.
- Az NVIDIA nyílt forráskódú kutatási előzetesként tette közzé a rendszert.
Egy Python-osztályban kezeli az ügynök működését
Az NVIDIA július 27-én ismertette a NOOA keretrendszert. A megközelítésben az ügynök egyetlen Python-osztály, amelyben a metódusok képességeket, a mezők állapotot, a dokumentációs szövegek pedig promptokat jelentenek. A típusannotációk ellenőrzött szerződésként működnek.
A hagyományos Python-metódusok determinisztikusan futnak, míg az ellipszissel megadott metódust a futásidőben egy nagy nyelvi modell vezérelt ciklus egészíti ki. Az NVIDIA szerint így az ügynök fejlesztése közelebb kerül a hagyományos szoftverfejlesztéshez: a kód összehasonlítható, kódellenőrzésen és egységteszteken eshet át, nyomon követhető, verziózható és átalakítható.
Hat interfész segíti a modell munkáját
A NOOA hat, modell által használt interfészötletre épít. Ezek a típusos bemenetek és kimenetek, a hivatkozás szerinti átadás, a kód mint cselekvés, a programozható vezérlési ciklusok, az explicit objektumállapot, valamint a modell által hívható keretrendszer-API-k.
A hivatkozás szerinti átadásnál az eszközök eredményei élő Python-változóként maradnak a futtatási környezetben. A modell csak korlátozott, típusos előnézetet lát, a teljes érték nem kerül szövegként újra és újra a kontextusablakba. Az NVIDIA szerint ez csökkenti a tokenfelhasználást, és a SWE-bench feladatainál nincs szükség kontextustömörítésre.
A rendszer hosszú távú memóriát is tartalmaz. Az ügynök modell által hívható eszközökkel írhat, kereshet és javíthat rekordokat. Ezekhez típus, fontosság és címkék tartoznak, a kapcsolatok pedig például a támogatás, az ellentmondás és a levezetés viszonyát is rögzíthetik. Az adatok egy ember által olvasható SQLite-fájlban maradnak meg, amely munkamenetek között is fennmarad.
A benchmarkokban a teljesítmény és a költség is javult
Az NVIDIA közlése szerint a NOOA GPT-5.5 modellel 82,2 százalékot ért el a SWE-bench Verified teszten, 29 LLM-hívással és feladatonként körülbelül 1,1 millió tokennel. Az összehasonlított keretrendszerek 66 hívással és 2,2 millió tokennel 78,2 százalékot, illetve 29 hívással és 1,3 millió tokennel 78,6 százalékot értek el.
A CyberGym L1 feladatain a NOOA GPT-5.5-tel 86,8 százalékot teljesített. A teszt hálózati hozzáférés nélkül futott, és minden végrehajtási folyamatot szabályalapú ellenőrzés vizsgált. Az ARC-AGI-3 benchmarkban a rendszer GPT-5.5-tel 50,2 százalékos, GPT-5.6-sol modellel pedig 85,1 százalékos átlagos RHAE-értéket ért el, játékonként 20 dollár alatti költséggel.
A NOOA kódját, képességtesztjeit, benchmarkügynökeit, adatait és értékeléseit az NVIDIA kutatási előzetesként közreadta. Ez lehetővé teszi, hogy a közösség reprodukálja, ellenőrizze és továbbfejlessze az eredményeket.
NVIDIA Developer: Six Agent Harness Capabilities for Higher Model Performance


