NVIDIA Vera CPU az agentikus AI egy szálas teljesítményére épít

Az NVIDIA ismertette a Vera CPU Olympus processzormagjának felépítését, amelyet az agentikus AI-feladatok egyre fontosabb CPU-oldali végrehajtására tervezett. A fejlesztés középpontjában a magas egy szálas teljesítmény, az alacsonyabb késleltetés és az irreguláris memóriaműveletek kezelése áll.
- Az NVIDIA Vera CPU központi eleme az agentikus AI-feladatokra tervezett Olympus mag.
- A mag 10 széles dekódolást, neurális elágazás-előrejelzést és mély, sorrenden kívüli végrehajtást használ.
- A gráf-előbetöltő az irreguláris memóriaelérések okozta várakozást csökkentheti.
- A Scalable Coherency Fabric legfeljebb 3,4 TB/s sávszélességet és 164 MB egységes L3-gyorsítótárat kínál.
- A platform PCIe 6.4, CXL 3.1 és Arm CCA/RME támogatást is tartalmaz.
Az agentikus AI új CPU-s igényei
Az NVIDIA 2026. július 21-én közzétett bemutatója szerint az agentikus AI-rendszerek a korábbiaknál több kritikus végrehajtási lépést helyeznek át a CPU-ra. Az ügynökök elkülönített környezetekben futtatnak kódot, eszközöket hívnak meg, kontextust keresnek vissza, adatbázisokkal lépnek kapcsolatba, majd elemzik az eredményeket, mielőtt választ küldenének a modellnek.
Ezek a folyamatok párhuzamosan futhatnak egy AI-infrastruktúrában, ezért az NVIDIA szerint a CPU teljesítménye hatással van az egyes ügynökök válaszidejére és a teljes rendszer áteresztőképességére is. A vállalat ehhez olyan processzort tervezett, amely teljes terhelés mellett is erős egy szálas teljesítményt, magonként elegendő memória-sávszélességet és kiszámítható késleltetést kínál.
Az agentikus munkafolyamatok gyakran irreguláris vezérlési folyamatokat, hosszú függőségi láncokat és mutatóalapú adatszerkezeteket használnak. Ez eltér a hagyományos felhős processzorok sok, egyenletesebb terhelésre optimalizált megközelítésétől.
Az Olympus mag felépítése
Az NVIDIA Vera CPU központi eleme az Olympus mag, amelyet a vállalat az utasításonkénti műveletszám, vagyis az IPC maximalizálására fejlesztett. A tervezés a Vera Rubin platform teljes rendszerével együtt készült, a CPU-k, GPU-k, hálózati és tárolási komponensek, memóriarendszerek, valamint a szoftverek összehangolásával.
Az Olympus elülső része fejlett elágazás-előrejelzést, nagy sávszélességű utasításbetöltést és 10 széles dekódolóegységet használ. A neurális elágazás-előrejelző a nehezen jelezhető, statisztikailag torzított minták kezelését célozza, miközben a mag ciklusonként legfeljebb két végrehajtott elágazást támogathat.
A központi rész széles átnevezési és kiosztási egységgel, nagy újrarendezési pufferrel és jelentős fizikai regiszterkapacitással tart több utasítást folyamatban. A memória-átnevezés, az érték-előrejelzés és a kritikus útvonal gyorsítása az NVIDIA szerint mérsékelheti a mutatóalapú kód, a soros memóriaműveletek és a hosszú függőségi láncok okozta várakozást.
A végrehajtó motor egész számú, elágazási, vektoros, lebegőpontos, kriptográfiai, betöltési és tárolási erőforrásokon ütemezi a műveleteket. A kialakítást többek között ügynökös AI-feladatokra, megerősítéses tanulásra, adatelemzésre, titkosításra és tömörítésre szánják.
Memória, gyorsítótár és a rendszer szerepe
Az agentikus munkafolyamatokban gyakoriak az olyan adatok, amelyek nem illeszkednek jól a gyorsítótárba. Ilyenek lehetnek a futtatókörnyezet objektumai, a visszakeresési indexek, az eszközállapotok, a gráfstruktúrák, a ritka adatok, az adatbázisok és a környezet memóriája.
Az Olympus gyorsítótár-rendszere mély gyorsítótár-hierarchiát, memória-elkülönítést és több hardveres előbetöltőmotort kombinál. A gráf-előbetöltő a vállalat szerint az adatintenzív gráf- és elemzési feladatok teljesítményét javíthatja, csökkentve az irreguláris memóriaelérések miatti várakozást.
A bemutató szerint a Vera CPU Scalable Coherency Fabric összeköttetése legfeljebb 3,4 TB/s kétirányú sávszélességet és 164 MB egységes L3-gyorsítótárat biztosít monolitikus lapkán. A SOCAMM2 LPDDR5X memória legfeljebb 1,2 TB/s összesített sávszélességet kínálhat alacsonyabb fogyasztás mellett, cserélhető modulokkal.
A kétfoglalatos skálázás második generációs NVLink-C2C kapcsolatot használ. Az NVIDIA szerint ez mindkét foglalatot egyetlen NUMA-doménként jeleníti meg, ami egyszerűsítheti a szoftverhangolást. A platform PCIe 6.4, CXL 3.1 és Arm CCA/RME-alapú bizalmas számítástechnikai támogatást is integrál.
A részletesebb műszaki leírást és a teljesítményméréseket az NVIDIA a Vera CPU kapcsolódó fehér könyvében ígéri. A bejelentés alapján a fejlesztés fő célcsoportját azok az AI-infrastruktúrák jelentik, ahol az ügynökök kódot futtatnak, eszközöket hívnak meg és adatokat dolgoznak fel, így a CPU egy szálon elért teljesítménye közvetlenül befolyásolhatja a válaszlépések sebességét.
NVIDIA Developer: NVIDIA Vera CPU: Olympus Cores Built for Maximum Single-Thread Performance in Agentic AI


