NVIDIA: a Vera Rubin NVL72 akár 30x hatékonyabb AI-ügynököknél

Az NVIDIA 2026. augusztus 24-én közölt, majd szeptember 15-én frissített blogbejegyzésében új teljesítményadatokat tett közzé a Vera Rubin NVL72 rendszerről. A vállalat szerint a platform agentikus AI-terheléseken akár 30x nagyobb áteresztést ad megawattonként a GB300 NVL72-höz képest.
- Az NVIDIA szerint a Vera Rubin NVL72 agentikus terheléseken akár 30x nagyobb megawattarányos áteresztést ér el, mint a GB300 NVL72.
- Az OpenRouter adatai alapján az agentikus AI-terhelések 15x több tokent fogyasztanak, mint egy egyszerű chatkérés.
- A SemiAnalysis AgentX valós agentikus kódolási munkameneteket használ a mérésekhez.
- Az NVIDIA állítása szerint a Vera Rubin NVL72 egymillió tokenre vetítve akár 45x alacsonyabb költséget érhet el, mint a GB300 NVL72.
- A Vera Rubin platform hétchipes architektúrára és együtt tervezett hardveres, szoftveres optimalizációkra épül.
Az AI-ügynökök jóval több tokent használnak
Az NVIDIA az OpenRouter adataira hivatkozva azt írja, hogy az agentikus AI-terhelések 15x több tokent fogyasztanak, mint egy egyszerű chatkérés. A vállalat példája szerint egy befektetési döntést előkészítő AI-ügynök pénzügyi adatbázisokat kérdez le, híreket és beadványokat keres, alügynököt hív meg összehasonlításokhoz és értékelési modellekhez, majd ezekből ajánlást készít.
Az ilyen folyamatokban az ügynökök és alügynökök addig érvelnek és dolgoznak, amíg a feladat elkészül. Minden lépésnél a korábban felhalmozott tokenek a következő lépés bemenetévé válnak, ezért a hosszú kontextus kezelése központi tényező az agentikus AI teljesítményében.
Az NVIDIA szerint ugyanez a minta jelenik meg több felhasználási területen is, például szoftverfejlesztésben, ügyfélszolgálatban és mély kutatási feladatokban. A cég állítása szerint az infrastruktúrának ezt a megnövekedett tokenigényt kell hatékonyan kiszolgálnia, ahogy az agentikus AI iparágakon át termelési környezetbe kerül.
Akár 30x nagyobb áteresztés megawattonként
Az NVIDIA a SemiAnalysis AgentX új adataira hivatkozva azt közölte, hogy a Vera Rubin NVL72 rendszerek agentikus terheléseken akár 30x nagyobb áteresztést érnek el megawattonként, mint az NVIDIA GB300 NVL72. A vállalat szerint ez az energiahatáros AI-gyáraknál ugyanakkora energiafelhasználás mellett 30x több agentikus munkát jelenthet.
A SemiAnalysis AgentX terhelése rögzített, valós agentikus kódolási munkamenetekből áll, amelyekben megmaradt a tényleges kontextusnövekedés, az eszközhívások és az alügynökök indítása. Az NVIDIA szerint az ilyen mérések jobban tükrözik az agentikus munkafolyamatot, mint egyetlen inferenciakérés vizsgálata.
A blog szerint a chat vagy dokumentumösszegzés esetén a bemeneti és kimeneti szekvenciák jellemzően 1K és 8K token között mozognak. Agentikus munkamenetekben ezzel szemben a kontextus lépésről lépésre halmozódik, és több százezer bemeneti tokenig nőhet, miközben a bemenet és a kimenet hossza is jelentősen változhat a kérések között.
Az NVIDIA azt írja, hogy a SemiAnalysis AgentX mérésein a Blackwell platform vezető teljesítményt nyújt több agentikus modellen, köztük a Kimi K3, MiniMax M3, GLM5.3, Qwen3.5 és DeepSeek V4 Pro modelleken. Példaként a GB300 NVL72 a DeepSeek V4 Pro modellen akár 15x jobb megawattarányos áteresztést ér el, mint az NVIDIA Hopper architektúra.
A Vera Rubin NVL72 az NVIDIA szerint tovább növeli ezt az előnyt: a DeepSeek V4 Pro modellen, a SemiAnalysis AgentX terhelésen mérve akár 30x nagyobb áteresztést hoz megawattonként a GB300 NVL72-höz képest. A cég hozzáteszi, hogy ezek a korai eredmények még nem tükrözik a Vera CPU teljesítményét az eszközhívásoknál.
A költség és az energiafelhasználás is kulcsszerepet kap
Az NVIDIA szerint a megawattarányos áteresztés közvetlenül hat a létrehozott tokenek költségére is. A vállalat állítása alapján a Vera Rubin NVL72 akár 45x alacsonyabb költséget érhet el egymillió tokenre vetítve, mint a GB300 NVL72.
A blogban szerepel az is, hogy az NVIDIA DSX MaxLPS technológiák a GPU, a rack és a munkaterhelés szintjén kezelik az energiafelhasználást. A vállalat szerint ez akár 40 százalékkal több GPU használatát teszi lehetővé ugyanakkora megawattos keretben, ami AI-gyári léptékben tovább növelheti a megawattarányos áteresztést.
Az NVIDIA megfogalmazása szerint energiahatáros AI-gyáraknál a megawattarányos áteresztés az AI-gyár bevételét, az egymillió tokenre jutó költség pedig az ezen elérhető profitmarzsot határozza meg. Ez a megközelítés különösen fontos lehet olyan agentikus terheléseknél, amelyek folyamatosan, nagy skálán futnak.
Hardver és szoftver együtt tervezve
Az NVIDIA a Vera Rubin NVL72 teljesítményét a platform rétegein átívelő együtttervezéssel magyarázza. A felsorolt optimalizációk közé tartozik a szétválasztott kiszolgálás, amely külön kezeli a kontextusfeldolgozást, vagyis a prefill szakaszt, és a válaszgenerálást, vagyis a decode szakaszt. A rate matching a prefill GPU-k és a decode GPU-k tokenelőállítási sebességét hangolja össze.
A vállalat kiemeli a nagy léptékű expert parallelism technikát a mixture-of-experts modellekhez, az elosztott KV-gyorsítótárazást, valamint a KV-cache offloading megoldást, amely a kevésbé aktív kontextust hoszt- és tárhelyszintekre helyezi. A KV-aware routing a beérkező kéréseket azokhoz a GPU-khoz irányítja, amelyek már tárolják a releváns gyorsítótárazott kontextust.
A blog szerint a MegaMoE-hoz hasonló összevont CUDA kernelek több számítási és GPU-k közötti kommunikációs műveletet egyetlen végrehajtási menetbe vonnak össze. Az NVIDIA Rubin GPU-k továbbfejlesztett ötödik generációs Tensor Core egységei és a harmadik generációs Transformer Engine a prefill és a decode inferenciaszakaszt is gyorsítják. Az NVFP4 kvantálás 4 bites pontosságra tömöríti a modell súlyait, csökkentve a memóriaigényt és növelve az áteresztést, az NVIDIA szerint a kimeneti minőség feláldozása nélkül.
Az NVL72 scale-up tartomány a Vera Rubin és a Grace Blackwell egyik meghatározó architektúrája. Az NVIDIA szerint ez biztosítja azt a nagy sávszélességű és alacsony késleltetésű GPU-k közötti kommunikációt, amely többek között a nagy léptékű expert parallelism és az elosztott KV-gyorsítótárazás működéséhez szükséges. A hatodik generációs NVLink technológia és NVLink Switches a vállalat állítása szerint 10x nagyobb csomagarányt és 3x alacsonyabb késleltetést nyújtanak, mint a kereskedelmi Ethernet-alternatívák.
A szoftveres rétegben az NVIDIA optimalizált CUDA kerneleket, az NVIDIA TensorRT LLM inferenciafuttatót és az NVIDIA Dynamo kiszolgáló keretrendszert említi. A teljes Vera Rubin platform a blog szerint hétchipes architektúra, amely a jelenlegi Vera Rubin NVL72 teljesítményadatokon túl magában foglalja az NVIDIA Vera CPU-t, a Groq 3 LPU-t, az NVLink 6 Switchet, a BlueField-4 DPU-t, a Spectrum-6 SPX-et és a ConnectX-9 SuperNIC-et.
Mit jelenthet ez a felhasználóknak és a piacnak
Az NVIDIA közlése alapján a Vera Rubin NVL72 fő ígérete az, hogy az agentikus AI-rendszerek hosszú kontextusú, soklépéses munkafolyamatait energiahatékonyabban lehet futtatni. Ez azoknál az ügyfeleknél lehet különösen lényeges, akiknél a rendelkezésre álló energia korlátozza az AI-infrastruktúra bővítését.
A vállalat szerint a Vera Rubin teljes gyártásban van, és az ökoszisztémában skálázódik. A blog azt is jelzi, hogy a teljesítmény a Vera Rubin NVL72 és a GB300 NVL72 esetében is tovább javulhat folyamatos szoftveroptimalizációkkal.
A felhasználói oldalról a hír nem egy új chatbotfunkcióról szól, hanem azokról az infrastruktúra-képességekről, amelyek a sok eszközhívást, alügynököt és hosszan növekvő kontextust használó AI-ügynökök futtatását tehetik hatékonyabbá. Az NVIDIA adatai szerint ennek mércéje egyre inkább a megawattonként elvégzett munka és az egymillió tokenre jutó költség lesz.


