Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az NVIDIA szerint a Vera Rubin NVL72 akár 30-szoros előnyt hoz agentikus AI-ban

2026. augusztus 24.Forrás: NVIDIA Developer
Az NVIDIA szerint a Vera Rubin NVL72 akár 30-szoros előnyt hoz agentikus AI-ban
Kép: NVIDIA Developer

Az NVIDIA 2026. augusztus 24-én közzétett fejlesztői blogbejegyzése szerint a Vera Rubin NVL72 előzetes mérésekben akár 30-szor nagyobb AI-gyári áteresztőképességet adott megawattonként, mint a GB300 NVL72. A vállalat a SemiAnalysis AgentX benchmarkjával vizsgálta az agentikus kódolási feladatok kiszolgálását.

A lényeg röviden
  • Az NVIDIA 2026. augusztus 24-én közölt AgentX-alapú eredményeket.
  • A Vera Rubin NVL72 előzetes mérésben akár 30-szor nagyobb megawattonkénti AI-gyári áteresztőképességet mutatott, mint a GB300 NVL72.
  • A GB300 NVL72 DeepSeek V4 Pro 1.6T alatt akár 15-ször jobb megawattonkénti áteresztőképességet ért el, mint a H200 NVL8.
  • Az NVIDIA szerint a GB300 NVL72 akár 10-szer alacsonyabb költséget ad egymillió tokenre vetítve, mint a H200 NVL8.
  • Az AgentX előre rögzített agentikus kódolási menetekkel méri a valószerű, többfordulós kiszolgálást.

Miért kellett új mérce az agentikus AI-hoz?

Az NVIDIA bejegyzése szerint az AI-ügynökök használata az egyszeri kérdés-válasz helyzetekből több lépéses munkafolyamatok felé tolódott el. Ezekben a rendszerekben a modell érvel, eszközöket hív meg, alügynököket koordinál, és a feladat előrehaladtával egyre nagyobb kontextust visz tovább egyik fordulóból a következőbe.

A cikk az OpenRouter State of AI jelentésére hivatkozva azt írja, hogy 100 trillió tokennyi valós használat alapján az átlagos prompttokenek száma kérésenként nagyjából négyszeresére nőtt, az egyes agentikus kérések pedig 15-ször annyi tokent fogyasztanak, mint a hagyományos chat.

Az NVIDIA szerint ez a terhelés másfajta mérést igényel. Egy hasznos benchmarknak kezelnie kell a hosszú kontextusú előfeldolgozást, a KV-cache újrahasznosítását, az interaktív generálást, az eszközhívások közti szüneteket, valamint az elosztott mixture of experts, röviden MoE végrehajtást valószerű párhuzamosság mellett.

Az AgentX valószerű ügynökmeneteket játszik vissza

Az AgentX a SemiAnalysis nyílt forrású InferenceX benchmarkcsomagjának agentikus kódolási tesztje. A célja annak mérése, hogy a gyorsítók mennyire hatékonyan szolgálják ki a valódi kódoló ügynökök által létrehozott kérésmintákat.

A módszer előre rögzített Claude Code meneteket játszik vissza fordulóról fordulóra, az AIPerf kliens használatával. A forrás szerint a visszajátszás megőrzi az egyes menetek kontextusát, a bemeneti és kimeneti szekvenciahosszokat, továbbá az eredeti folyamatban rögzített érvelési időt és eszközhívási késleltetést.

Ez azért fontos, mert az agentikus munkamenetek hosszúak, állapottartók és változók. A kérések hossza fordulóról fordulóra változhat, a kontextus felhalmozódik, a korábban feldolgozott tokenek újrahasznosíthatók, a modellhívásokat pedig eszközfuttatás vagy delegált munka szakíthatja meg.

Az AgentX több felhasználóiélmény-mutató mellett méri a tokenek számát megawattonként. A bejegyzés négy kiemelt mutatót sorol fel: E2E normalizált interaktivitás, standard interaktivitás, E2E késleltetés és time to first token, röviden TTFT. Az NVIDIA szerint az AI-gyárak számára a legfontosabb mérőszám a megawattonkénti tokenszám.

Vera Rubin NVL72: előzetes, felülvizsgálatra váró eredmények

Az NVIDIA közlése szerint a Vera Rubin NVL72 eredményeit a vállalat mérte a SemiAnalysis AgentX terhelésén, és ezek még SemiAnalysis-felülvizsgálatra várnak. A DeepSeek V4-Pro AgentX munkaterhelésen, felhasználónként 160 token per másodperces cél mellett a Vera Rubin NVL72 akár 30-szor nagyobb AI-gyári áteresztőképességet ért el megawattonként, mint a GB300 NVL72.

A vállalat értelmezése szerint ez jelentős növekedést jelez az agentikus következtetési kapacitásban úgy, hogy közben ugyanazt az interaktív kiszolgálási célt tartják. A forrás nem közöl általános elérhetőségi dátumot vagy árat a Vera Rubin NVL72-re, ezért ezekről a bejelentés alapján nem lehet következtetést levonni.

A GB300 NVL72 előnye a H200 NVL8-hoz képest

Az NVIDIA a Blackwell GB300 NVL72 teljesítményét is bemutatta az AgentX alatt. A DeepSeek V4 Pro 1.6T munkaterhelésen a GB300 NVL72 akár 15-ször nagyobb AI-gyári áteresztőképességet ért el megawattonként, mint a H200 NVL8.

A cég szerint ez közvetlenül a költségmutatókban is megjelenik: a GB300 NVL72 akár 10-szer alacsonyabb költséget ad egymillió tokenre vetítve, mint a H200 NVL8. Az NVIDIA úgy fogalmaz, hogy az üzemeltetők számára ez azt jelenti, hogy azonos energia- és infrastruktúra-keret mellett több interaktív agentikus kapacitás szolgálható ki, vagy ugyanaz a kapacitás alacsonyabb üzemeltetési költséggel biztosítható.

A bejegyzés szerint a GB300 NVL72 előnye nagyobb modellméretnél még hangsúlyosabb. A Kimi K3 2.8T AgentX munkaterhelésen a rendszer nagyjából 80-szoros megawattonkénti áteresztőképességet mutatott a H200 NVL8-hoz képest, összehasonlítható interaktivitás mellett.

Mit jelent ez az üzemeltetőknek és a felhasználóknak?

A forrás alapján a fő üzenet az, hogy az agentikus AI terjedésével a puszta, rögzített hosszúságú szekvenciákon mért teljesítmény egyre kevésbé írja le a valós kiszolgálási helyzeteket. Az NVIDIA szerint a korábbi InferenceX statikus 8K/1K szekvenciahosszú DeepSeek-R1-0528 tesztben a GB300 NVL72 akár 40-szer több tokent adott megawattonként a H200-hoz képest, de ez ellenőrzött, fix hosszúságú kiszolgálást jelentett.

Az AgentX ezzel szemben olyan helyzeteket mér, ahol a kontextus növekszik, az ügynök eszközöket használ, és a rendszernek a gyors válaszidőt is tartania kell. A felhasználók szempontjából ez azért lényeges, mert az interaktív ügynökök gyakran kezdenek hosszú kontextusú fordulókat, ahol a TTFT és a teljes kérés késleltetése is befolyásolja az élményt.

Az NVIDIA a rendszeroldali optimalizációk között MoE-kiszolgáló futtatókörnyezeteket említ, köztük az SGLang, TensorRT-LLM és vLLM megoldásokat, továbbá DeepGEMM-alapú kerneleket MXFP4 és MXFP8 formátumokkal, az NVIDIA Dynamo rendszert az előfeldolgozás és a generálás szétválasztására, valamint az NVIDIA NVLink scale-up fabric technológiát. A vállalat szerint ezek együtt segítik a többfordulós kiszolgálást, ahogy az ügynökmenetek növekednek.

Kapcsolódó hírek

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti
Chipek és infrastruktúra2026. október 2.

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti

A CoreWeave szerint a nagy AI-klaszterek értékét nem önmagában a hardver sebessége, hanem a ténylegesen elvégzett hasznos munka határozza meg. A vállalat az NVIDIA-val…

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell
Chipek és infrastruktúra2026. október 2.

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell

A GPU-k önmagukban már nem bizonyítják, hogy egy AI-infrastruktúra készen áll a termelésre. A CoreWeave és az NVIDIA a számítási kapacitást, a hálózatot, a tárhelyet, az…

Chipek és infrastruktúra
Chipek és infrastruktúra2026. október 2.

A CoreWeave oldala szerint megérkezett az NVIDIA Blackwell Platform

A CoreWeave weboldalán az NVIDIA Blackwell Platform érkezését jelző bejegyzés jelent meg. A 2026. október 2-i oldalon a cím mellett azonban nem szerepelnek részletes…