Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Világrekordot ért el az NVIDIA GB300 NVL72 MoE-modellek tanításában

2026. július 21.Forrás: NVIDIA Developer
Világrekordot ért el az NVIDIA GB300 NVL72 MoE-modellek tanításában
Kép: NVIDIA Developer

Az NVIDIA szerint a GB300 NVL72 rackméretű rendszer világrekordot állított fel a DeepSeek-V3 671B kevert szakértői modell előtanításában. A 256 GPU-val végzett mérés 1648 TFLOPs teljesítményt ért el GPU-nként.

A lényeg röviden
  • A GB300 NVL72 a DeepSeek-V3 671B modellen 1648 TFLOPs teljesítményt ért el GPU-nként.
  • A mérés 256 GPU használatával készült.
  • A rendszer 72 Blackwell Ultra GPU-t kapcsol össze egy rackben.
  • A Megatron Core 98,5 százalékos GPU-nkénti teljesítményt tartott meg 1024 GPU-ra skálázva.
  • Az NVIDIA szerint a szoftveres optimalizálások hat hónap alatt 1,5-szeres gyorsulást hoztak ugyanazon a hardveren.

A kommunikáció lett a nagy MoE-modellek egyik fő korlátja

A kevert szakértői, vagyis mixture of experts, MoE-modellek minden token feldolgozásakor csak a paraméterek egy részét aktiválják. Az NVIDIA példája szerint a DeepSeek-V3 összesen 671 milliárd paramétert tartalmaz, tokenenként azonban körülbelül 37 milliárd paramétert aktivál. Ez csökkenti az egy tokenre jutó számítási igényt, ugyanakkor jelentős kommunikációs terhet ró a GPU-kra.

Az egyes szakértők több GPU-n helyezkednek el, ezért minden MoE-rétegben el kell juttatni a tokeneket a megfelelő szakértőkhöz, majd össze kell gyűjteni az eredményeket. Ez az úgynevezett all-to-all kommunikáció az előre- és a visszafelé irányuló számításban is megjelenik. Az NVIDIA szerint a késleltetések rétegenként és tanítási lépésenként összeadódhatnak, így egy idő után a további GPU-k hozzáadása már nem növeli arányosan a teljesítményt.

72 Blackwell Ultra GPU dolgozik egy rackben

A GB300 NVL72 rendszer központi eleme az ötödik generációs NVLink összeköttetés, amely 72 NVIDIA Blackwell Ultra GPU-t kapcsol össze. Az NVIDIA közlése szerint minden GPU 1,8 TB/s sávszélességet kap, a rackben pedig 130 TB/s nem blokkoló, all-to-all sávszélesség áll rendelkezésre. Így minden GPU egyetlen ugrással elérheti a többi GPU-t.

Az NVLink memóriaszemantikus kapcsolatként működik. A GPU-k közvetlenül olvashatják és írhatják egy másik GPU HBM memóriáját, a vállalat szerint natív betöltési és tárolási műveletekkel. A rendszerben a redukciók a kapcsolóban, az adatok áthaladása közben is végrehajthatók. A racken kívüli kommunikációt NVIDIA ConnectX-8 SuperNIC-ek biztosítják, GPU-nként 800 Gbps sebességgel, NVIDIA Quantum-X800 InfiniBand vagy NVIDIA Spectrum-X Ethernet hálózaton.

A platformhoz NVIDIA BlueField adatfeldolgozó egységek is kapcsolódhatnak. Ezek elkülönített infrastruktúra-feldolgozási tartományt biztosítanak a virtuális hálózatkezeléshez, a tárhelyeléréshez, a biztonsághoz, a telemetriához és az életciklus-kezeléshez, ezzel csökkentve a gazdagép processzorának terhelését.

A szoftver hat hónap alatt 1,5-szeres gyorsulást hozott

A DeepSeek-V3 671B 256 GPU-s előtanításában a Megatron Core 1648 TFLOPs teljesítményt ért el GPU-nként a GB300 NVL72 rendszeren. Összehasonlításként az NVIDIA korábbi, GB200 NVL72 rendszeren mért eredménye 606 TFLOPs volt GPU-nként. A vállalat ezt nagyjából háromszoros, generáción belüli növekedésként írja le.

Az NVIDIA szerint ugyanazon a GB300 NVL72 hardveren hat hónap alatt 1,5-szeres javulást értek el kizárólag szoftveres fejlesztésekkel. A TorchTitan optimalizálásaival körülbelül hatszoros, a JAX fejlesztéseivel pedig közel tízszeres teljesítményjavulást jelentettek ugyanazon az infrastruktúrán. A JAX legfrissebb szoftververziója 1025 TFLOPs GPU-nkénti áteresztést ért el a megadott mérésben.

A nagyobb klaszterekben is megmarad a teljesítmény

Az NVIDIA a DeepSeek-V3 671B előtanítását 256-ról 1024 GPU-ra skálázta. A Megatron Core 98,5 százalékon tartotta az egy GPU-ra jutó teljesítményt, míg a TorchTitan és a JAX egyaránt 97 százalékot őrzött meg. A vállalat szerint ez azt mutatja, hogy az 800 Gbps sebességű, GPU-nkénti hálózat képes a gradiensforgalmat a számítás mögött tartani.

Felhasználói és kutatói szempontból a bejelentés azt jelenti, hogy az NVIDIA által bemutatott hardveres és szoftveres fejlesztések ugyanazon tanítási feladat nagyobb klasztereken történő futtatását célozzák. Az NVIDIA szerint a jobb előtanítási hatékonyság lehetővé teszi nagyobb modellek tanítását és több kísérlet futtatását ugyanazon infrastruktúrán.

Kapcsolódó hírek

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti
Chipek és infrastruktúra2026. október 2.

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti

A CoreWeave szerint a nagy AI-klaszterek értékét nem önmagában a hardver sebessége, hanem a ténylegesen elvégzett hasznos munka határozza meg. A vállalat az NVIDIA-val…

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell
Chipek és infrastruktúra2026. október 2.

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell

A GPU-k önmagukban már nem bizonyítják, hogy egy AI-infrastruktúra készen áll a termelésre. A CoreWeave és az NVIDIA a számítási kapacitást, a hálózatot, a tárhelyet, az…

Chipek és infrastruktúra
Chipek és infrastruktúra2026. október 2.

A CoreWeave szerint az NVIDIA H100 dominálta az MLPerf v3.0 eredményeit

A CoreWeave szerint az NVIDIA H100 dominálta az új MLPerf v3.0 benchmark eredményeit. A vállalat 2026. október 2-án közzétett oldalának címe erre a teljesítményre hívja…