Világrekordot ért el az NVIDIA GB300 NVL72 MoE-modellek tanításában

Az NVIDIA szerint a GB300 NVL72 rackméretű rendszer világrekordot állított fel a DeepSeek-V3 671B kevert szakértői modell előtanításában. A 256 GPU-val végzett mérés 1648 TFLOPs teljesítményt ért el GPU-nként.
- A GB300 NVL72 a DeepSeek-V3 671B modellen 1648 TFLOPs teljesítményt ért el GPU-nként.
- A mérés 256 GPU használatával készült.
- A rendszer 72 Blackwell Ultra GPU-t kapcsol össze egy rackben.
- A Megatron Core 98,5 százalékos GPU-nkénti teljesítményt tartott meg 1024 GPU-ra skálázva.
- Az NVIDIA szerint a szoftveres optimalizálások hat hónap alatt 1,5-szeres gyorsulást hoztak ugyanazon a hardveren.
A kommunikáció lett a nagy MoE-modellek egyik fő korlátja
A kevert szakértői, vagyis mixture of experts, MoE-modellek minden token feldolgozásakor csak a paraméterek egy részét aktiválják. Az NVIDIA példája szerint a DeepSeek-V3 összesen 671 milliárd paramétert tartalmaz, tokenenként azonban körülbelül 37 milliárd paramétert aktivál. Ez csökkenti az egy tokenre jutó számítási igényt, ugyanakkor jelentős kommunikációs terhet ró a GPU-kra.
Az egyes szakértők több GPU-n helyezkednek el, ezért minden MoE-rétegben el kell juttatni a tokeneket a megfelelő szakértőkhöz, majd össze kell gyűjteni az eredményeket. Ez az úgynevezett all-to-all kommunikáció az előre- és a visszafelé irányuló számításban is megjelenik. Az NVIDIA szerint a késleltetések rétegenként és tanítási lépésenként összeadódhatnak, így egy idő után a további GPU-k hozzáadása már nem növeli arányosan a teljesítményt.
72 Blackwell Ultra GPU dolgozik egy rackben
A GB300 NVL72 rendszer központi eleme az ötödik generációs NVLink összeköttetés, amely 72 NVIDIA Blackwell Ultra GPU-t kapcsol össze. Az NVIDIA közlése szerint minden GPU 1,8 TB/s sávszélességet kap, a rackben pedig 130 TB/s nem blokkoló, all-to-all sávszélesség áll rendelkezésre. Így minden GPU egyetlen ugrással elérheti a többi GPU-t.
Az NVLink memóriaszemantikus kapcsolatként működik. A GPU-k közvetlenül olvashatják és írhatják egy másik GPU HBM memóriáját, a vállalat szerint natív betöltési és tárolási műveletekkel. A rendszerben a redukciók a kapcsolóban, az adatok áthaladása közben is végrehajthatók. A racken kívüli kommunikációt NVIDIA ConnectX-8 SuperNIC-ek biztosítják, GPU-nként 800 Gbps sebességgel, NVIDIA Quantum-X800 InfiniBand vagy NVIDIA Spectrum-X Ethernet hálózaton.
A platformhoz NVIDIA BlueField adatfeldolgozó egységek is kapcsolódhatnak. Ezek elkülönített infrastruktúra-feldolgozási tartományt biztosítanak a virtuális hálózatkezeléshez, a tárhelyeléréshez, a biztonsághoz, a telemetriához és az életciklus-kezeléshez, ezzel csökkentve a gazdagép processzorának terhelését.
A szoftver hat hónap alatt 1,5-szeres gyorsulást hozott
A DeepSeek-V3 671B 256 GPU-s előtanításában a Megatron Core 1648 TFLOPs teljesítményt ért el GPU-nként a GB300 NVL72 rendszeren. Összehasonlításként az NVIDIA korábbi, GB200 NVL72 rendszeren mért eredménye 606 TFLOPs volt GPU-nként. A vállalat ezt nagyjából háromszoros, generáción belüli növekedésként írja le.
Az NVIDIA szerint ugyanazon a GB300 NVL72 hardveren hat hónap alatt 1,5-szeres javulást értek el kizárólag szoftveres fejlesztésekkel. A TorchTitan optimalizálásaival körülbelül hatszoros, a JAX fejlesztéseivel pedig közel tízszeres teljesítményjavulást jelentettek ugyanazon az infrastruktúrán. A JAX legfrissebb szoftververziója 1025 TFLOPs GPU-nkénti áteresztést ért el a megadott mérésben.
A nagyobb klaszterekben is megmarad a teljesítmény
Az NVIDIA a DeepSeek-V3 671B előtanítását 256-ról 1024 GPU-ra skálázta. A Megatron Core 98,5 százalékon tartotta az egy GPU-ra jutó teljesítményt, míg a TorchTitan és a JAX egyaránt 97 százalékot őrzött meg. A vállalat szerint ez azt mutatja, hogy az 800 Gbps sebességű, GPU-nkénti hálózat képes a gradiensforgalmat a számítás mögött tartani.
Felhasználói és kutatói szempontból a bejelentés azt jelenti, hogy az NVIDIA által bemutatott hardveres és szoftveres fejlesztések ugyanazon tanítási feladat nagyobb klasztereken történő futtatását célozzák. Az NVIDIA szerint a jobb előtanítási hatékonyság lehetővé teszi nagyobb modellek tanítását és több kísérlet futtatását ugyanazon infrastruktúrán.
NVIDIA Developer: Setting a World Record for MoE Pre-Training on NVIDIA GB300 NVL72

