Az NVIDIA bitre pontos determinisztikussá tenné a nagy modelltréninget

Az NVIDIA a Megatron Core olyan munkafolyamatát mutatta be, amely bitre pontosan reprodukálhatóvá teheti a nagyméretű modellek előtanítását. A megközelítés rangonként, rendezett módon rögzített tenzor-ujjlenyomatokkal segít megtalálni a nemdeterminisztikus működés első eltérését.
- A Megatron Core bitre pontosan reprodukálható előtanítást céloz.
- A rendszer rangonként rögzített tenzor-ujjlenyomatokkal keresi az első eltérést.
- A módszer támogatja a hibák visszajátszását és a megszakított tréning folytatását.
- A determinizmus többletköltségét körülbelül 2 százalékra csökkentették 2432 GPU-n.
- A beszámoló szerint 800 lépésen át fennmaradt a bitre pontos eredmény.
Miért fontos a bitre pontos reprodukció?
A bitre pontos determinizmus azt jelenti, hogy azonos adatsorrend, architektúra, tanítási recept, párhuzamosítás, szoftveres környezet, futásidejű beállítások és hardver mellett az önállóan elindított, illetve a visszaállított ellenőrzőpontból folytatott futások ugyanazt a numerikus pályát követik.
Az NVIDIA szerint ez különösen fontos a több billió paraméteres modellek ezreket számláló GPU-kon végzett előtanításánál. Ilyen környezetben egy hibát nehéz lehet ugyanazon a ponton újra előidézni, miközben a párhuzamosítás több dimenziója, az alacsony pontosságú számítás és az elosztott ellenőrzőpont-kezelés tovább bonyolítja a hibakeresést.
A reprodukálhatóság lehetővé teszi a veszteség kiugrásának ugyanazon lépésben történő visszajátszását, a megszakított tanítás folytatását azonos numerikus pályán, valamint a szoftveres és hardveres változások hatásának elkülönítését. Az NVIDIA szerint egy billió paraméteres modellnél már kis lassulás is több ezer GPU-napot jelenthet, ezért a determinizmusnak hatékonynak kell maradnia.
Ujjlenyomatokkal keresik az első eltérést
A Megatron-LM 7262-es pull requestje olyan eljárást javasol, amely minden ranghoz rendezett, tenzorszintű ujjlenyomatokat rögzít. A vizsgálat a teljes tanítási lépéstől fokozatosan szűkíthető egy fázisra, modulra, műveletre vagy kernelre.
A folyamat először olyan metrikákon keres eltérést, mint a tanítási veszteség, a nyelvi modellezési veszteség, a terheléskiegyenlítési veszteség, a többtokenes predikció vesztesége és a gradiensnorma. Ezután a kommunikációs műveletek, a csővezetékes kommunikáció, az újraszámítás, az optimalizáló műveletei és a gradiensek redukciója is vizsgálható.
A cél annak azonosítása, hogy két futás azonos bemeneti ujjlenyomatok mellett eltérő kimenetet adott-e. A rangok külön-külön jelzik az első eltérést, mivel a sorszámok nem alkalmasak a rangok közötti sorrend megállapítására. Ha több rang ugyanazt a műveletet jelöli meg, maga a művelet lehet nemdeterminisztikus. Ha csak néhány rang tér el, a topológiát, a rangok elhelyezését, a bemenetek eloszlását és a redukció sorrendjét kell vizsgálni.
A javítás ellenőrzése és a teljesítmény ára
A javasolt munkafolyamat GPU-n futó ujjlenyomatokat használ, és a tenzor alakját, adattípusát, elemszámát, valamint kivonatát is rögzíti. Az MXFP8 és NVFP4 tenzoroknál az értékek mellett a skálapuffereket is vizsgálni kell. Az NVIDIA külön kiemeli, hogy a teljes tenzoron végzett XOR-ujjlenyomat nem érzékeli a permutációkat, ezért a sorrendérzékeny adatok, például az útválasztási térképek és a MoE-kiküldések esetében sor- vagy darabszintű vizsgálat szükséges. Az ujjlenyomat egyezése önmagában nem bizonyítja a bitenkénti azonosságot, ezt bájtszintű összehasonlítással kell megerősíteni.
A hibakeresés során ki kell zárni a nem inicializált tenzorokat, a be nem fejezett aszinkron kollektív műveleteket és az érvénytelenül korán olvasott, nem blokkoló másolásokat. A Megatron Core a regressziók ellen receptvalidálással, kerneltesztekkel és modulvalidálással védekezik, több párhuzamosítási beállításban, FP8 és FP4 használata mellett is.
Az NVIDIA három Nemotron-munkaterhelés optimalizálásával körülbelül 2 százalékra csökkentette a determinizmus többletköltségét 2432 GPU-n, miközben 800 lépésen át bitre pontos eredményeket tartott fenn. A fejlesztői oldal szerint a felhasználóknak független, illetve ellenőrzőpontról folytatott futásokat kell összehasonlítaniuk a reprodukálhatóság ellenőrzéséhez.
NVIDIA Developer: Scale Bitwise-Deterministic Pretraining with NVIDIA Megatron Core


