Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az NVIDIA bitre pontos determinisztikussá tenné a nagy modelltréninget

2026. október 6. 21:58Forrás: NVIDIA Developer
Az NVIDIA bitre pontos determinisztikussá tenné a nagy modelltréninget
Kép: NVIDIA Developer

Az NVIDIA a Megatron Core olyan munkafolyamatát mutatta be, amely bitre pontosan reprodukálhatóvá teheti a nagyméretű modellek előtanítását. A megközelítés rangonként, rendezett módon rögzített tenzor-ujjlenyomatokkal segít megtalálni a nemdeterminisztikus működés első eltérését.

A lényeg röviden
  • A Megatron Core bitre pontosan reprodukálható előtanítást céloz.
  • A rendszer rangonként rögzített tenzor-ujjlenyomatokkal keresi az első eltérést.
  • A módszer támogatja a hibák visszajátszását és a megszakított tréning folytatását.
  • A determinizmus többletköltségét körülbelül 2 százalékra csökkentették 2432 GPU-n.
  • A beszámoló szerint 800 lépésen át fennmaradt a bitre pontos eredmény.

Miért fontos a bitre pontos reprodukció?

A bitre pontos determinizmus azt jelenti, hogy azonos adatsorrend, architektúra, tanítási recept, párhuzamosítás, szoftveres környezet, futásidejű beállítások és hardver mellett az önállóan elindított, illetve a visszaállított ellenőrzőpontból folytatott futások ugyanazt a numerikus pályát követik.

Az NVIDIA szerint ez különösen fontos a több billió paraméteres modellek ezreket számláló GPU-kon végzett előtanításánál. Ilyen környezetben egy hibát nehéz lehet ugyanazon a ponton újra előidézni, miközben a párhuzamosítás több dimenziója, az alacsony pontosságú számítás és az elosztott ellenőrzőpont-kezelés tovább bonyolítja a hibakeresést.

A reprodukálhatóság lehetővé teszi a veszteség kiugrásának ugyanazon lépésben történő visszajátszását, a megszakított tanítás folytatását azonos numerikus pályán, valamint a szoftveres és hardveres változások hatásának elkülönítését. Az NVIDIA szerint egy billió paraméteres modellnél már kis lassulás is több ezer GPU-napot jelenthet, ezért a determinizmusnak hatékonynak kell maradnia.

Ujjlenyomatokkal keresik az első eltérést

A Megatron-LM 7262-es pull requestje olyan eljárást javasol, amely minden ranghoz rendezett, tenzorszintű ujjlenyomatokat rögzít. A vizsgálat a teljes tanítási lépéstől fokozatosan szűkíthető egy fázisra, modulra, műveletre vagy kernelre.

A folyamat először olyan metrikákon keres eltérést, mint a tanítási veszteség, a nyelvi modellezési veszteség, a terheléskiegyenlítési veszteség, a többtokenes predikció vesztesége és a gradiensnorma. Ezután a kommunikációs műveletek, a csővezetékes kommunikáció, az újraszámítás, az optimalizáló műveletei és a gradiensek redukciója is vizsgálható.

A cél annak azonosítása, hogy két futás azonos bemeneti ujjlenyomatok mellett eltérő kimenetet adott-e. A rangok külön-külön jelzik az első eltérést, mivel a sorszámok nem alkalmasak a rangok közötti sorrend megállapítására. Ha több rang ugyanazt a műveletet jelöli meg, maga a művelet lehet nemdeterminisztikus. Ha csak néhány rang tér el, a topológiát, a rangok elhelyezését, a bemenetek eloszlását és a redukció sorrendjét kell vizsgálni.

A javítás ellenőrzése és a teljesítmény ára

A javasolt munkafolyamat GPU-n futó ujjlenyomatokat használ, és a tenzor alakját, adattípusát, elemszámát, valamint kivonatát is rögzíti. Az MXFP8 és NVFP4 tenzoroknál az értékek mellett a skálapuffereket is vizsgálni kell. Az NVIDIA külön kiemeli, hogy a teljes tenzoron végzett XOR-ujjlenyomat nem érzékeli a permutációkat, ezért a sorrendérzékeny adatok, például az útválasztási térképek és a MoE-kiküldések esetében sor- vagy darabszintű vizsgálat szükséges. Az ujjlenyomat egyezése önmagában nem bizonyítja a bitenkénti azonosságot, ezt bájtszintű összehasonlítással kell megerősíteni.

A hibakeresés során ki kell zárni a nem inicializált tenzorokat, a be nem fejezett aszinkron kollektív műveleteket és az érvénytelenül korán olvasott, nem blokkoló másolásokat. A Megatron Core a regressziók ellen receptvalidálással, kerneltesztekkel és modulvalidálással védekezik, több párhuzamosítási beállításban, FP8 és FP4 használata mellett is.

Az NVIDIA három Nemotron-munkaterhelés optimalizálásával körülbelül 2 százalékra csökkentette a determinizmus többletköltségét 2432 GPU-n, miközben 800 lépésen át bitre pontos eredményeket tartott fenn. A fejlesztői oldal szerint a felhasználóknak független, illetve ellenőrzőpontról folytatott futásokat kell összehasonlítaniuk a reprodukálhatóság ellenőrzéséhez.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Második lett az NVIDIA csapata a KDD Cup adatügynök-versenyén
Fejlesztőknek2026. október 8. 20:30

Második lett az NVIDIA csapata a KDD Cup adatügynök-versenyén

Második helyezést ért el az NVIDIA KGMON csapata a KDD Cup 2026 Data Agents versenyén. A rendszer egy kis, rögzített nyelvi modell köré épített szűk eszköztárral…

Az NVIDIA digitális ikrekkel tesztelné az AI-gyárak módosításait
Termékek és eszközök2026. október 7. 18:00

Az NVIDIA digitális ikrekkel tesztelné az AI-gyárak módosításait

Az NVIDIA olyan munkafolyamatot mutatott be, amelyben digitális iker és AI-ügynökök ellenőrzik az AI-gyárak támogatott konfigurációit és szoftverintegrációit, még a…

Az NVIDIA cuPhoton hónapok helyett percek alatt dolgozhatja fel a tudományos képeket
Fejlesztőknek2026. október 7. 17:00

Az NVIDIA cuPhoton hónapok helyett percek alatt dolgozhatja fel a tudományos képeket

Az NVIDIA bemutatta a cuPhoton nyílt forráskódú CUDA-X eszköztárat, amely a tudományos képek betöltésétől az elemzésig GPU-n tartja az adatokat. A vállalat szerint a…