Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az NVIDIA NVLink 6 többrétegű hibakezelést ígér az AI-gyáraknak

2026. szeptember 15.Forrás: NVIDIA Developer
Az NVIDIA NVLink 6 többrétegű hibakezelést ígér az AI-gyáraknak
Kép: NVIDIA Developer

Az NVIDIA szerint az NVLink 6 olyan többrétegű hibakezelési architektúrát kínál az AI-gyárak számára, amely a jelfeldolgozási hibákat, a hálózati torlódást és egyes szoftveres kieséseket is kezeli. A cél a csomagvesztés elkerülése és a nagy léptékű tanítási, illetve következtetési feladatok folyamatos futtatása.

A lényeg röviden
  • Az NVLink 6 fizikai és linkrétegbeli hibajavítást kombinál.
  • A kreditalapú folyamszabályozás tervezetten akadályozza meg a csomagvesztést.
  • Az NMX Controller és a redundáns komponensek helyben tartják a hibákat.
  • A Dynamo Shadow Engine Recovery B200 GPU-kon 7,3 másodperces helyreállítást mutatott.
  • Az NVLink Fusion egyedi XPU-khoz is elérhetővé teszi az NVLink skálázható fabricét.

A veszteségmentes hálózat alapjai

Az NVIDIA Developer szeptember 15-én közzétett ismertetője szerint a nagy AI-telepítésekben a ritka hibák is komoly teljesítményromlást okozhatnak. A tanítás során a klaszter GPU-inak másodpercenként több ezer kollektív műveletben kell szinkronizálniuk a gradienseket, a következtetésnél pedig minden kiesés csökkenti a kiszolgált kérések mennyiségét.

Az NVLink 6 a vállalat szerint natívan veszteségmentes hálózati szövetet biztosít. A fizikai rétegben könnyű előre irányuló hibajavítást, fizikai rétegbeli újraküldést, valamint UPHY-helyreállítást használ. A hibajavító kódokkal a fogadó oldal közvetlenül rekonstruálhatja a sérült biteket, az NVIDIA állítása szerint közel nulla késleltetési többlettel.

Ha egy hibasorozat meghaladja a hibajavítás képességeit, a Physical Layer Retry újraküldi az érintett adatokat. Fizikai kapcsolatkimaradás esetén az UPHY újrakalibrálja a kapcsolat paramétereit, miközben a csomagokat hardveres visszajátszási puffer tartja meg.

A forgalom szabályozása és a hibák elszigetelése

Az NVLink 6 linkrétege kreditalapú folyamszabályozást használ. A küldő csak akkor helyezhet csomagot a hálózatba, ha a következő hálózati csomópont elegendő pufferkapacitást jelző kredittel rendelkezik. Az NVIDIA szerint ez tervezetten kiküszöböli a csomagvesztést, és kiszámítható, alacsony késleltetésű működést tesz lehetővé.

A rendszer a fizikai kapcsolatok romlásakor automatikusan újraegyensúlyozza a hozzáférési és törzslinkeket. A vállalat szerint ezzel a hibák helyben tarthatók, így nem indulnak el a magasabb szintű újraküldések, időtúllépések és kollektív műveleti leállások.

Az architektúra redundáns kapcsolópolcokat, elosztott NMX Controller vezérlőket és két, sávon kívüli felügyeleti útvonalat is tartalmaz. Ezek célja, hogy egyes komponensek kiesése mellett is működőképes maradjon a tartomány.

Védelem a teljes AI-platform szintjén

Az NVIDIA a hibakezelést nem egyetlen technikára építi. A közlemény szerint a fizikai és linkrétegbeli védelem mellett a rendszer- és alkalmazásszintű helyreállítás is része az NVLink 6 megközelítésének.

A Vera Rubin NVL72 platform 72 Rubin GPU-t kapcsol össze egyetlen skálázható számítási tartományban, az NVLink 6 fabric használatával. Az NVIDIA ezt a Vera Rubin teljes veremű AI-gyárplatformjának központi, rackméretű számítási egységeként írja le.

A szoftveres oldalon a Dynamo Shadow Engine Recovery előmelegített másolatfolyamatot használ. Az ismertető szerint B200 GPU-kon ez 7,3 másodperc alatt állította helyre a következtetési kapacitást, szemben a hideg újraindítás 283 másodpercével. Az NCCL prototípusos támogatást kapott a cuda-checkpoint funkcióhoz is, amely több csomóponton készít ellenőrzési pontokat, és az NVIDIA szerint az általános elérhetőség az év végére várható. Az NVLink Fusion ugyanezt a többrétegű hibakezelési megközelítést egyedi XPU-kra is kiterjeszti.

Kapcsolódó hírek

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti
Chipek és infrastruktúra2026. október 2.

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti

A CoreWeave szerint a nagy AI-klaszterek értékét nem önmagában a hardver sebessége, hanem a ténylegesen elvégzett hasznos munka határozza meg. A vállalat az NVIDIA-val…

A Modal mindenki számára elérhetővé tette a többgépes GPU-klasztereket
Chipek és infrastruktúra2026. október 1.

A Modal mindenki számára elérhetővé tette a többgépes GPU-klasztereket

A Modal általánosan elérhetővé tette a Modal Clusters szolgáltatást, amely több számítási csomópontot kapcsol össze nagy léptékű modelltréninghez és következtetéshez. A…

Általánosan elérhetővé váltak a Modal többgépes AI-fürtjei
Chipek és infrastruktúra2026. október 1.

Általánosan elérhetővé váltak a Modal többgépes AI-fürtjei

A Modal általánosan elérhetővé tette a Modal Clusters szolgáltatást, amely több csomópontból álló AI-fürtök indítását és kezelését egyszerűsíti. A vállalat szerint a…