Az NVIDIA szerint a Spectrum-X Ethernet a giga méretű AI-gyárak hálózati válasza

Az NVIDIA Developer blogján 2026. augusztus 24-én megjelent bejegyzés szerint a Spectrum-X Ethernet olyan hardveresen gyorsított hálózati architektúra, amelyet giga méretű AI-gyárakhoz terveztek. A vállalat szerint a megoldás kiszámítható alacsony késleltetést, magas hálózati kihasználtságot és jobb hibatűrést céloz a nagy AI-terhelések alatt.
- Az NVIDIA 2026. augusztus 24-én ismertette a Spectrum-X Ethernet architektúrát a Developer blogon.
- A megoldás három hardveresen gyorsított vezérlési kört használ: Adaptive Routing, Congestion Control és Plane Load Balancing.
- A Spectrum-X Multiplane technológia több mint 128 000 végpontig skálázást céloz.
- Az NVIDIA szerint 10 százalékos linkhiba mellett a Spectrum-X Ethernet sávszélessége 11 százalékkal csökkent.
- A DeepSeek-V3 szimulációban a Spectrum-X Ethernet 668 ms lépésidőt tartott torlódott több-bérlős környezetben is.
Miért szűk keresztmetszet a hálózat az AI-tanításban?
Az NVIDIA bejegyzése szerint a generatív AI gyors növekedése alapvetően megváltoztatta az adatközpontok tervezését. Ahogy az elosztott modelltanítás több százezer GPU-ra skálázódik, a csomópontokat összekötő scale-out hálózat elsődleges teljesítménykorláttá vált.
A cég szerint a hagyományos Ethernet évtizedeken át az enterprise és felhős hálózatok meghatározó technológiája volt, mert olcsó, szabványosított és jól kezeli az általános, nagy entrópiájú webes forgalmat. Az AI-terhelések viszont más mintázatot hoznak: a GPU-k folyamatosan szinkronizálnak olyan kollektív műveleteken keresztül, mint az All-Reduce, az All-Gather és az All-to-All, ezért viszonylag kevés, de nagyon nagy és időben összehangolt adatfolyam keletkezik.
Az NVIDIA három fő korlátot emel ki a hagyományos Ethernetnél. Az Equal-Cost Multi-Path, vagy ECMP statikus hash-alapú útválasztást használ, ezért nagy adatfolyamok ugyanarra a linkre kerülhetnek, miközben más utak kihasználatlanok maradnak. A torlódás túlcsordíthatja a switchpuffereket, ami csomagvesztést és újraküldést okozhat. A harmadik gond a lassú torlódásvezérlés: a Data Center Quantized Congestion Notification, vagy DCQCN protokollok a szinkronizált AI-kitörésekhez nehezen hangolhatók.
Három hardveres vezérlési körre épül a Spectrum-X Ethernet
Az NVIDIA szerint a Spectrum-X Ethernet lényege, hogy a nagy teljesítményű switcheket és a hosztoldali hálózati kártyákat, a NIC-eket együtt tervezi. A cél a torlódás valós idejű kezelése, mert 800 gigabit per másodperc, vagyis 800 Gbps és afölötti sebességnél a szoftveres vezérlési utak nem tudnak elég gyorsan reagálni a mikroszekundumos időskálán jelentkező változásokra.
Az első vezérlési kör az in-switch Adaptive Routing. A hagyományos, statikus ECMP helyett a Spectrum-X Ethernet switchek csomagonként választanak útvonalat. A bejegyzés szerint a switch a Join-Shortest-Queue algoritmus kvantált hardveres közelítését használja, és szubmikroszekundumos időközönként mintázza az ECMP-csoport minden kimeneti portjának sormélységét. A beérkező csomagot ezután a legkevésbé torlódott fizikai portra irányítja.
A második elem a célzott Congestion Control. Az NVIDIA leírása alapján a switch csak akkor generál Explicit Congestion Notification, vagy ECN jelöléseket, amikor az adaptív útválasztási kapacitás teljesen kimerült, és a sor tovább nő. A küldők pontos RTT-próbákat és ECN-jelöléseket használnak a küldési sebesség RTT időskálán történő módosítására.
A harmadik vezérlési kör a NIC-alapú Plane Load Balancing. Ez a Plane Load Balancer nevű dedikált hardvermotor a Spectrum-X Ethernet SuperNIC-ben működik, például az NVIDIA ConnectX-ben. Feladata, hogy a csomagokat több hálózati sík között ossza el, helyi sorvisszajelzés és végpontok közötti, síkonkénti torlódási telemetria alapján.
Multiplane topológia a több százezer végpont felé
A forrás szerint egy több százezer GPU-s AI-gyár skálázásához a hagyományos hálózati architektúrák további rétegeket igényelnek, például 2 szintes fat-tree topológiáról 3 szintesre kell váltani. Az NVIDIA szerint ez növeli a késleltetést és a jittert, terhelési egyensúlytalanságot hoz be, valamint jelentősen növeli az optika, a kábelezés és az energia költségét.
A Spectrum-X Multiplane technológia ezzel szemben a forrás szerint egyetlen hoszt sávszélességét több, fizikailag független, kétszintes fat-tree hálózati síkra bontja. A bejegyzés példaként 800 Gbps sávszélességet említ egy 8 sávos ConnectX SuperNIC esetében. Az NVIDIA szerint ez a megközelítés több mint 128 000 végpontig teszi lehetővé a skálázást a hagyományos többszintes topológiák késleltetése és jittere nélkül.
A Plane Load Balancer síkonként tart nyilván torlódási állapotot és helyi sormélységet, ami a forrás szerint segít a hibák elkülönítésében. Az NVIDIA mérései alapján a failover ideje 2,68 milliszekundum, míg hagyományos Ethernetnél 1,08 másodperc.
Mit jelenthet ez az AI-felhasználóknak és az üzemeltetőknek?
Az NVIDIA bejegyzése alapján a Spectrum-X Ethernet fő ígérete az, hogy az AI-tanítás közben jelentkező szinkronizált forgalmi csúcsokat kiszámíthatóbban kezeli. A cég egy DeepSeek-V3 LLM-tanítási szimulációt is idéz: a hagyományos Ethernet önálló futásban 735 ms tanítási lépésidőt ért el, háttérben futó zajforgalom mellett viszont 1,18 másodpercre nőtt, ami 1,6-szoros lassulás. A Spectrum-X Ethernet a forrás szerint 668 ms lépésidőt tartott önálló és erősen torlódott, több-bérlős körülmények között is.
A hibatűrésnél a forrás szintén jelentős különbséget állít. 10 százalékos hálózati linkhiba esetén a Spectrum-X Ethernet sávszélessége arányosan, 11 százalékkal csökkent, a farokkésleltetés pedig csak 7 százalékkal nőtt. A hagyományos Ethernet a bejegyzés szerint ilyen helyzetben 50 százalékkal vagy annál nagyobb mértékben esett vissza.
A piac számára ez azért fontos, mert az NVIDIA a hálózatot az AI-gyárak egyik meghatározó komponenseként kezeli, nem X, hanem Y szerkezet helyett itt konkrétan switchek, SuperNIC-ek, torlódásvezérlés és Multiplane topológia összehangolt rendszeréről beszél. A vállalat a részletes architekturális elemzéshez és értékelési eredményekhez a High-Speed Networking for Giga-Scale AI Factories whitepapert ajánlja.
NVIDIA Developer: Giga-Scale AI and the Ethernet Evolution: How Spectrum-X Ethernet Rewrites the Rules


