Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az NVIDIA szerint a Spectrum-X Ethernet a giga méretű AI-gyárak hálózati válasza

2026. augusztus 24.Forrás: NVIDIA Developer
Az NVIDIA szerint a Spectrum-X Ethernet a giga méretű AI-gyárak hálózati válasza
Kép: NVIDIA Developer

Az NVIDIA Developer blogján 2026. augusztus 24-én megjelent bejegyzés szerint a Spectrum-X Ethernet olyan hardveresen gyorsított hálózati architektúra, amelyet giga méretű AI-gyárakhoz terveztek. A vállalat szerint a megoldás kiszámítható alacsony késleltetést, magas hálózati kihasználtságot és jobb hibatűrést céloz a nagy AI-terhelések alatt.

A lényeg röviden
  • Az NVIDIA 2026. augusztus 24-én ismertette a Spectrum-X Ethernet architektúrát a Developer blogon.
  • A megoldás három hardveresen gyorsított vezérlési kört használ: Adaptive Routing, Congestion Control és Plane Load Balancing.
  • A Spectrum-X Multiplane technológia több mint 128 000 végpontig skálázást céloz.
  • Az NVIDIA szerint 10 százalékos linkhiba mellett a Spectrum-X Ethernet sávszélessége 11 százalékkal csökkent.
  • A DeepSeek-V3 szimulációban a Spectrum-X Ethernet 668 ms lépésidőt tartott torlódott több-bérlős környezetben is.

Miért szűk keresztmetszet a hálózat az AI-tanításban?

Az NVIDIA bejegyzése szerint a generatív AI gyors növekedése alapvetően megváltoztatta az adatközpontok tervezését. Ahogy az elosztott modelltanítás több százezer GPU-ra skálázódik, a csomópontokat összekötő scale-out hálózat elsődleges teljesítménykorláttá vált.

A cég szerint a hagyományos Ethernet évtizedeken át az enterprise és felhős hálózatok meghatározó technológiája volt, mert olcsó, szabványosított és jól kezeli az általános, nagy entrópiájú webes forgalmat. Az AI-terhelések viszont más mintázatot hoznak: a GPU-k folyamatosan szinkronizálnak olyan kollektív műveleteken keresztül, mint az All-Reduce, az All-Gather és az All-to-All, ezért viszonylag kevés, de nagyon nagy és időben összehangolt adatfolyam keletkezik.

Az NVIDIA három fő korlátot emel ki a hagyományos Ethernetnél. Az Equal-Cost Multi-Path, vagy ECMP statikus hash-alapú útválasztást használ, ezért nagy adatfolyamok ugyanarra a linkre kerülhetnek, miközben más utak kihasználatlanok maradnak. A torlódás túlcsordíthatja a switchpuffereket, ami csomagvesztést és újraküldést okozhat. A harmadik gond a lassú torlódásvezérlés: a Data Center Quantized Congestion Notification, vagy DCQCN protokollok a szinkronizált AI-kitörésekhez nehezen hangolhatók.

Három hardveres vezérlési körre épül a Spectrum-X Ethernet

Az NVIDIA szerint a Spectrum-X Ethernet lényege, hogy a nagy teljesítményű switcheket és a hosztoldali hálózati kártyákat, a NIC-eket együtt tervezi. A cél a torlódás valós idejű kezelése, mert 800 gigabit per másodperc, vagyis 800 Gbps és afölötti sebességnél a szoftveres vezérlési utak nem tudnak elég gyorsan reagálni a mikroszekundumos időskálán jelentkező változásokra.

Az első vezérlési kör az in-switch Adaptive Routing. A hagyományos, statikus ECMP helyett a Spectrum-X Ethernet switchek csomagonként választanak útvonalat. A bejegyzés szerint a switch a Join-Shortest-Queue algoritmus kvantált hardveres közelítését használja, és szubmikroszekundumos időközönként mintázza az ECMP-csoport minden kimeneti portjának sormélységét. A beérkező csomagot ezután a legkevésbé torlódott fizikai portra irányítja.

A második elem a célzott Congestion Control. Az NVIDIA leírása alapján a switch csak akkor generál Explicit Congestion Notification, vagy ECN jelöléseket, amikor az adaptív útválasztási kapacitás teljesen kimerült, és a sor tovább nő. A küldők pontos RTT-próbákat és ECN-jelöléseket használnak a küldési sebesség RTT időskálán történő módosítására.

A harmadik vezérlési kör a NIC-alapú Plane Load Balancing. Ez a Plane Load Balancer nevű dedikált hardvermotor a Spectrum-X Ethernet SuperNIC-ben működik, például az NVIDIA ConnectX-ben. Feladata, hogy a csomagokat több hálózati sík között ossza el, helyi sorvisszajelzés és végpontok közötti, síkonkénti torlódási telemetria alapján.

Multiplane topológia a több százezer végpont felé

A forrás szerint egy több százezer GPU-s AI-gyár skálázásához a hagyományos hálózati architektúrák további rétegeket igényelnek, például 2 szintes fat-tree topológiáról 3 szintesre kell váltani. Az NVIDIA szerint ez növeli a késleltetést és a jittert, terhelési egyensúlytalanságot hoz be, valamint jelentősen növeli az optika, a kábelezés és az energia költségét.

A Spectrum-X Multiplane technológia ezzel szemben a forrás szerint egyetlen hoszt sávszélességét több, fizikailag független, kétszintes fat-tree hálózati síkra bontja. A bejegyzés példaként 800 Gbps sávszélességet említ egy 8 sávos ConnectX SuperNIC esetében. Az NVIDIA szerint ez a megközelítés több mint 128 000 végpontig teszi lehetővé a skálázást a hagyományos többszintes topológiák késleltetése és jittere nélkül.

A Plane Load Balancer síkonként tart nyilván torlódási állapotot és helyi sormélységet, ami a forrás szerint segít a hibák elkülönítésében. Az NVIDIA mérései alapján a failover ideje 2,68 milliszekundum, míg hagyományos Ethernetnél 1,08 másodperc.

Mit jelenthet ez az AI-felhasználóknak és az üzemeltetőknek?

Az NVIDIA bejegyzése alapján a Spectrum-X Ethernet fő ígérete az, hogy az AI-tanítás közben jelentkező szinkronizált forgalmi csúcsokat kiszámíthatóbban kezeli. A cég egy DeepSeek-V3 LLM-tanítási szimulációt is idéz: a hagyományos Ethernet önálló futásban 735 ms tanítási lépésidőt ért el, háttérben futó zajforgalom mellett viszont 1,18 másodpercre nőtt, ami 1,6-szoros lassulás. A Spectrum-X Ethernet a forrás szerint 668 ms lépésidőt tartott önálló és erősen torlódott, több-bérlős körülmények között is.

A hibatűrésnél a forrás szintén jelentős különbséget állít. 10 százalékos hálózati linkhiba esetén a Spectrum-X Ethernet sávszélessége arányosan, 11 százalékkal csökkent, a farokkésleltetés pedig csak 7 százalékkal nőtt. A hagyományos Ethernet a bejegyzés szerint ilyen helyzetben 50 százalékkal vagy annál nagyobb mértékben esett vissza.

A piac számára ez azért fontos, mert az NVIDIA a hálózatot az AI-gyárak egyik meghatározó komponenseként kezeli, nem X, hanem Y szerkezet helyett itt konkrétan switchek, SuperNIC-ek, torlódásvezérlés és Multiplane topológia összehangolt rendszeréről beszél. A vállalat a részletes architekturális elemzéshez és értékelési eredményekhez a High-Speed Networking for Giga-Scale AI Factories whitepapert ajánlja.

Kapcsolódó hírek

AWS és NVIDIA: 2 millió új GPU agentic és fizikai AI-hoz
Chipek és infrastruktúra2026. szeptember 28.

AWS és NVIDIA: 2 millió új GPU agentic és fizikai AI-hoz

Az AWS és az NVIDIA 2 millió további GPU-t, valamint következő generációs infrastruktúrát készül biztosítani agentic és fizikai AI-feladatokhoz. A hírt az NVIDIA 2026.…

NVIDIA és pénzügyi partnerei 500 milliárd dollár feletti AI-infrastruktúra-finanszírozást céloznak
Cégek és üzlet2026. szeptember 28.

NVIDIA és pénzügyi partnerei 500 milliárd dollár feletti AI-infrastruktúra-finanszírozást céloznak

Több mint 500 milliárd dollárnyi külső tőke mozgósítását célzó finanszírozási platformokat hozna létre az NVIDIA több nagy pénzügyi szereplővel az AI-számítási…

BlueField-4-re épül az NVIDIA új Scale-In hálózati infrastruktúrája
Chipek és infrastruktúra2026. augusztus 24.

BlueField-4-re épül az NVIDIA új Scale-In hálózati infrastruktúrája

Az NVIDIA 2026. augusztus 24-én ismertette a Scale-In hálózati infrastruktúrát, amelyet az AI-gyárak hozzáférési, biztonsági, adattovábbítási és üzemeltetési feladataira…