Folyadékhűtés duplázza az AI-rackek hálózati kapacitását a CoreWeave szerint

A CoreWeave az NVIDIA Spectrum-X Ethernet SN6600-LD folyadékhűtéses kapcsolóit telepítette Vera Rubin NVL72 rendszereihez. A vállalat szerint az új hálózati infrastruktúra rackenként 1,64 Pb/s kapcsolási kapacitást és a korábbi megoldáshoz képest kétszeres teljesítményt kínál.
- A CoreWeave az NVIDIA Spectrum-X SN6600-LD kapcsolókat telepítette Vera Rubin NVL72 rendszereihez.
- Az SN6600-LD kapcsolónként 102,4 Tb/s, rackenként pedig 1,64 Pb/s kapacitást kínál.
- A vállalat szerint a korábbi megoldáshoz képest kétszeres a rackenkénti kapcsolási teljesítmény.
- A CoreWeave 62,5 százalékos helymegtakarítást és 30 százalékos energiahatékonysági javulást mér 16 000 GPU mellett.
- A Valvey, Racky és a Rack Lifecycle Controller közös rack-szintű vezérlést biztosít.
102,4 Tb/s egyetlen kapcsolóban
A CoreWeave október 2-i közlése szerint a Vera Rubin NVL72 környezet hálózati fabricjának részeként telepítette az NVIDIA Spectrum-X Ethernet SN6600-LD modellt. A vállalat az iparág első teljesen folyadékhűtéses, 102,4 Tb/s kapacitású Ethernet-kapcsolójaként mutatja be az eszközt.
A kapcsoló az NVIDIA Spectrum-6 ASIC-re épül, 64 darab, egyenként 1,6 Tb/s sebességű porttal rendelkezik, és 200G SerDes technológiát használ. A korábbi generációhoz képest megduplázza az egy sávra jutó sávszélességet, miközben 2U magas formátumban marad.
A CoreWeave szerint egy szabványos, 48U magas rackbe 16 SN6600-LD kapcsoló helyezhető el. Ez összesen 1,64 Pb/s kapcsolási kapacitást jelent rackenként. A vállalat szemléltetése alapján ez a hálózat teljes terhelésen, torlódás nélkül másodpercenként nagyjából 160 alkalommal továbbíthatná a Kongresszusi Könyvtár teljes szöveggyűjteményét.
A cél a GPU-k közötti szűk keresztmetszet megszüntetése
Az AI-modellek tanítása, a következtetés és a több lépésben gondolkodó ügynöki rendszerek nagy mennyiségű, alacsony késleltetésű kommunikációt igényelnek a GPU-k között. A CoreWeave szerint az SN6600-LD-re épülő hálózat teljes, kétirányú GPU és GPU közötti sávszélességet biztosít a Vera Rubin NVL72 rendszerek számára.
A vállalat egy teljesen nem blokkoló, több síkból és több sínrendszerből álló spine és leaf hálózatot alakított ki, túlfoglalás nélkül. Nagy léptékű tanításnál ez a CoreWeave állítása szerint magasabb modell-FLOPS-kihasználtságot eredményezhet a hálózati késleltetés csökkentésével, a GPU-k teljes sávszélességének biztosításával és az üresjárati idő mérséklésével.
Következtetési feladatoknál a vállalat alacsonyabb és egyenletesebb késleltetést, gyorsabb válaszokat, nagyobb áteresztőképességet és jobb gyorsítókihasználtságot vár az infrastruktúrától.
Kevesebb hely és energia a CoreWeave számításai szerint
A CoreWeave az új kapcsolókat a korábbi, levegőhűtéses Spectrum-4 alapú SN5600 és SN5610 modellekkel hasonlította össze, 16 000 Vera Rubin GPU-t összekötő topológiában. A vállalat három mérhető előnyt emel ki.
- 100 százalékkal nagyobb a rackenkénti teljes kapcsolási teljesítmény. Az SN5600 és SN5610 összesen 51,2 Tb/s kapacitást nyújt 64 darab, 800 Gb/s sebességű porton, 100G SerDes mellett, míg az SN6600-LD 102,4 Tb/s-ot kínál 64 darab, 1,6 Tb/s-os porton.
- 62,5 százalékkal kisebb rack- és alapterületre van szükség a kapcsolási infrastruktúrához. A nagyobb sűrűség a CoreWeave szerint több GPU elhelyezését teszi lehetővé egy négyzetméteren.
- 30 százalékkal jobb energiahatékonyságot ér el az SN6600-LD az SN5600 és SN5610 modellekhez képest, ugyanebben a 16 000 GPU-s konfigurációban.
A vállalat szerint a kisebb energia- és helyigény rackenként alacsonyabb költségeket, egyszerűbb üzemeltetést és nagyobb GPU-sűrűséget támogathat. A CoreWeave ezt a számítási kapacitás egységére jutó szén-dioxid-kibocsátás csökkentésével is összekapcsolja.
Egy közös vezérlési réteg kezeli a rackeket
A folyadékhűtéses kapcsolók a CoreWeave Mission Control rendszerének rack-szintű felügyeletébe kerülnek. A Valvey nevű, szabadalmaztatás alatt álló, programozható szelepmodul a folyadékáramot, a hőmérsékletet, a nyomást és a szivárgást figyeli, illetve szabályozza.
A Racky rackvezérlő egyetlen felületen gyűjti össze az energiaellátási, hűtési és környezeti érzékelők adatait. A Rack Lifecycle Controller a CoreWeave leírása szerint a GPU-k, a hálózati eszközök, az energiaellátás és a hűtés telepítését, konfigurációját, állapotfigyelését és helyreállítását is rack-szinten hangolja össze.
Ez a felhasználók számára a vállalat szerint egységes felügyeleti és kapacitásmodellt jelent a számítási és hálózati infrastruktúrához. A CoreWeave ezt az AI-rendszerek nagyobb sűrűségű, automatizáltabb telepítésének alapjaként kezeli.
CoreWeave: Liquid-Cooled Switching Doubles AI Network Bandwidth Per Rack


