A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti

A CoreWeave szerint a nagy AI-klaszterek értékét nem önmagában a hardver sebessége, hanem a ténylegesen elvégzett hasznos munka határozza meg. A vállalat az NVIDIA-val közös sorozatának második részében a folyamatos üzemeltetésről és a következő generációs gyorsított számítástechnika előkészítéséről írt.
- A CoreWeave szerint a Hopper GPU-kon elért goodput felső értéke 96 százalék.
- A vállalat 20 százalékkal magasabb MFU-t mért a nyilvános benchmarkokhoz képest.
- A Mission Control másodpercenként több mint 200 millió metrikamintát dolgoz fel.
- A CoreWeave 2026 júniusában validálta az NVIDIA Vera Rubin NVL72 rendszert.
- A Vera Rubin rackjeinek összeszerelése a közlés szerint akár 90-szer gyorsabb lehet a Blackwellénél.
A teljesítmény mellett a hasznos munka számít
A CoreWeave 2026. október 2-án közzétett bejegyzése szerint egy klaszter akkor is veszíthet értékes órákat, ha minden teljesítményteszten megfelel. Megszakítások, hibásan elmentett ellenőrzőpontok és a helyreállításra fordított idő csökkenthetik azt a munkát, amelyet az ügyfél ténylegesen megkap.
Erre használja a vállalat a goodput fogalmát. Ez azt mutatja meg, hogy a számítási idő mekkora része fordítódik hasznos munkára, és mekkora része megy el megszakításokra és helyreállításra. A CoreWeave közlése szerint hosszú, elosztott tanítási feladatokon az NVIDIA Hopper GPU-kkal akár 96 százalékos goodputot is elért, ez azonban felső érték, nem garantált eredmény.
A mutatót két fő tényező határozza meg: az áteresztőképesség és a hibatűrés. Egy 1024 NVIDIA Hopper GPU-t használó klaszter tesztjében a CoreWeave a nyilvánosan közölt más benchmarkokhoz képest 20 százalékkal magasabb MFU-t mért. Az MFU azt jelzi, hogy a GPU elméleti csúcsteljesítményéből mennyi alakul modellhaladássá, értéke pedig a munkaterheléstől, a modell architektúrájától, a sorozathossztól és a párhuzamosítás módjától is függ.
A szoftver tartja üzemben a nagy klasztereket
A CoreWeave szerint a meghibásodások közötti átlagos idő nagyjából tízszeresére javult, az effektív tanítási idő aránya pedig elérte a 98 százalékot. A vállalat ezt a GPU-k, CPU-k és rackek megbízhatósági, rendelkezésre állási és szervizelhetőségi képességeivel, valamint a hibákat felismerő és kezelő szoftverréteggel magyarázza.
A CoreWeave Mission Control többek között késleltetett vagy lemaradó csomópontokat keres, automatikusan kivonja az érintett node-okat, kezeli a flotta és a rackek életciklusát, valamint helyreállítási munkafolyamatokat biztosít. A rendszer a vállalat szerint az összes ügyfélkörnyezetben másodpercenként több mint 200 millió metrikamintát dolgoz fel.
A SUNK, vagyis a CoreWeave Slurm on Kubernetes megoldása a változó igényekhez igazítja a GPU-k elosztását a tanítási és következtetési feladatok között. Így a felszabaduló kapacitás újra munkába állhat, ahelyett hogy tétlenül várna a következő feladatra.
A Vera Rubinra készülnek
A CoreWeave közlése szerint 2026 júniusában elsőként végezte el az NVIDIA Vera Rubin NVL72 rendszer üzembe helyezését és validálását. A vállalat célja, hogy az ügyfelek előzetesen ellenőrzött rendszert kapjanak, és ne nekik kelljen egy új architektúra hibakeresését éles környezetben elvégezniük.
A Vera Rubin platform hat célra épített chipet egyesít: a Vera CPU-t, a Rubin GPU-t, az NVLink 6 Switchet, a ConnectX-9 SuperNIC-et, a BlueField-4 DPU-t és a Spectrum-6 Ethernet Switchet. A Rubin GPU-k második generációs RAS-motort kapnak, amely a vállalat szerint leállás nélküli, proaktív karbantartást és valós idejű állapotellenőrzést tesz lehetővé.
A platform rackenkénti működtetéséhez a CoreWeave saját, szabadalmaztatás alatt álló Valvey és Racky megoldásait is bemutatja. A Valvey folyadékhűtési szelepösszeállítás, amely folyamatosan figyeli az áramlást, a hőmérsékletet és a nyomást, hiba esetén pedig automatikusan leválaszthatja az érintett racket. A CoreWeave szerint a Vera Rubin moduláris, kábel nélküli tálcái akár 90-szer gyorsabb összeszerelést tesznek lehetővé a Blackwellhez képest.
CoreWeave: What Comes Next: Operating and Evolving the Production AI Factory


