Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti

2026. október 2. 16:12Forrás: CoreWeave
A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti
Kép: CoreWeave

A CoreWeave szerint a nagy AI-klaszterek értékét nem önmagában a hardver sebessége, hanem a ténylegesen elvégzett hasznos munka határozza meg. A vállalat az NVIDIA-val közös sorozatának második részében a folyamatos üzemeltetésről és a következő generációs gyorsított számítástechnika előkészítéséről írt.

A lényeg röviden
  • A CoreWeave szerint a Hopper GPU-kon elért goodput felső értéke 96 százalék.
  • A vállalat 20 százalékkal magasabb MFU-t mért a nyilvános benchmarkokhoz képest.
  • A Mission Control másodpercenként több mint 200 millió metrikamintát dolgoz fel.
  • A CoreWeave 2026 júniusában validálta az NVIDIA Vera Rubin NVL72 rendszert.
  • A Vera Rubin rackjeinek összeszerelése a közlés szerint akár 90-szer gyorsabb lehet a Blackwellénél.

A teljesítmény mellett a hasznos munka számít

A CoreWeave 2026. október 2-án közzétett bejegyzése szerint egy klaszter akkor is veszíthet értékes órákat, ha minden teljesítményteszten megfelel. Megszakítások, hibásan elmentett ellenőrzőpontok és a helyreállításra fordított idő csökkenthetik azt a munkát, amelyet az ügyfél ténylegesen megkap.

Erre használja a vállalat a goodput fogalmát. Ez azt mutatja meg, hogy a számítási idő mekkora része fordítódik hasznos munkára, és mekkora része megy el megszakításokra és helyreállításra. A CoreWeave közlése szerint hosszú, elosztott tanítási feladatokon az NVIDIA Hopper GPU-kkal akár 96 százalékos goodputot is elért, ez azonban felső érték, nem garantált eredmény.

A mutatót két fő tényező határozza meg: az áteresztőképesség és a hibatűrés. Egy 1024 NVIDIA Hopper GPU-t használó klaszter tesztjében a CoreWeave a nyilvánosan közölt más benchmarkokhoz képest 20 százalékkal magasabb MFU-t mért. Az MFU azt jelzi, hogy a GPU elméleti csúcsteljesítményéből mennyi alakul modellhaladássá, értéke pedig a munkaterheléstől, a modell architektúrájától, a sorozathossztól és a párhuzamosítás módjától is függ.

A szoftver tartja üzemben a nagy klasztereket

A CoreWeave szerint a meghibásodások közötti átlagos idő nagyjából tízszeresére javult, az effektív tanítási idő aránya pedig elérte a 98 százalékot. A vállalat ezt a GPU-k, CPU-k és rackek megbízhatósági, rendelkezésre állási és szervizelhetőségi képességeivel, valamint a hibákat felismerő és kezelő szoftverréteggel magyarázza.

A CoreWeave Mission Control többek között késleltetett vagy lemaradó csomópontokat keres, automatikusan kivonja az érintett node-okat, kezeli a flotta és a rackek életciklusát, valamint helyreállítási munkafolyamatokat biztosít. A rendszer a vállalat szerint az összes ügyfélkörnyezetben másodpercenként több mint 200 millió metrikamintát dolgoz fel.

A SUNK, vagyis a CoreWeave Slurm on Kubernetes megoldása a változó igényekhez igazítja a GPU-k elosztását a tanítási és következtetési feladatok között. Így a felszabaduló kapacitás újra munkába állhat, ahelyett hogy tétlenül várna a következő feladatra.

A Vera Rubinra készülnek

A CoreWeave közlése szerint 2026 júniusában elsőként végezte el az NVIDIA Vera Rubin NVL72 rendszer üzembe helyezését és validálását. A vállalat célja, hogy az ügyfelek előzetesen ellenőrzött rendszert kapjanak, és ne nekik kelljen egy új architektúra hibakeresését éles környezetben elvégezniük.

A Vera Rubin platform hat célra épített chipet egyesít: a Vera CPU-t, a Rubin GPU-t, az NVLink 6 Switchet, a ConnectX-9 SuperNIC-et, a BlueField-4 DPU-t és a Spectrum-6 Ethernet Switchet. A Rubin GPU-k második generációs RAS-motort kapnak, amely a vállalat szerint leállás nélküli, proaktív karbantartást és valós idejű állapotellenőrzést tesz lehetővé.

A platform rackenkénti működtetéséhez a CoreWeave saját, szabadalmaztatás alatt álló Valvey és Racky megoldásait is bemutatja. A Valvey folyadékhűtési szelepösszeállítás, amely folyamatosan figyeli az áramlást, a hőmérsékletet és a nyomást, hiba esetén pedig automatikusan leválaszthatja az érintett racket. A CoreWeave szerint a Vera Rubin moduláris, kábel nélküli tálcái akár 90-szer gyorsabb összeszerelést tesznek lehetővé a Blackwellhez képest.

Kapcsolódó hírek

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell
Chipek és infrastruktúra2026. október 2. 16:12

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell

A GPU-k önmagukban már nem bizonyítják, hogy egy AI-infrastruktúra készen áll a termelésre. A CoreWeave és az NVIDIA a számítási kapacitást, a hálózatot, a tárhelyet, az…

A CoreWeave szerint az AI a kísérletezésből a termelésbe lép
Cégek és üzlet2026. október 2. 16:12

A CoreWeave szerint az AI a kísérletezésből a termelésbe lép

A CoreWeave szerint a mesterséges intelligencia következő szakaszát már nem az alapvető technológiai képességek kiépítése, hanem az iparági alkalmazás és a termelési…

Rekordot döntött a CoreWeave és az NVIDIA felhős AI-szuperszámítógépe
Chipek és infrastruktúra2026. október 2. 16:12

Rekordot döntött a CoreWeave és az NVIDIA felhős AI-szuperszámítógépe

A CoreWeave és az NVIDIA több mint 3500 NVIDIA H100 Tensor Core GPU-val, 11 percnél rövidebb idő alatt teljesítette az új MLPerf GPT-3 175B tesztet. A vállalatok szerint…