A CoreWeave szerint tízszer megbízhatóbbá tehetők a H100-fürtök

A CoreWeave hathetes, nagy léptékű tesztben vizsgálta, hogyan javítható egyszerre az NVIDIA H100 GPU-k teljesítménye és megbízhatósága. A vállalat szerint 1024 GPU mellett 51, 52 százalékos modell FLOPs-kihasználtságot és 3,66 napos átlagos meghibásodásmentes működést ért el.
- A CoreWeave legfeljebb 1024 NVIDIA H100 GPU-val tesztelt egy 30 milliárd paraméteres modellt.
- A vállalat 51, 52 százalékos MFU-t és 3,66 napos MTTF-et mért.
- Az aszinkron Tensorizer-mentés 129 másodpercről 17 másodpercre csökkentette a mentési időt.
- A SUNK rendszer egy hibás csomópont után három percen belül folytatta a tanítást.
- A CoreWeave szerint a 42-ről 51 százalékra javított MFU 18 százalékkal gyorsabb tanítást jelenthet.
A tesztben valódi modell és adatok szerepeltek
A CoreWeave 2026. október 2-án közzétett beszámolója szerint a vizsgálat célja annak felmérése volt, hogy egy kifejezetten mesterségesintelligencia-feladatokra kialakított infrastruktúra képes-e egyszerre magas teljesítményt és stabil működést biztosítani nagy GPU-szám mellett. A teszt nem szintetikus laboratóriumi mérés volt: egy valódi, gyártási környezethez használt modell, valódi tanítóadatok és a Megatron-LM keretrendszer szerepelt benne.
A vizsgált modell egy 30 milliárd paraméteres, Llama 3 jellegű architektúra volt. A tanításhoz a Dolma v1.6 adatállomány 2 billió tokenjét használták, legfeljebb 1024 NVIDIA H100 GPU-n. A mérőszámok között szerepelt az átlagos meghibásodásmentes működési idő (MTTF), a hiba utáni helyreállítás ideje, a modell FLOPs-kihasználtsága (MFU), a mentési teljesítmény és a tokenizálási sebesség.
A CoreWeave több rétegen alakította át az infrastruktúrát
A GPU-kat közvetlenül, hipervizor nélküli, úgynevezett bare-metal környezetben futtatták, a NUMA-beállításokat pedig saját ellenőrzésük alatt tartották. A kommunikációhoz két külön hálózati réteget alkalmaztak. Az NVIDIA Quantum InfiniBand a redukciós műveleteket kezelte, míg a tárolási forgalmat egy NVIDIA BlueField DPU által gyorsított Ethernet-hálózatra választották le. Ezzel a vállalat szerint elkerülhetővé vált a hálózati forgalom egymásra hatása.
A SUNK, vagyis a Slurm on Kubernetes topológiatudatos ütemezést és állapotfigyelő ellenőrzéseket biztosított. A rendszer a hibás csomópontokat még azelőtt eltávolította a fürtből, hogy azok hatással lettek volna a futó munkákra. A sikertelen folyamatokat körülbelül 90 másodperc alatt indította újra, szemben a kézi hibakereséshez szükséges, több mint 4 perccel.
Az aszinkron, Tensorizer-alapú ellenőrzőpont-mentés a mentési időt 129 másodpercről 17 másodpercre csökkentette, miközben a számítási kihasználtság 99 százalék felett maradt. A saját gpt_bpe tokenizáló másodpercenként 63 millió tokent dolgozott fel, ami a CoreWeave szerint 6, 12-szeres sebesség a HuggingFace Tokenizers megoldásaihoz képest.
51, 52 százalékos MFU-t mértek 1024 H100 GPU mellett
A vállalat 51, 52 százalékos MFU-t jelentett, miközben a beszámoló szerint a nagy léptékű tanításoknál gyakran 35, 45 százalék közötti értékek fordulnak elő. Az 1024 GPU-s konfigurációban mért 3,66 napos MTTF a CoreWeave által idézett, 0,33 napos kiindulási értékhez képest tízszeres javulás. Az effektív tanítási idő aránya, az ETTR, 97,5 százalék lett, az aszinkron mentés pedig nyolcszoros gyorsulást hozott.
A CoreWeave más, publikált konfigurációkkal is összevetette az eredményeket. Egy másik AI-kutatócsoport 40,43 százalékos MFU-jával szemben 51,9 százalékot, egy másik vezető AI-labor 41,85 százalékos értékével szemben 49,2 százalékot mért. A beszámoló szerint az eredmények teljesítmény és megbízhatóság szempontjából elérték az NVIDIA DGX Cloud összehasonlító receptjeinek szintjét.
A beszámoló egyik példája szerint egy 30 napos, 1024 GPU-s tanításnál, GPU-óránként 2,10 dolláros költséggel, az átlagos MFU 42 százalékról 51 százalékra emelése körülbelül 6000 GPU-óra többlet számítási kapacitást jelentene. A CoreWeave ezt 12 600 dollár értékű kapacitásként számszerűsíti, változatlan számla mellett. A vállalat szerint a 9 százalékpontos MFU-javulás 18 százalékkal gyorsabb tanítást eredményezhet, ami egy hónapos munkáknál csaknem egy héttel rövidebb futási időt jelent.
A hibát a rendszer kezelte az éjszakai futás közben
A CoreWeave egy 512 GPU-s futás példájával szemléltette az infrastruktúra működését. Hajnali 2 óra 17 perckor egy csomópont hibásodni kezdett, a SUNK állapotfigyelő rendszere ezt észlelte, eltávolította a csomópontot a készletből, újraütemezte a feladatot, majd három percen belül folytatta a tanítást. A vállalat szerint az ügyeletes mérnök telefonja nem jelzett, a Grafana felülete pedig már az értesítés előtt megfelelő állapotot mutatott.
A CoreWeave a megoldásokat már NVIDIA GB200 NVL72 fürtökön is alkalmazza, és élő MFU-irányítópultokat épít az ügyfelek munkaterheléseihez. A részletes, 30 oldalas technikai jelentés a módszertant, a túlélési modell matematikáját és a nyers naplókat is tartalmazza. A cég következtetése szerint a fürt architektúrája meghatározó a sebesség és a stabilitás szempontjából, különösen ezer GPU körüli méretben.


