A CoreWeave szerint GPU-nként 1 GiB/s tárhelysebesség tartható fenn
A CoreWeave benchmarkjai szerint elosztott fájltárolójuk több száz NVIDIA GPU-ra skálázva is GPU-nként 1 GiB/s adatátviteli sebességet tudott fenntartani szimulált mesterségesintelligencia-tréningeknél. A vállalat a tesztekkel azt vizsgálta, okoz-e a tárolórendszer teljesítményhiánya szűk keresztmetszetet a modelltréningben.
- A CoreWeave szerint GPU-nként 1 GiB/s tárhelysebesség volt fenntartható több száz NVIDIA GPU mellett.
- A vizsgált munkaterhelés csúcsértéke körülbelül 70 GiB/s olvasás és 50 GiB/s írás volt.
- A benchmarkhoz 24 CNode-ból és 16 DNode-ból álló fürtöt használtak.
- A tesztek fio-val, Ubuntu 22.04-es környezetben és Slurm vezérléssel futottak.
- A CoreWeave szerint a GPU-kihasználtság az adatbetöltés és a checkpointolás kisebb visszaeséseitől eltekintve 100 százalékos volt.
A modelltréning eltérő olvasási és írási terhelést jelent
A CoreWeave 2026. október 2-án közzétett beszámolója szerint a nagy modellek tanításához használt adathalmazok mérete és a modellek összetettsége egyre nagyobb követelményeket támaszt a tárolórendszerekkel szemben. A GPU-k akkor használhatók hatékonyan, ha a háttértár alacsony késleltetéssel és megfelelő áteresztőképességgel szolgálja ki az adatokat.
A vállalat egy több milliárd paraméteres modell 4096 NVIDIA H100 GPU-n történő tanítását használta reprezentatív munkaterhelésként. A folyamat kezdetén intenzív olvasási terhelés jelentkezik, amikor a modell adatokat tölt a GPU-memóriába. Ez nagy volumenű, részben véletlenszerű olvasásokat jelent, amelyeknél az adatok elrendezése a véletlenszerű műveletek csökkentésével és a szekvenciális olvasások növelésével javítható.
A másik jellegzetes szakaszt a modellállapotok időszakos mentése, vagyis a checkpointolás adja. Ez írási csúcsokat okoz a tárolón. A bemutatott példában a mentés szinkron módon zajlik, ezért jól elkülönülő I/O-csúcsok jelennek meg. A mért terhelésnél a csúcsérték körülbelül 70 GiB/s olvasás és 50 GiB/s írás volt.
Külön skálázható vezérlő- és adatréteg
A CoreWeave a VAST Data tárolóarchitektúráját használja. Ez egy két, egymástól elválasztott rétegből álló rendszer: a CNode-ok kezelik az adatmenedzsmentet, az I/O-ütemezést és a tárolási műveleteket, a DNode-ok pedig a fizikai kapacitást és az adatok megőrzését biztosítják.
A benchmarkhoz használt fürt 24 CNode-ból és 16 DNode-ból állt. A felépítés lehetővé teszi, hogy a teljesítményt a CNode-ok bővítésével, a kapacitást pedig a DNode-ok hozzáadásával növeljék. A két réteget NVMe fabric kapcsolja össze.
A vállalat szerint ez a kialakítás azért fontos, mert a modelltréning tárolási igényei nem kizárólag a kapacitásról szólnak. A rendszernek a kezdeti adatbetöltés és a checkpointolás eltérő terheléseit is kezelnie kell, miközben a teljesítménynek az infrastruktúra növekedésével együtt kell skálázódnia.
Fio tesztekkel vizsgálták az elosztott fájltárolót
A CoreWeave a Flexible I/O, röviden fio nevű, tárolórendszerek benchmarkolására használt eszközzel mérte a teljesítményt. A tesztek a vállalat alapértelmezett Ubuntu 22.04-es környezetében futottak, a munkafolyamatokat pedig Slurm segítségével vezérelték a hibrid Slurm és Kubernetes infrastruktúrán.
Az olvasási tesztek különböző blokkméretekkel szekvenciális és véletlenszerű műveleteket szimuláltak. A vizsgált blokkméretek 32M és 1k között változtak, a bemutatott eredmények pedig a szekvenciális és véletlenszerű I/O teljesítményének átlagát adják. Az írási tesztek a checkpointolást utánzó szekvenciális írásokra összpontosítottak, szintén többféle blokkmérettel.
A tesztkonfigurációkat és a futtatási szkripteket a CoreWeave nyilvános tárhelyen tette elérhetővé, hogy az eredmények reprodukálhatók és ellenőrizhetők legyenek. A vállalat közlése szerint a mérések során a GPU-magok kihasználtsága tartósan 100 százalékos volt, csak az adatbetöltés és a checkpointolás alatt jelentkeztek kisebb visszaesések.
A CoreWeave szerint a benchmarkok célja, hogy az ügyfelek saját munkaterheléseik mellett is megmérhessék a tárolási teljesítményt, és azonosíthassák az optimalizálási lehetőségeket. A vállalat állítása alapján a megfelelően méretezett elosztott fájltároló csökkentheti az üresjáratban maradó GPU-k idejét, és hatékonyabbá teheti az AI-modellek tanítását.
CoreWeave: Storage Benchmarking: Distributed File Storage for Model Training


