Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A CoreWeave szerint GPU-nként 1 GiB/s tárhelysebesség tartható fenn

2026. október 2. 16:12Forrás: CoreWeave

A CoreWeave benchmarkjai szerint elosztott fájltárolójuk több száz NVIDIA GPU-ra skálázva is GPU-nként 1 GiB/s adatátviteli sebességet tudott fenntartani szimulált mesterségesintelligencia-tréningeknél. A vállalat a tesztekkel azt vizsgálta, okoz-e a tárolórendszer teljesítményhiánya szűk keresztmetszetet a modelltréningben.

A lényeg röviden
  • A CoreWeave szerint GPU-nként 1 GiB/s tárhelysebesség volt fenntartható több száz NVIDIA GPU mellett.
  • A vizsgált munkaterhelés csúcsértéke körülbelül 70 GiB/s olvasás és 50 GiB/s írás volt.
  • A benchmarkhoz 24 CNode-ból és 16 DNode-ból álló fürtöt használtak.
  • A tesztek fio-val, Ubuntu 22.04-es környezetben és Slurm vezérléssel futottak.
  • A CoreWeave szerint a GPU-kihasználtság az adatbetöltés és a checkpointolás kisebb visszaeséseitől eltekintve 100 százalékos volt.

A modelltréning eltérő olvasási és írási terhelést jelent

A CoreWeave 2026. október 2-án közzétett beszámolója szerint a nagy modellek tanításához használt adathalmazok mérete és a modellek összetettsége egyre nagyobb követelményeket támaszt a tárolórendszerekkel szemben. A GPU-k akkor használhatók hatékonyan, ha a háttértár alacsony késleltetéssel és megfelelő áteresztőképességgel szolgálja ki az adatokat.

A vállalat egy több milliárd paraméteres modell 4096 NVIDIA H100 GPU-n történő tanítását használta reprezentatív munkaterhelésként. A folyamat kezdetén intenzív olvasási terhelés jelentkezik, amikor a modell adatokat tölt a GPU-memóriába. Ez nagy volumenű, részben véletlenszerű olvasásokat jelent, amelyeknél az adatok elrendezése a véletlenszerű műveletek csökkentésével és a szekvenciális olvasások növelésével javítható.

A másik jellegzetes szakaszt a modellállapotok időszakos mentése, vagyis a checkpointolás adja. Ez írási csúcsokat okoz a tárolón. A bemutatott példában a mentés szinkron módon zajlik, ezért jól elkülönülő I/O-csúcsok jelennek meg. A mért terhelésnél a csúcsérték körülbelül 70 GiB/s olvasás és 50 GiB/s írás volt.

Külön skálázható vezérlő- és adatréteg

A CoreWeave a VAST Data tárolóarchitektúráját használja. Ez egy két, egymástól elválasztott rétegből álló rendszer: a CNode-ok kezelik az adatmenedzsmentet, az I/O-ütemezést és a tárolási műveleteket, a DNode-ok pedig a fizikai kapacitást és az adatok megőrzését biztosítják.

A benchmarkhoz használt fürt 24 CNode-ból és 16 DNode-ból állt. A felépítés lehetővé teszi, hogy a teljesítményt a CNode-ok bővítésével, a kapacitást pedig a DNode-ok hozzáadásával növeljék. A két réteget NVMe fabric kapcsolja össze.

A vállalat szerint ez a kialakítás azért fontos, mert a modelltréning tárolási igényei nem kizárólag a kapacitásról szólnak. A rendszernek a kezdeti adatbetöltés és a checkpointolás eltérő terheléseit is kezelnie kell, miközben a teljesítménynek az infrastruktúra növekedésével együtt kell skálázódnia.

Fio tesztekkel vizsgálták az elosztott fájltárolót

A CoreWeave a Flexible I/O, röviden fio nevű, tárolórendszerek benchmarkolására használt eszközzel mérte a teljesítményt. A tesztek a vállalat alapértelmezett Ubuntu 22.04-es környezetében futottak, a munkafolyamatokat pedig Slurm segítségével vezérelték a hibrid Slurm és Kubernetes infrastruktúrán.

Az olvasási tesztek különböző blokkméretekkel szekvenciális és véletlenszerű műveleteket szimuláltak. A vizsgált blokkméretek 32M és 1k között változtak, a bemutatott eredmények pedig a szekvenciális és véletlenszerű I/O teljesítményének átlagát adják. Az írási tesztek a checkpointolást utánzó szekvenciális írásokra összpontosítottak, szintén többféle blokkmérettel.

A tesztkonfigurációkat és a futtatási szkripteket a CoreWeave nyilvános tárhelyen tette elérhetővé, hogy az eredmények reprodukálhatók és ellenőrizhetők legyenek. A vállalat közlése szerint a mérések során a GPU-magok kihasználtsága tartósan 100 százalékos volt, csak az adatbetöltés és a checkpointolás alatt jelentkeztek kisebb visszaesések.

A CoreWeave szerint a benchmarkok célja, hogy az ügyfelek saját munkaterheléseik mellett is megmérhessék a tárolási teljesítményt, és azonosíthassák az optimalizálási lehetőségeket. A vállalat állítása alapján a megfelelően méretezett elosztott fájltároló csökkentheti az üresjáratban maradó GPU-k idejét, és hatékonyabbá teheti az AI-modellek tanítását.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti
Chipek és infrastruktúra2026. október 2. 16:12

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti

A CoreWeave szerint a nagy AI-klaszterek értékét nem önmagában a hardver sebessége, hanem a ténylegesen elvégzett hasznos munka határozza meg. A vállalat az NVIDIA-val…

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell
Chipek és infrastruktúra2026. október 2. 16:12

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell

A GPU-k önmagukban már nem bizonyítják, hogy egy AI-infrastruktúra készen áll a termelésre. A CoreWeave és az NVIDIA a számítási kapacitást, a hálózatot, a tárhelyet, az…

A CoreWeave szerint az AI a kísérletezésből a termelésbe lép
Cégek és üzlet2026. október 2. 16:12

A CoreWeave szerint az AI a kísérletezésből a termelésbe lép

A CoreWeave szerint a mesterséges intelligencia következő szakaszát már nem az alapvető technológiai képességek kiépítése, hanem az iparági alkalmazás és a termelési…