Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A CoreWeave 512 H100 GPU-n tesztelte a torchforge RL-keretrendszert

2026. október 2.Forrás: CoreWeave
A CoreWeave 512 H100 GPU-n tesztelte a torchforge RL-keretrendszert
Kép: CoreWeave

A CoreWeave támogatást jelentett be a torchforge nevű, PyTorch-ra épülő, elosztott megerősítéses tanulási keretrendszerhez. A vállalat a Meta és a Stanford Scaling Intelligence Lab közreműködésével 512 NVIDIA H100 GPU-n végzett nagyszabású utótréninget.

A lényeg röviden
  • A CoreWeave támogatja a PyTorch-ra skálázott torchforge RL-keretrendszert.
  • A Meta és a Stanford Scaling Intelligence Lab közreműködésével 512 NVIDIA H100 GPU-n futott kísérlet.
  • A torchforge az RL-algoritmust leválasztja az elosztott infrastruktúra kezeléséről.
  • A SUNK több mint 32 000 GPU-t átfogó feladatokat is támogat.
  • A CoreWeave szerint a rendszer 96 százalékos Goodputot és 20 százalékkal magasabb MFU-t ért el.

A torchforge szétválasztja az algoritmust és az infrastruktúrát

A CoreWeave október 2-án számolt be arról, hogy felhőplatformján elérhetővé teszi a torchforge támogatását. A PyTorch-ra skálázott keretrendszer célja, hogy egyszerűbbé tegye a megerősítéses tanulás, vagyis az RL használatát a kutatók és fejlesztők számára.

Az RL a modell utótréningjében használható módszer. A felügyelt finomhangolással ellentétben, amely címkézett adatok mintáinak utánzására tanítja a modellt, az RL eredményekből, visszajelzésekből és jutalmakból tanul. A CoreWeave szerint ez a megközelítés olyan modellek fejlődésében is szerepet játszott, mint a DeepSeek R1, és egyes feladatokon lehetővé teheti, hogy kisebb modellek nagyobb modellek teljesítményét érjék el.

A torchforge az algoritmikus logikát leválasztja az infrastruktúra kezeléséről. Így a kutatóknak elsősorban az adatokkal, a jutalmakkal, a veszteségfüggvényekkel és a környezetekkel kell foglalkozniuk, miközben a rendszer kezeli a skálázást, az útválasztást, a terheléselosztást és a hibatűrést. A keretrendszer a GRPO nevű, a modellek következtetési képességének javítására használt RL-algoritmust is megvalósítja.

512 NVIDIA H100 GPU-n futott a közös kísérlet

A Meta, a Stanford Scaling Intelligence Lab és a CoreWeave háromoldalú együttműködésben nagyszabású utótréninget végzett egy fejlett, sűrű kódolási modellen. A futtatás a CoreWeave Cloud Platform 512 NVIDIA H100 GPU-t használó fürtjén zajlott.

A CoreWeave közlése szerint a Stanford laboratóriumával együttműködésben több tucat torchforge-futtatást hajtottak végre, köztük olyan teljes méretű kísérleteket is, amelyek mind az 512 GPU-t igénybe vették. A vállalat szerint az együttműködés igazolta a torchforge stabilitását, teljesítményét és éles környezetben használható működését nagy léptékben.

A keretrendszer a Monarch nevű, PyTorch-alapú elosztott programozási keretrendszerre épül. Az RDMA használatával gyors, hibatűrő adatmozgatást kínál, és a CoreWeave szerint akár több ezer GPU-ra is skálázható. Ez a vállalat értelmezésében az RL-kísérletek gyorsabb és megbízhatóbb futtatását, valamint a kutatási folyamatok megismételhetőbbé tételét segíti.

A SUNK kezeli a nagy klaszterek ütemezését

A torchforge a CoreWeave Slurm on Kubernetes, röviden SUNK nevű megoldásával használható. A kutatók szabványos Slurm-kötegelt parancsfájlban definiálhatják a feladatot, majd az sbatch vagy srun paranccsal indíthatják el. A SUNK automatikusan kezeli a GPU-k kiosztását és a csomópontok skálázását, míg a Kubernetes a hibás komponensek állapotát és újraindítását felügyeli.

A CoreWeave szerint a SUNK a Slurm ütemezési képességeit a vállalat menedzselt Kubernetes szolgáltatásával, a CKS-sel kapcsolja össze. A megoldás több mint 32 000 GPU-t átfogó feladatokat is támogat, és a cég állítása szerint több százezer feladat kezelésére képes. A Slurm prioritásokat, előzetes erőforrás-elvételt, kvótákat, együttes ütemezést és topológiatudatos ütemezést biztosít.

A torchforge-feladatok futás közben szabványos megfigyelési eszközökkel és naplókkal követhetők. Ha egy csomópont meghibásodik vagy egy szolgáltatás újraindul, a Monarch hibatűrő vezérlője és a torchforge újrapróbálkozási logikája folytatja a munkát. A CoreWeave közlése szerint saját infrastruktúráján a megoldás akár tízszer jobb megbízhatóságot, 20 százalékkal magasabb MFU-t, vagyis modell lebegőpontos műveleti kihasználtságot, valamint 96 százalékos Goodputot, az effektív tanítási idő arányát érte el.

A torchforge támogatása a CoreWeave-nél a SUNK-on keresztül érhető el. A vállalat közölte, hogy a Meta PyTorch csapatával folytatja a teljesítmény, a megbízhatóság és a fejlesztői élmény javítását, valamint a partnerséget a PyTorch ökoszisztéma más területeire is kiterjesztené.

CoreWeavetorchforgeMetaStanford's Scaling Intelligence LabNVIDIA H100nyelvi modellekkódolásfelhőchipek

Kapcsolódó hírek

A CoreWeave szerint élmezőnyben a Kimi K2.7 Code ár-teljesítménye
Termékek és eszközök2026. október 2.

A CoreWeave szerint élmezőnyben a Kimi K2.7 Code ár-teljesítménye

Elérhetővé vált a Moonshot AI Kimi K2.7 Code modellje a CoreWeave Serverless Inference szolgáltatásán. A CoreWeave szerint a modell a szolgáltatók között a legmagasabb…

Rekordot döntött a CoreWeave és az NVIDIA felhős AI-szuperszámítógépe
Chipek és infrastruktúra2026. október 2.

Rekordot döntött a CoreWeave és az NVIDIA felhős AI-szuperszámítógépe

A CoreWeave és az NVIDIA több mint 3500 NVIDIA H100 Tensor Core GPU-val, 11 percnél rövidebb idő alatt teljesítette az új MLPerf GPT-3 175B tesztet. A vállalatok szerint…

A CoreWeave 100 millió dollárból bővíti NVIDIA GPU-infrastruktúráját
Chipek és infrastruktúra2026. október 2.

A CoreWeave 100 millió dollárból bővíti NVIDIA GPU-infrastruktúráját

A CoreWeave 100 millió dolláros stratégiai befektetést kapott a Magnetartól, amelyet NVIDIA GPU-kkal gyorsított infrastruktúrájának bővítésére fordít. A vállalat 2023…