A CoreWeave 512 H100 GPU-n tesztelte a torchforge RL-keretrendszert

A CoreWeave támogatást jelentett be a torchforge nevű, PyTorch-ra épülő, elosztott megerősítéses tanulási keretrendszerhez. A vállalat a Meta és a Stanford Scaling Intelligence Lab közreműködésével 512 NVIDIA H100 GPU-n végzett nagyszabású utótréninget.
- A CoreWeave támogatja a PyTorch-ra skálázott torchforge RL-keretrendszert.
- A Meta és a Stanford Scaling Intelligence Lab közreműködésével 512 NVIDIA H100 GPU-n futott kísérlet.
- A torchforge az RL-algoritmust leválasztja az elosztott infrastruktúra kezeléséről.
- A SUNK több mint 32 000 GPU-t átfogó feladatokat is támogat.
- A CoreWeave szerint a rendszer 96 százalékos Goodputot és 20 százalékkal magasabb MFU-t ért el.
A torchforge szétválasztja az algoritmust és az infrastruktúrát
A CoreWeave október 2-án számolt be arról, hogy felhőplatformján elérhetővé teszi a torchforge támogatását. A PyTorch-ra skálázott keretrendszer célja, hogy egyszerűbbé tegye a megerősítéses tanulás, vagyis az RL használatát a kutatók és fejlesztők számára.
Az RL a modell utótréningjében használható módszer. A felügyelt finomhangolással ellentétben, amely címkézett adatok mintáinak utánzására tanítja a modellt, az RL eredményekből, visszajelzésekből és jutalmakból tanul. A CoreWeave szerint ez a megközelítés olyan modellek fejlődésében is szerepet játszott, mint a DeepSeek R1, és egyes feladatokon lehetővé teheti, hogy kisebb modellek nagyobb modellek teljesítményét érjék el.
A torchforge az algoritmikus logikát leválasztja az infrastruktúra kezeléséről. Így a kutatóknak elsősorban az adatokkal, a jutalmakkal, a veszteségfüggvényekkel és a környezetekkel kell foglalkozniuk, miközben a rendszer kezeli a skálázást, az útválasztást, a terheléselosztást és a hibatűrést. A keretrendszer a GRPO nevű, a modellek következtetési képességének javítására használt RL-algoritmust is megvalósítja.
512 NVIDIA H100 GPU-n futott a közös kísérlet
A Meta, a Stanford Scaling Intelligence Lab és a CoreWeave háromoldalú együttműködésben nagyszabású utótréninget végzett egy fejlett, sűrű kódolási modellen. A futtatás a CoreWeave Cloud Platform 512 NVIDIA H100 GPU-t használó fürtjén zajlott.
A CoreWeave közlése szerint a Stanford laboratóriumával együttműködésben több tucat torchforge-futtatást hajtottak végre, köztük olyan teljes méretű kísérleteket is, amelyek mind az 512 GPU-t igénybe vették. A vállalat szerint az együttműködés igazolta a torchforge stabilitását, teljesítményét és éles környezetben használható működését nagy léptékben.
A keretrendszer a Monarch nevű, PyTorch-alapú elosztott programozási keretrendszerre épül. Az RDMA használatával gyors, hibatűrő adatmozgatást kínál, és a CoreWeave szerint akár több ezer GPU-ra is skálázható. Ez a vállalat értelmezésében az RL-kísérletek gyorsabb és megbízhatóbb futtatását, valamint a kutatási folyamatok megismételhetőbbé tételét segíti.
A SUNK kezeli a nagy klaszterek ütemezését
A torchforge a CoreWeave Slurm on Kubernetes, röviden SUNK nevű megoldásával használható. A kutatók szabványos Slurm-kötegelt parancsfájlban definiálhatják a feladatot, majd az sbatch vagy srun paranccsal indíthatják el. A SUNK automatikusan kezeli a GPU-k kiosztását és a csomópontok skálázását, míg a Kubernetes a hibás komponensek állapotát és újraindítását felügyeli.
A CoreWeave szerint a SUNK a Slurm ütemezési képességeit a vállalat menedzselt Kubernetes szolgáltatásával, a CKS-sel kapcsolja össze. A megoldás több mint 32 000 GPU-t átfogó feladatokat is támogat, és a cég állítása szerint több százezer feladat kezelésére képes. A Slurm prioritásokat, előzetes erőforrás-elvételt, kvótákat, együttes ütemezést és topológiatudatos ütemezést biztosít.
A torchforge-feladatok futás közben szabványos megfigyelési eszközökkel és naplókkal követhetők. Ha egy csomópont meghibásodik vagy egy szolgáltatás újraindul, a Monarch hibatűrő vezérlője és a torchforge újrapróbálkozási logikája folytatja a munkát. A CoreWeave közlése szerint saját infrastruktúráján a megoldás akár tízszer jobb megbízhatóságot, 20 százalékkal magasabb MFU-t, vagyis modell lebegőpontos műveleti kihasználtságot, valamint 96 százalékos Goodputot, az effektív tanítási idő arányát érte el.
A torchforge támogatása a CoreWeave-nél a SUNK-on keresztül érhető el. A vállalat közölte, hogy a Meta PyTorch csapatával folytatja a teljesítmény, a megbízhatóság és a fejlesztői élmény javítását, valamint a partnerséget a PyTorch ökoszisztéma más területeire is kiterjesztené.
CoreWeave: Scaling Reinforcement Learning with torchforge on CoreWeave Cloud


