A Modal mindenki számára elérhetővé tette a többgépes GPU-klasztereket

A Modal általánosan elérhetővé tette a Modal Clusters szolgáltatást, amely több számítási csomópontot kapcsol össze nagy léptékű modelltréninghez és következtetéshez. A vállalat szerint a klaszterek másodpercek alatt elindíthatók, és a felhasználók csak a tényleges használatért fizetnek.
- A Modal Clusters másfél év tesztelés után általánosan elérhetővé vált.
- A klaszterek egyetlen @modal.clustered dekorátorral indíthatók.
- Az RDMA-kommunikáció sebessége a Modal szerint akár 6,4 Tbps lehet.
- A szolgáltatás másodperc alapú számlázást és automatikus GPU-állapotkezelést kínál.
- A Decagon, az 1x és a Runway is Modal Clustersre épít egyes munkafolyamatokat.
Egyetlen dekorátorral indíthatók a klaszterek
A Modal 2026. október 1-jei bejelentése szerint a Modal Clusters másfél év tesztelés után vált általánosan elérhetővé. A szolgáltatás több csomópontból álló klasztereket kezel a Modal infrastruktúráján, így a nagy számítási igényű modellek betanítása és kiszolgálása külön hardver birtoklása nélkül is megoldható.
A fejlesztők egyetlen @modal.clustered dekorátorral adhatják meg a klaszter méretét és az RDMA használatát. A szolgáltatás a Modal meglévő építőelemeivel is együttműködik: a modell-ellenőrzőpontok Volumes tárhelyre írhatók, az adatok Cloud Bucket Mounts segítségével tölthetők be, a feladatok pedig Queues használatával szervezhetők.
A Modal szerint a csomópontok közötti kommunikáció InfiniBand verbs használatával, akár 6,4 Tbps sebességgel működhet. A PyTorch és az NCCL automatikus beállítást kap, a kód pedig a klaszter igénylése után másodperceken belül futhat. A számlázás másodperc alapú.
Új ütemező kezeli az egyszerre induló csomópontokat
A klasztereket a Modal új munkavégzési egységként kezeli. A hagyományos ütemező egyesével választja ki, hogy az infrastruktúra melyik csomópontja vegyen fel egy feladatot. Többgépes munkafolyamatoknál viszont az összes szükséges csomópontot egyszerre kell megtalálni, ezért a vállalat új, úgynevezett gang ütemezőt épített.
Az ütemező egy ciklusban felméri a teljes rendelkezésre álló infrastruktúrát, megtervezi az összes függőben lévő klaszter elhelyezését, majd végrehajtja a kiosztást. A munkaterheléseket az elérhető zónák és hálózati azonosítók alapján csoportosítja, szükség esetén új kapacitást indít, és értesíti a működő csomópontokat.
A Modal szerint a gang ütemező ugyanabból a kapacitáskészletből dolgozik, mint a szolgáltatás többi feladata. A cég állítása szerint ez másodpercek alatt teszi lehetővé a klaszterek megszerzését, miközben a használat alapú, szerver nélküli díjazás megmarad.
Az RDMA a GPU-memóriát közvetlenül továbbítja
A több csomóponton futó munkaterhelések nagy mennyiségű adatot mozgatnak. A Modal példája szerint a GLM 4.7 egyes tréninglépéseiben körülbelül 717 GB BF16 súlyt kell továbbítani a tréning és a futtatási motor között. Ez a vállalat szerint 50 Gbps sebességű TCP-kapcsolaton csaknem két percig tart, RDMA használatával viszont két másodpercnél rövidebb lehet.
Az RDMA, vagyis a távoli közvetlen memória-hozzáférés lehetővé teszi, hogy a GPU vagy a CPU memóriája a kernel közbeiktatása nélkül kerüljön át egy másik gépre. A Modal szerint a technológia akár 6,4 Tbps sebességet is elérhet. A tréningben a DDP all-reduce és a modellpárhuzamosítás, a következtetésben pedig a kulcsérték-gyorsítótár továbbítása használhatja.
A szolgáltatásban ezt az összetett beállítást az rdma=True kapcsoló mögé rejtették. A Modal több felhőben automatizálta az RDMA konfigurálását, és saját módosításokkal egészítette ki a gVisor konténerfuttatási környezetet. A vállalat ezeket a változtatásokat visszajuttatta a nyílt forráskódú projekthez.
Tréninghez, robotikához és videógeneráláshoz használják
A Modal több ügyfél példáját is bemutatta. A Decagon ügyfélszolgálati ügynökökhöz fejleszt modelleket, és a Modal Clusters segítségével akár ezermilliárd paraméteres nyílt modelleket finomhangolt. A közös munkában a Modal LoRA-támogatást adott a Miles rendszerhez, és egy stabil, nyílt tréningrecept kialakításában is közreműködött.
Az 1x a NEO otthoni robot mögötti világmodellt tanítja be Modal Clusters használatával. A vállalat szerint a többcsomópontos B300-klasztereket RDMA-val futtatják a nagy tréningekhez, miközben az értékelésekhez egycsomópontos feladatokat indítanak. A közös ütemező révén a munkák akár több száz GPU-ra is felskálázhatók, majd a futtatás végén leállíthatók.
A Runway a Modal szerint több csomóponton futtatja legújabb videógeneráló és videószerkesztő modelljeit, köztük a Gen-4.5 és az Aleph 2.0 rendszereket. A bejelentés alapján a Modal Clusters azoknak a fejlesztőknek kínál infrastruktúrát, akik nagy, több GPU-s tréningeket vagy következtetési feladatokat szeretnének futtatni saját klaszterek fenntartása nélkül.
Modal: Modal Clusters are generally available

