Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Modal mindenki számára elérhetővé tette a többgépes GPU-klasztereket

2026. október 1.Forrás: Modal
A Modal mindenki számára elérhetővé tette a többgépes GPU-klasztereket
Kép: Modal

A Modal általánosan elérhetővé tette a Modal Clusters szolgáltatást, amely több számítási csomópontot kapcsol össze nagy léptékű modelltréninghez és következtetéshez. A vállalat szerint a klaszterek másodpercek alatt elindíthatók, és a felhasználók csak a tényleges használatért fizetnek.

A lényeg röviden
  • A Modal Clusters másfél év tesztelés után általánosan elérhetővé vált.
  • A klaszterek egyetlen @modal.clustered dekorátorral indíthatók.
  • Az RDMA-kommunikáció sebessége a Modal szerint akár 6,4 Tbps lehet.
  • A szolgáltatás másodperc alapú számlázást és automatikus GPU-állapotkezelést kínál.
  • A Decagon, az 1x és a Runway is Modal Clustersre épít egyes munkafolyamatokat.

Egyetlen dekorátorral indíthatók a klaszterek

A Modal 2026. október 1-jei bejelentése szerint a Modal Clusters másfél év tesztelés után vált általánosan elérhetővé. A szolgáltatás több csomópontból álló klasztereket kezel a Modal infrastruktúráján, így a nagy számítási igényű modellek betanítása és kiszolgálása külön hardver birtoklása nélkül is megoldható.

A fejlesztők egyetlen @modal.clustered dekorátorral adhatják meg a klaszter méretét és az RDMA használatát. A szolgáltatás a Modal meglévő építőelemeivel is együttműködik: a modell-ellenőrzőpontok Volumes tárhelyre írhatók, az adatok Cloud Bucket Mounts segítségével tölthetők be, a feladatok pedig Queues használatával szervezhetők.

A Modal szerint a csomópontok közötti kommunikáció InfiniBand verbs használatával, akár 6,4 Tbps sebességgel működhet. A PyTorch és az NCCL automatikus beállítást kap, a kód pedig a klaszter igénylése után másodperceken belül futhat. A számlázás másodperc alapú.

Új ütemező kezeli az egyszerre induló csomópontokat

A klasztereket a Modal új munkavégzési egységként kezeli. A hagyományos ütemező egyesével választja ki, hogy az infrastruktúra melyik csomópontja vegyen fel egy feladatot. Többgépes munkafolyamatoknál viszont az összes szükséges csomópontot egyszerre kell megtalálni, ezért a vállalat új, úgynevezett gang ütemezőt épített.

Az ütemező egy ciklusban felméri a teljes rendelkezésre álló infrastruktúrát, megtervezi az összes függőben lévő klaszter elhelyezését, majd végrehajtja a kiosztást. A munkaterheléseket az elérhető zónák és hálózati azonosítók alapján csoportosítja, szükség esetén új kapacitást indít, és értesíti a működő csomópontokat.

A Modal szerint a gang ütemező ugyanabból a kapacitáskészletből dolgozik, mint a szolgáltatás többi feladata. A cég állítása szerint ez másodpercek alatt teszi lehetővé a klaszterek megszerzését, miközben a használat alapú, szerver nélküli díjazás megmarad.

Az RDMA a GPU-memóriát közvetlenül továbbítja

A több csomóponton futó munkaterhelések nagy mennyiségű adatot mozgatnak. A Modal példája szerint a GLM 4.7 egyes tréninglépéseiben körülbelül 717 GB BF16 súlyt kell továbbítani a tréning és a futtatási motor között. Ez a vállalat szerint 50 Gbps sebességű TCP-kapcsolaton csaknem két percig tart, RDMA használatával viszont két másodpercnél rövidebb lehet.

Az RDMA, vagyis a távoli közvetlen memória-hozzáférés lehetővé teszi, hogy a GPU vagy a CPU memóriája a kernel közbeiktatása nélkül kerüljön át egy másik gépre. A Modal szerint a technológia akár 6,4 Tbps sebességet is elérhet. A tréningben a DDP all-reduce és a modellpárhuzamosítás, a következtetésben pedig a kulcsérték-gyorsítótár továbbítása használhatja.

A szolgáltatásban ezt az összetett beállítást az rdma=True kapcsoló mögé rejtették. A Modal több felhőben automatizálta az RDMA konfigurálását, és saját módosításokkal egészítette ki a gVisor konténerfuttatási környezetet. A vállalat ezeket a változtatásokat visszajuttatta a nyílt forráskódú projekthez.

Tréninghez, robotikához és videógeneráláshoz használják

A Modal több ügyfél példáját is bemutatta. A Decagon ügyfélszolgálati ügynökökhöz fejleszt modelleket, és a Modal Clusters segítségével akár ezermilliárd paraméteres nyílt modelleket finomhangolt. A közös munkában a Modal LoRA-támogatást adott a Miles rendszerhez, és egy stabil, nyílt tréningrecept kialakításában is közreműködött.

Az 1x a NEO otthoni robot mögötti világmodellt tanítja be Modal Clusters használatával. A vállalat szerint a többcsomópontos B300-klasztereket RDMA-val futtatják a nagy tréningekhez, miközben az értékelésekhez egycsomópontos feladatokat indítanak. A közös ütemező révén a munkák akár több száz GPU-ra is felskálázhatók, majd a futtatás végén leállíthatók.

A Runway a Modal szerint több csomóponton futtatja legújabb videógeneráló és videószerkesztő modelljeit, köztük a Gen-4.5 és az Aleph 2.0 rendszereket. A bejelentés alapján a Modal Clusters azoknak a fejlesztőknek kínál infrastruktúrát, akik nagy, több GPU-s tréningeket vagy következtetési feladatokat szeretnének futtatni saját klaszterek fenntartása nélkül.

Kapcsolódó hírek

Fejlesztőknek
Fejlesztőknek2026. október 2.

A Helion gyorsíthatja a vLLM LLM-inferenciáját NVIDIA GPU-kon

A PyTorch Helion-alapú lineáris backendet integrált a vLLM-be, hogy automatikus hangolással javítsa a nagy nyelvi modellek következtetési teljesítményét. Az NVIDIA…

A Modal új eszközöket jelentett be az AI-ügynökök és modellek számára
Termékek és eszközök2026. október 1.

A Modal új eszközöket jelentett be az AI-ügynökök és modellek számára

A Modal több új futtatási és infrastruktúra-funkciót jelentett be első konferenciáján. A csomagban virtuális gépet kínáló Sandboxok, elkülönített Sidecar konténerek…

NVIDIA: akár 5,93-szor kisebb késleltetés HSTU ajánlóknál KV cache-sel
Fejlesztőknek2026. szeptember 30.

NVIDIA: akár 5,93-szor kisebb késleltetés HSTU ajánlóknál KV cache-sel

Az NVIDIA új, végponttól végpontig használható HSTU inferenciafolyamatot mutatott be generatív ajánlórendszerekhez a recsys-examples tárolóban. A megoldás Dynamo-Triton…