A CoreWeave új SUNK képességekkel gyorsítaná az AI-klaszterek építését

A CoreWeave új képességekkel bővíti SUNK nevű AI-tréningrendszerét. A SUNK self-service és a SUNK Anywhere célja, hogy egyszerűbbé tegye a hosszú, nagy számításigényű AI-munkafolyamatok klasztereinek létrehozását és üzemeltetését.
- A CoreWeave új SUNK self-service és SUNK Anywhere képességeket jelentett be.
- Az AUP és az SUP automatizálja a felhasználók, csoportok és Slurm-fiókok létrehozását.
- A SUNK Anywhere több szolgáltatón és saját infrastruktúrán is egységes működést céloz.
- A Mission Control GPU-straggler-felismeréssel bővül.
- A CoreWeave benchmarkjaiban akár 96 százalékos goodputot és tízszer hosszabb meghibásodások közötti átlagos időt közöl.
A CoreWeave szerint túl sok az infrastruktúra-építés
A CoreWeave 2026. október 2-án közzétett bejelentése szerint a modern AI-kutatóklaszterek létrehozása továbbra is összetett feladat. A csapatoknak gyakran Kubernetes-alapelemeket, ütemezőket, személyazonosság-kezelő rendszereket és megfigyelési eszközöket kell összeállítaniuk. A vállalat szerint ez az összerakott megközelítés még nem biztosít olyan rendszert, amely készen áll a nagy terhelésű tréningfeladatokra.
A SUNK-ot a CoreWeave egységes, kifejezetten nagy igényű AI-munkaterhelésekhez fejlesztett tréningrendszerként mutatja be. A rendszer a hónapokig futó előtanítási feladatokat, a nagy léptékű megerősítéses tanulást és az ügynöki környezeteket is célozza. A vállalat szerint a SUNK támogatja a Slurm-munkafolyamatokat, miközben a Kubernetes működési előnyeit kínálja a platformcsapatoknak és a kutatóknak.
A CoreWeave állítása szerint a SUNK a Slurm Kubernetesen történő futtatásának egyik leginkább bizonyított megoldása. A cél a klaszterek felépítésével töltött idő csökkentése, miközben megmarad a hosszú tréningfeladatokhoz szükséges egységesség, átláthatóság és kontroll.
Önkiszolgáló klaszterindítás és automatizált hozzáférés
A SUNK self-service a CoreWeave bevált gyakorlatain alapuló, gyorsabb klaszterindítást kínál. A vállalat szerint a szabványosított és előre kialakított minták megkönnyítik a termelésre kész alapállapotból történő indulást, egyszerűsítik a bevezetést, és hosszabb távon következetesebb klaszterműködést tesznek lehetővé.
Az új képességek a hozzáférések kezelését is automatizálják. Az Automated User Provisioning, vagyis az AUP SCIM segítségével szinkronizálja a felhasználókat és csoportokat a szervezet identitásszolgáltatójából a CoreWeave IAM rendszerébe. A SUNK User Provisioning, az SUP, létrehozza a SUNK-klasztereken szükséges POSIX-felhasználókat, csoportokat, SSH-kulcsokat és Slurm-fiókokat.
A CoreWeave által idézett ügyfélvisszajelzések szerint az IBM topológiatudatos ütemezést és egyedi irányítópultokat használ a gyorsabb, hatékonyabb tréninghez és a rackléptékű GB200-rendszerek jobb kihasználásához. A Cursor a megosztott fájlrendszereket, az automatikus felhasználó-létrehozást és a testre szabható környezeteket emeli ki.
A SUNK Anywhere több infrastruktúrán tartaná egységesen a működést
A SUNK Anywhere a CoreWeave infrastruktúráján kívül is kiterjeszti az egységes tréningrendszert. A vállalat szerint a cél az, hogy a szervezetek több szolgáltató vagy saját tulajdonú infrastruktúra használatakor is ugyanazokat a tréningfolyamatokat, ütemezési elveket és működési gyakorlatokat alkalmazhassák.
Ez a CoreWeave szerint csökkentheti a különböző környezetek közötti széttagoltságot. A Periodic Labs beszámolója alapján a SUNK-ot CoreWeave-en és más szolgáltatóknál is futtatják, nagy, több ezer GPU-t használó elosztott feladatokkal. A vállalat műszaki munkatársa, Xander Dunn szerint a nem CoreWeave-klasztereken történő telepítéshez kevés konfigurációs módosításra van szükség.
A CoreWeave a Mission Control megfigyelési képességeit GPU-straggler-felismeréssel is bővíti. Ez azokat az eseteket célozza, amikor egy GPU, csomópont vagy kommunikációs útvonal lassulása az egész elosztott tréninget visszafogja. A rendszer képes lehet azonosítani a problémát okozó GPU-t, így a kutatók a CoreWeave szerint anélkül indíthatják újra a feladatot, hogy azt a GPU-t is bevonnák.
A felhasználóknak a tréningre maradhat több idejük
A bejelentés alapján a SUNK fejlesztései elsősorban a platformcsapatok és az AI-kutatók munkáját érintik. Az önkiszolgáló indítás gyorsabb utat kínálhat a működő klaszterhez, az automatizált hozzáférés-kezelés pedig csökkentheti a kézi beállításokat. A több infrastruktúrán használható működés a kutatók számára ismerősebb ütemezést és munkafolyamatokat tarthat fenn, miközben a szervezetek bővítik számítási környezetüket.
A CoreWeave saját benchmark-forgatókönyveiben akár 96 százalékos hasznos munkavégzést, vagyis goodputot, valamint a meghibásodások közötti átlagos idő tízszeres növekedését említi. Ezek a vállalat által közölt eredmények, és nem általános, minden környezetre érvényes teljesítményígéretek. A bejelentés fő állítása szerint a tréningrendszer értékét az adja, hogy a feladat elindítása után mennyire következetesen folytatódik a hasznos munka.


