Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A CoreWeave új SUNK képességekkel gyorsítaná az AI-klaszterek építését

2026. október 2. 16:12Forrás: CoreWeave
A CoreWeave új SUNK képességekkel gyorsítaná az AI-klaszterek építését
Kép: CoreWeave

A CoreWeave új képességekkel bővíti SUNK nevű AI-tréningrendszerét. A SUNK self-service és a SUNK Anywhere célja, hogy egyszerűbbé tegye a hosszú, nagy számításigényű AI-munkafolyamatok klasztereinek létrehozását és üzemeltetését.

A lényeg röviden
  • A CoreWeave új SUNK self-service és SUNK Anywhere képességeket jelentett be.
  • Az AUP és az SUP automatizálja a felhasználók, csoportok és Slurm-fiókok létrehozását.
  • A SUNK Anywhere több szolgáltatón és saját infrastruktúrán is egységes működést céloz.
  • A Mission Control GPU-straggler-felismeréssel bővül.
  • A CoreWeave benchmarkjaiban akár 96 százalékos goodputot és tízszer hosszabb meghibásodások közötti átlagos időt közöl.

A CoreWeave szerint túl sok az infrastruktúra-építés

A CoreWeave 2026. október 2-án közzétett bejelentése szerint a modern AI-kutatóklaszterek létrehozása továbbra is összetett feladat. A csapatoknak gyakran Kubernetes-alapelemeket, ütemezőket, személyazonosság-kezelő rendszereket és megfigyelési eszközöket kell összeállítaniuk. A vállalat szerint ez az összerakott megközelítés még nem biztosít olyan rendszert, amely készen áll a nagy terhelésű tréningfeladatokra.

A SUNK-ot a CoreWeave egységes, kifejezetten nagy igényű AI-munkaterhelésekhez fejlesztett tréningrendszerként mutatja be. A rendszer a hónapokig futó előtanítási feladatokat, a nagy léptékű megerősítéses tanulást és az ügynöki környezeteket is célozza. A vállalat szerint a SUNK támogatja a Slurm-munkafolyamatokat, miközben a Kubernetes működési előnyeit kínálja a platformcsapatoknak és a kutatóknak.

A CoreWeave állítása szerint a SUNK a Slurm Kubernetesen történő futtatásának egyik leginkább bizonyított megoldása. A cél a klaszterek felépítésével töltött idő csökkentése, miközben megmarad a hosszú tréningfeladatokhoz szükséges egységesség, átláthatóság és kontroll.

Önkiszolgáló klaszterindítás és automatizált hozzáférés

A SUNK self-service a CoreWeave bevált gyakorlatain alapuló, gyorsabb klaszterindítást kínál. A vállalat szerint a szabványosított és előre kialakított minták megkönnyítik a termelésre kész alapállapotból történő indulást, egyszerűsítik a bevezetést, és hosszabb távon következetesebb klaszterműködést tesznek lehetővé.

Az új képességek a hozzáférések kezelését is automatizálják. Az Automated User Provisioning, vagyis az AUP SCIM segítségével szinkronizálja a felhasználókat és csoportokat a szervezet identitásszolgáltatójából a CoreWeave IAM rendszerébe. A SUNK User Provisioning, az SUP, létrehozza a SUNK-klasztereken szükséges POSIX-felhasználókat, csoportokat, SSH-kulcsokat és Slurm-fiókokat.

A CoreWeave által idézett ügyfélvisszajelzések szerint az IBM topológiatudatos ütemezést és egyedi irányítópultokat használ a gyorsabb, hatékonyabb tréninghez és a rackléptékű GB200-rendszerek jobb kihasználásához. A Cursor a megosztott fájlrendszereket, az automatikus felhasználó-létrehozást és a testre szabható környezeteket emeli ki.

A SUNK Anywhere több infrastruktúrán tartaná egységesen a működést

A SUNK Anywhere a CoreWeave infrastruktúráján kívül is kiterjeszti az egységes tréningrendszert. A vállalat szerint a cél az, hogy a szervezetek több szolgáltató vagy saját tulajdonú infrastruktúra használatakor is ugyanazokat a tréningfolyamatokat, ütemezési elveket és működési gyakorlatokat alkalmazhassák.

Ez a CoreWeave szerint csökkentheti a különböző környezetek közötti széttagoltságot. A Periodic Labs beszámolója alapján a SUNK-ot CoreWeave-en és más szolgáltatóknál is futtatják, nagy, több ezer GPU-t használó elosztott feladatokkal. A vállalat műszaki munkatársa, Xander Dunn szerint a nem CoreWeave-klasztereken történő telepítéshez kevés konfigurációs módosításra van szükség.

A CoreWeave a Mission Control megfigyelési képességeit GPU-straggler-felismeréssel is bővíti. Ez azokat az eseteket célozza, amikor egy GPU, csomópont vagy kommunikációs útvonal lassulása az egész elosztott tréninget visszafogja. A rendszer képes lehet azonosítani a problémát okozó GPU-t, így a kutatók a CoreWeave szerint anélkül indíthatják újra a feladatot, hogy azt a GPU-t is bevonnák.

A felhasználóknak a tréningre maradhat több idejük

A bejelentés alapján a SUNK fejlesztései elsősorban a platformcsapatok és az AI-kutatók munkáját érintik. Az önkiszolgáló indítás gyorsabb utat kínálhat a működő klaszterhez, az automatizált hozzáférés-kezelés pedig csökkentheti a kézi beállításokat. A több infrastruktúrán használható működés a kutatók számára ismerősebb ütemezést és munkafolyamatokat tarthat fenn, miközben a szervezetek bővítik számítási környezetüket.

A CoreWeave saját benchmark-forgatókönyveiben akár 96 százalékos hasznos munkavégzést, vagyis goodputot, valamint a meghibásodások közötti átlagos idő tízszeres növekedését említi. Ezek a vállalat által közölt eredmények, és nem általános, minden környezetre érvényes teljesítményígéretek. A bejelentés fő állítása szerint a tréningrendszer értékét az adja, hogy a feladat elindítása után mennyire következetesen folytatódik a hasznos munka.

Kapcsolódó hírek

A CNCF Sandboxba kerül az llm-d, az AI-inferencia nyílt infrastruktúrája
Fejlesztőknek2026. október 2. 16:12

A CNCF Sandboxba kerül az llm-d, az AI-inferencia nyílt infrastruktúrája

A Cloud Native Computing Foundation Sandbox projektjei közé kerül az llm-d, a több gyorsítós infrastruktúrán futó, elosztott következtetés összehangolására és…

A CoreWeave 42 adatközpontig bővítette AI-felhőjét
Chipek és infrastruktúra2026. október 2. 16:12

A CoreWeave 42 adatközpontig bővítette AI-felhőjét

A CoreWeave 2025-ben felgyorsította globális terjeszkedését, és az AI-rendszerek fejlesztését, futtatását és folyamatos üzemeltetését támogató felhőplatformmá bővítette…

Új eszközökkel bővíti AI-infrastruktúráját a CoreWeave
Termékek és eszközök2026. október 2. 16:12

Új eszközökkel bővíti AI-infrastruktúráját a CoreWeave

A CoreWeave három új képességgel bővíti Mission Control platformját, amely az AI-munkafolyamatok felügyeletét és hibakeresését szolgálja. A Telemetry Relay általános…