Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

CUDA Toolkit 13.4: Windows on Arm támogatás és Rubin előzetes

2026. szeptember 9.Forrás: NVIDIA Developer
CUDA Toolkit 13.4: Windows on Arm támogatás és Rubin előzetes
Kép: NVIDIA Developer

Az NVIDIA 2026. szeptember 9-én jelentette be a CUDA Toolkit 13.4-et a vállalat fejlesztői blogján. A kiadás Windows on Arm támogatást, NVIDIA Rubin előzetes támogatást, új MPS V3 vezérlést, valamint CUDA Python és CCCL bővítéseket hoz.

A lényeg röviden
  • A CUDA Toolkit 13.4 támogatja a Windows on Arm platformot.
  • A kiadás előzetes támogatást ad az NVIDIA Rubin architektúrához, compute capability 107 értékkel.
  • Az MPS V3 szkriptelhető vezérlést, TOML konfigurációt és cgroup-integrált GPU-memóriakorlátokat vezet be.
  • A CUDA Compute Fabric Transport NVLink fabric rendszereken segíti az adatmozgatást kommunikációs könyvtárak számára.
  • A CUDA Python, a CCCL, az Nsight eszközök és a matematikai könyvtárak is frissültek.

Windows on Arm is bekerült a CUDA célplatformjai közé

A CUDA Toolkit 13.4 egyik fő újdonsága, hogy támogatja a Windows on Arm platformot. Az NVIDIA közlése szerint a CUDA alkalmazások Arm platformokon eddig régóta elérhetők voltak Linux alatt, az új kiadás pedig ezt a képességet kiterjeszti Windows on Armra is.

A csomag emellett korai fejlesztői támogatást ad az NVIDIA Rubin GPU architektúrához. A Rubin támogatása előzetesként érkezik, compute capability 107 értékkel, így a fejlesztők már a CUDA Toolkit egy későbbi kiadásában várható általános elérhetőség előtt elkezdhetik alkalmazásaik portolását.

Az NVIDIA a Rubin architektúrát a következő generációs GPU architektúraként írja le, amely az ügynökalapú AI korszakát hajtja. A 13.4-es kiadásban az új SM_107 architektúracél is megjelenik, amely lehetővé teszi a Rubin GPU-kra történő fordítást.

Pontosabb megosztott GPU-kezelés MPS V3-mal

A CUDA 13.4-ben megjelenő Multi-Process Service V3 a CUDA MPS modernizált vezérlési rétegét vezeti be. A cél a megosztott GPU-erőforrások automatizálásának és kezelésének egyszerűsítése, különösen olyan környezetekben, ahol több folyamat vagy konténer osztozik ugyanazon hardveren.

Az MPS V3 szkriptelhető parancssori felületet, névvel ellátott szerverpéldányokat és névtereket ad a párhuzamos terhelések rendezéséhez. A frissítés támogatja a TOML konfigurációt, a streaming multiprocessor, röviden SM particionálását, valamint a cgroupokkal integrált GPU-memóriakorlátokat.

Az NVIDIA szerint ezekkel a képességekkel programozottan határozható meg a számítási teljesítmény, a memóriahatár és a végrehajtási prioritás. A vállalat azt is kiemeli, hogy a kiadás konténerizált környezetekbe illeszti az MPS-t, a hardverkihasználás növelése mellett folyamatonként szigorú erőforrás-elkülönítést biztosítva.

Új adatmozgatási út NVLink rendszerekhez

A CUDA Compute Fabric Transport, röviden CFT, új, transzportközpontú API-t ad fejlett alkalmazásoknak és kommunikációs könyvtáraknak. A cél az adatok mozgatása NVIDIA NVLink fabric rendszereken nagy léptékben.

A CFT megközelítése szerint a szoftvereknek nem kell minden távoli GPU-allokációt leképezniük a folyamat virtuális címtartományába. Ehelyett névvel ellátott logikai végpontokat célozhatnak meg végpontazonosítóval és eltolással, majd aszinkron put, get és redukciós műveleteket indíthatnak közvetlenül a GPU-ról.

Az NVIDIA szerint ez csökkenti a virtuális címterhelést nagy, több GPU-s rendszerekben, támogatja az unicast és multicast kommunikációs mintákat, és visszajelzést ad a befejezésről, illetve hibákról. A CFT csak a CUDA Driver API-n keresztül érhető el, és olyan kommunikációs könyvtárak fejlesztőinek szól, akiknek a magasabb szintű kommunikációs könyvtárakban nem elérhető, nagyon specifikus funkciókra van szükségük. A forrás szerint a legtöbb alkalmazásfejlesztő számára továbbra is olyan könyvtárak használata ajánlott, mint az NVIDIA NCCL vagy az NVSHMEM.

Memória, fordítók és Python API-k is frissültek

A CUDA 13.4 programozott hozzáférést ad a lokalitási tartományokhoz. A lokalitási tartomány a GPU olyan része, amely streaming multiprocessorokat és eszközmemóriát tartalmaz. Egy alkalmazás eszközmemóriát foglalhat egy ilyen tartományban, majd ugyanott hozhat létre SM-erőforrásokat tartalmazó green contextet. Az NVIDIA szerint a számítás memóriához közeli elhelyezése javíthatja a teljesítményt olyan eszközökön, amelyek egynél több lokalitási tartománnyal rendelkeznek.

A kiadás API-t ad az egységes memória, vagyis unified memory aktuális helyének lekérdezésére is. Ez a teljesítményérzékeny könyvtáraknak és futtatókörnyezeteknek segíthet megérteni, hol található a felügyelt vagy rendszer által allokált adat, és ennek alapján jobb döntéseket hozni a számítások és adatmozgatások ütemezéséről.

Fontos változás, hogy a CUDA SDK telepítői már nem csomagolják a NVIDIA drivert. A megfelelő nvidia-open driver vagy cuda-toolkit csomagokat külön kell telepíteni a választott csomagkezelővel. Koherens NVIDIA platformokon, például NVIDIA Grace Hopper, NVIDIA Grace Blackwell és NVIDIA Vera Rubin rendszereken a driver alapértelmezésben Coherent Driver-based Memory Management, röviden CDMM módot használ NUMA helyett. A NUMA mód továbbra is teljesen támogatott, kernelmodul-paraméterrel választható, de a módot frissítés előtt kell beállítani, és a beállítás driver újratöltést vagy újraindítást igényel.

A fordítói támogatás is bővült: a host compiler kompatibilitás a támogatott host platformokon már a GCC 16 és a Clang 22 verziókra is kiterjed.

A CUDA Python oldalán a cuda.core 1.1.0 textúra és surface programozást, gazdagabb managed-memory vezérlést, jobb CUDA graph integrációt és teljes típusinformációt ad a fejlesztőeszközöknek és ágenseknek. Az új cuda.core.texture modul Python API-kat kínál a CUDA textúra és surface memóriához. A cuda.compute 1.1 az NVIDIA összefoglalója szerint lehetővé teszi a CCCL algoritmusok idő előtti, több GPU architektúrára történő fordítását.

Mit jelent ez a fejlesztőknek és a piacnak

A CUDA Toolkit 13.4 elsősorban a fejlesztői célplatformok és a nagy GPU-s rendszerek kezelhetősége felől hoz változást. A Windows on Arm támogatás új fejlesztési irányt nyit azoknak, akik CUDA alkalmazásokat Arm alapú Windows környezetben készítenének.

A Rubin előzetes támogatása a portolás korai megkezdését teszi lehetővé, még az általános CUDA támogatás előtt. Ez különösen azoknak a fejlesztőcsapatoknak lehet fontos, amelyek hardvergeneráció-váltásra készülnek, és előre szeretnék ellenőrizni kódjaik kompatibilitását.

A megosztott GPU-kat használó szervezetek számára az MPS V3 jelenthet kézzelfogható előrelépést. A szkriptelhető vezérlés, a névvel ellátott szerverpéldányok, a TOML konfiguráció és a cgroup-integrált memóriakorlátok alapján a GPU-erőforrások finomabban oszthatók fel konténeres környezetekben. A CFT, a lokalitási tartományok és az egységes memória helyének lekérdezése pedig főként azoknak a könyvtárfejlesztőknek és teljesítményre optimalizáló csapatoknak ad új eszközöket, akik nagy, több GPU-s rendszereken dolgoznak.

Kapcsolódó hírek

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti
Chipek és infrastruktúra2026. október 2.

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti

A CoreWeave szerint a nagy AI-klaszterek értékét nem önmagában a hardver sebessége, hanem a ténylegesen elvégzett hasznos munka határozza meg. A vállalat az NVIDIA-val…

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell
Chipek és infrastruktúra2026. október 2.

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell

A GPU-k önmagukban már nem bizonyítják, hogy egy AI-infrastruktúra készen áll a termelésre. A CoreWeave és az NVIDIA a számítási kapacitást, a hálózatot, a tárhelyet, az…

A CoreWeave szerint az AI a kísérletezésből a termelésbe lép
Cégek és üzlet2026. október 2.

A CoreWeave szerint az AI a kísérletezésből a termelésbe lép

A CoreWeave szerint a mesterséges intelligencia következő szakaszát már nem az alapvető technológiai képességek kiépítése, hanem az iparági alkalmazás és a termelési…