CUDA Toolkit 13.4: Windows on Arm támogatás és Rubin előzetes

Az NVIDIA 2026. szeptember 9-én jelentette be a CUDA Toolkit 13.4-et a vállalat fejlesztői blogján. A kiadás Windows on Arm támogatást, NVIDIA Rubin előzetes támogatást, új MPS V3 vezérlést, valamint CUDA Python és CCCL bővítéseket hoz.
- A CUDA Toolkit 13.4 támogatja a Windows on Arm platformot.
- A kiadás előzetes támogatást ad az NVIDIA Rubin architektúrához, compute capability 107 értékkel.
- Az MPS V3 szkriptelhető vezérlést, TOML konfigurációt és cgroup-integrált GPU-memóriakorlátokat vezet be.
- A CUDA Compute Fabric Transport NVLink fabric rendszereken segíti az adatmozgatást kommunikációs könyvtárak számára.
- A CUDA Python, a CCCL, az Nsight eszközök és a matematikai könyvtárak is frissültek.
Windows on Arm is bekerült a CUDA célplatformjai közé
A CUDA Toolkit 13.4 egyik fő újdonsága, hogy támogatja a Windows on Arm platformot. Az NVIDIA közlése szerint a CUDA alkalmazások Arm platformokon eddig régóta elérhetők voltak Linux alatt, az új kiadás pedig ezt a képességet kiterjeszti Windows on Armra is.
A csomag emellett korai fejlesztői támogatást ad az NVIDIA Rubin GPU architektúrához. A Rubin támogatása előzetesként érkezik, compute capability 107 értékkel, így a fejlesztők már a CUDA Toolkit egy későbbi kiadásában várható általános elérhetőség előtt elkezdhetik alkalmazásaik portolását.
Az NVIDIA a Rubin architektúrát a következő generációs GPU architektúraként írja le, amely az ügynökalapú AI korszakát hajtja. A 13.4-es kiadásban az új SM_107 architektúracél is megjelenik, amely lehetővé teszi a Rubin GPU-kra történő fordítást.
Pontosabb megosztott GPU-kezelés MPS V3-mal
A CUDA 13.4-ben megjelenő Multi-Process Service V3 a CUDA MPS modernizált vezérlési rétegét vezeti be. A cél a megosztott GPU-erőforrások automatizálásának és kezelésének egyszerűsítése, különösen olyan környezetekben, ahol több folyamat vagy konténer osztozik ugyanazon hardveren.
Az MPS V3 szkriptelhető parancssori felületet, névvel ellátott szerverpéldányokat és névtereket ad a párhuzamos terhelések rendezéséhez. A frissítés támogatja a TOML konfigurációt, a streaming multiprocessor, röviden SM particionálását, valamint a cgroupokkal integrált GPU-memóriakorlátokat.
Az NVIDIA szerint ezekkel a képességekkel programozottan határozható meg a számítási teljesítmény, a memóriahatár és a végrehajtási prioritás. A vállalat azt is kiemeli, hogy a kiadás konténerizált környezetekbe illeszti az MPS-t, a hardverkihasználás növelése mellett folyamatonként szigorú erőforrás-elkülönítést biztosítva.
Új adatmozgatási út NVLink rendszerekhez
A CUDA Compute Fabric Transport, röviden CFT, új, transzportközpontú API-t ad fejlett alkalmazásoknak és kommunikációs könyvtáraknak. A cél az adatok mozgatása NVIDIA NVLink fabric rendszereken nagy léptékben.
A CFT megközelítése szerint a szoftvereknek nem kell minden távoli GPU-allokációt leképezniük a folyamat virtuális címtartományába. Ehelyett névvel ellátott logikai végpontokat célozhatnak meg végpontazonosítóval és eltolással, majd aszinkron put, get és redukciós műveleteket indíthatnak közvetlenül a GPU-ról.
Az NVIDIA szerint ez csökkenti a virtuális címterhelést nagy, több GPU-s rendszerekben, támogatja az unicast és multicast kommunikációs mintákat, és visszajelzést ad a befejezésről, illetve hibákról. A CFT csak a CUDA Driver API-n keresztül érhető el, és olyan kommunikációs könyvtárak fejlesztőinek szól, akiknek a magasabb szintű kommunikációs könyvtárakban nem elérhető, nagyon specifikus funkciókra van szükségük. A forrás szerint a legtöbb alkalmazásfejlesztő számára továbbra is olyan könyvtárak használata ajánlott, mint az NVIDIA NCCL vagy az NVSHMEM.
Memória, fordítók és Python API-k is frissültek
A CUDA 13.4 programozott hozzáférést ad a lokalitási tartományokhoz. A lokalitási tartomány a GPU olyan része, amely streaming multiprocessorokat és eszközmemóriát tartalmaz. Egy alkalmazás eszközmemóriát foglalhat egy ilyen tartományban, majd ugyanott hozhat létre SM-erőforrásokat tartalmazó green contextet. Az NVIDIA szerint a számítás memóriához közeli elhelyezése javíthatja a teljesítményt olyan eszközökön, amelyek egynél több lokalitási tartománnyal rendelkeznek.
A kiadás API-t ad az egységes memória, vagyis unified memory aktuális helyének lekérdezésére is. Ez a teljesítményérzékeny könyvtáraknak és futtatókörnyezeteknek segíthet megérteni, hol található a felügyelt vagy rendszer által allokált adat, és ennek alapján jobb döntéseket hozni a számítások és adatmozgatások ütemezéséről.
Fontos változás, hogy a CUDA SDK telepítői már nem csomagolják a NVIDIA drivert. A megfelelő nvidia-open driver vagy cuda-toolkit csomagokat külön kell telepíteni a választott csomagkezelővel. Koherens NVIDIA platformokon, például NVIDIA Grace Hopper, NVIDIA Grace Blackwell és NVIDIA Vera Rubin rendszereken a driver alapértelmezésben Coherent Driver-based Memory Management, röviden CDMM módot használ NUMA helyett. A NUMA mód továbbra is teljesen támogatott, kernelmodul-paraméterrel választható, de a módot frissítés előtt kell beállítani, és a beállítás driver újratöltést vagy újraindítást igényel.
A fordítói támogatás is bővült: a host compiler kompatibilitás a támogatott host platformokon már a GCC 16 és a Clang 22 verziókra is kiterjed.
A CUDA Python oldalán a cuda.core 1.1.0 textúra és surface programozást, gazdagabb managed-memory vezérlést, jobb CUDA graph integrációt és teljes típusinformációt ad a fejlesztőeszközöknek és ágenseknek. Az új cuda.core.texture modul Python API-kat kínál a CUDA textúra és surface memóriához. A cuda.compute 1.1 az NVIDIA összefoglalója szerint lehetővé teszi a CCCL algoritmusok idő előtti, több GPU architektúrára történő fordítását.
Mit jelent ez a fejlesztőknek és a piacnak
A CUDA Toolkit 13.4 elsősorban a fejlesztői célplatformok és a nagy GPU-s rendszerek kezelhetősége felől hoz változást. A Windows on Arm támogatás új fejlesztési irányt nyit azoknak, akik CUDA alkalmazásokat Arm alapú Windows környezetben készítenének.
A Rubin előzetes támogatása a portolás korai megkezdését teszi lehetővé, még az általános CUDA támogatás előtt. Ez különösen azoknak a fejlesztőcsapatoknak lehet fontos, amelyek hardvergeneráció-váltásra készülnek, és előre szeretnék ellenőrizni kódjaik kompatibilitását.
A megosztott GPU-kat használó szervezetek számára az MPS V3 jelenthet kézzelfogható előrelépést. A szkriptelhető vezérlés, a névvel ellátott szerverpéldányok, a TOML konfiguráció és a cgroup-integrált memóriakorlátok alapján a GPU-erőforrások finomabban oszthatók fel konténeres környezetekben. A CFT, a lokalitási tartományok és az egységes memória helyének lekérdezése pedig főként azoknak a könyvtárfejlesztőknek és teljesítményre optimalizáló csapatoknak ad új eszközöket, akik nagy, több GPU-s rendszereken dolgoznak.
NVIDIA Developer: CUDA Toolkit 13.4 Adds Windows on Arm Support and Greater Control over Shared GPUs


