Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Megjelent az NVIDIA AICR v1.0 a GPU-klaszterek ellenőrizhető konfigurációjához

2026. október 6. 18:13Forrás: NVIDIA Developer
Megjelent az NVIDIA AICR v1.0 a GPU-klaszterek ellenőrizhető konfigurációjához
Kép: NVIDIA Developer

Az NVIDIA kiadta az AI Cluster Runtime, vagyis az AICR v1.0 verzióját, amely verziózáras konfigurációs receptekkel és ellenőrizhető validációs eredményekkel támogatja a GPU-gyorsított Kubernetes-klasztereket. A kiadás stabil kompatibilitási szabályokat vezet be a parancssori eszközhöz, a REST API-hoz, a Go SDK-hoz és a generált telepítési csomagokhoz.

A lényeg röviden
  • Az AICR v1.0 verziózáras, validált recepteket kínál GPU-s Kubernetes-klaszterekhez.
  • A rendszer Snapshot, Recipe, Bundle és Validation képességekre épül.
  • Stabil kompatibilitási szabályok vonatkoznak a CLI-re, a REST API-ra, a Go SDK-ra és az artefaktumsémákra.
  • A validációs irányítópulton a receptek és az aláírt bizonyítékok is megtekinthetők.
  • A Pulumi Labs és a Mirantis k0rdent-integrációja külső felhasználási példát ad.

Verziózáras receptek a GPU-klaszterekhez

Az NVIDIA Developer október 6-i közleménye szerint a GPU-gyorsított Kubernetes-klaszterek működéséhez számos, eltérő ütemben frissülő összetevő kompatibilitása szükséges. Ide tartozik többek között a gazdagép kernelje, a GPU-illesztőprogram, a konténerfuttatókörnyezet, a Kubernetes, a hálózat, a tárolás, az operátorok és a munkaterhelési keretrendszerek.

Az AICR ezt a problémát verziózáras és validált receptekkel kezeli. Egy recept rögzíti az együtt működő komponensek kombinációját, telepítési artefaktumokat állít elő Helm, Argo CD, Flux vagy Helmfile számára, és aláírt bizonyítékot tartalmaz arról a hardverről, amelyen a konfigurációt tesztelték.

A projekt szerint egy korábban működő összeállítást egyetlen komponens frissítése is felboríthat. A telepítés önmagában azt sem igazolja, hogy a komponensek egészségesek, hogy az olyan szükséges képességek, mint a csoportos ütemezés vagy a gyorsítófelismerés működnek, illetve hogy a mért eredmények megfelelnek a recept teljesítményküszöbeinek.

Négy különálló képesség alkotja az AICR-t

Az AICR négy alapvető képességre épül. A Snapshot a klaszter megfigyelt állapotát rögzíti, beleértve a Kubernetes, az operációs rendszer, a kernel, a GPU és a topológia adatait. A Recipe a kívánt, verziózáras konfigurációt, valamint az alkalmazandó korlátozásokat és validációs fázisokat írja le.

A Bundle a receptből a választott telepítési eszközhöz szükséges artefaktumokat állítja elő. A Validation összeveti a receptet a megfigyelt állapottal, és ahol ezt a recept előírja, telepítési, megfelelőségi és teljesítmény-ellenőrzéseket futtat a klaszteren.

A képességek külön is használhatók. A Snapshot nem kívánt konfigurációt, a Recipe pedig nem klaszteregyeztetést végez. A telepítést és az egyeztetést a Helm, az Argo CD, a Flux vagy a Helmfile végezheti, az AICR pedig ezt követően ellenőrizheti a futó klasztert, majd aláírt bizonyítékot rögzíthet az eredményről.

Az NVIDIA példája szerint egy üzemeltető az EKS, a GB300, az Ubuntu, a training és a Kubeflow kiválasztásával rögzített receptet kereshet, azt Argo CD-hez renderelheti, majd a meglévő GitOps-folyamaton keresztül telepítheti. Ugyanez a kívánt konfiguráció Helm, Flux vagy Helmfile használatával is előállítható.

Stabil nyilvános interfészek és ellenőrzési felület

Az AICR v1.0 kompatibilitási szabályokat határoz meg az aicr parancssori eszköz nyilvános parancsaira, kapcsolóira, kilépési szemantikájára és strukturált kimenetére. A szabályok kiterjednek az aicrd REST API-ra és annak OpenAPI-szerződésére, a github.com/NVIDIA/aicr/pkg/client/v1 csomag exportált API-jára, továbbá a generált bundle-elrendezésre és az AICR artefaktumsémáira.

Minden nyilvános felülethez rögzített kompatibilitási alapvonal tartozik, amelyet a módosítások összeolvasztása előtt ellenőriznek. Az AICR v1.x kompatibilitási szabályzata szerint egy stabil nyilvános felület eltávolítása vagy inkompatibilis módosítása új főverziót igényel. A Go-integrátorok a támogatott munkafolyamatot a pkg/client/v1 csomagon keresztül érhetik el, belső AICR-csomagok importálása nélkül.

A validációs irányítópulton a receptek szolgáltatás, GPU, operációs rendszer, munkaterhelési cél és opcionális platform szerint kereshetők. Az üzemeltetők megtekinthetik az egyes receptek állapotát, a tesztelt hardverkonfigurációt, a sikeres ellenőrzéseket és az eredmények aláíróját.

Külső hozzájárulások és ökoszisztéma-integrációk

Az NVIDIA szerint az AICR-nek jelenleg több mint 100 közreműködője van, akiknek csaknem fele a vállalaton kívülről érkezik. A hozzájárulók olyan hardverhez, operációs rendszerhez vagy szolgáltatáshoz is javasolhatnak receptet, amely még nem szerepel a projektben. Saját klaszterükön validálhatják a konfigurációt, majd aláírt bizonyítékot küldhetnek be a karbantartók felülvizsgálatára.

A Pulumi Labs az AICR-t infrastruktúra-kódként használható szolgáltatón keresztül teszi elérhetővé, a Mirantis k0rdent-integrációja pedig többklaszteres kezeléshez csomagolja. Ezek a példák ugyanannak a GPU-klaszter-konfigurációnak az eltérő infrastruktúra- és többklaszteres eszközökön keresztüli használatát mutatják.

A felhasználók kipróbálhatnak egy környezetükhöz illő receptet, megtekinthetik annak állapotát és közzétett bizonyítékait, valamint elindíthatják az aicr evidence verify parancsot ott, ahol rendelkezésre áll bizonyíték. Az NVIDIA a projekt tárházában, a közreműködési útmutatóban és a hibakövetőben várja a funkciókra, integrációkra, dokumentációra és új receptekre vonatkozó hozzájárulásokat.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az NVIDIA új CUDA-funkcióval szabályozná, hogyan osztozik a GPU a munkán
Fejlesztőknek2026. október 6. 17:00

Az NVIDIA új CUDA-funkcióval szabályozná, hogyan osztozik a GPU a munkán

A CUDA 13.1-ben a green context funkcióval az alkalmazások egyetlen folyamaton belül kijelölhetik, mely GPU-erőforrásokon fusson az egyes munkaterhelés. Az NVIDIA…

A CoreWeave Kubernetesre ültette a Slurm HPC-ütemezőt
Fejlesztőknek2026. október 2. 16:12

A CoreWeave Kubernetesre ültette a Slurm HPC-ütemezőt

A CoreWeave bemutatta a SUNK-ot, amely a Slurm HPC-ütemezőt Kubernetesen futtatja. A megoldás célja, hogy a kötegelt Slurm-feladatok és a hosszú futású…

NVIDIA NVCRE: GPU-klaszterek tesztelése éles AI-terhelés előtt
Chipek és infrastruktúra2026. szeptember 23. 21:45

NVIDIA NVCRE: GPU-klaszterek tesztelése éles AI-terhelés előtt

Valódi elosztott AI-terhelésekkel ellenőrizné a GPU-klaszterek éles üzemre való alkalmasságát az NVIDIA Cluster Readiness Engine. A nyílt forrású Kubernetes-vezérlő…