CNCF-minősítést kapott a Nutanix Kubernetes Platform AI-képessége

CNCF Certified Kubernetes AI Conformant Platform minősítést szerzett a Nutanix Kubernetes Platform. Az NKP 2.18 a program mind a tizenkét követelményét teljesítette, a validációt valódi GPU-terhelésekkel, éles infrastruktúrán végezték.
- Az NKP 2.18 teljesítette a CNCF AI Conformance Program mind a 12 követelményét.
- A validáció Kubernetes v1.35-tel, NVIDIA GPU-kkal és Nutanix infrastruktúrán zajlott.
- A platform támogatja a GPU-kezelést, a csoportos ütemezést és az automatikus méretezést.
- Az NKP nyilvános felhőben, helyszíni infrastruktúrán és bare metal környezetben is használható.
Közös alapot adna a Kubernetesen futó AI-nak
A Nutanix augusztus 26-i közleménye szerint a Nutanix Kubernetes Platform, röviden NKP, megkapta a Cloud Native Computing Foundation, vagyis a CNCF Certified Kubernetes AI Conformant Platform minősítését. A tanúsítást az NKP 2.18-as verziója szerezte meg, amely a CNCF Kubernetes AI Conformance Program mind a tizenkét követelményének megfelel.
A CNCF a programot a KubeCon + CloudNativeCon North America 2025 rendezvényen indította el. A közösség által vezetett kezdeményezés célja, hogy meghatározza és ellenőrizze a Kubernetesen futó mesterségesintelligencia-munkaterhelések megbízható és következetes üzemeltetéséhez szükséges alapokat. A követelmények olyan területekre terjednek ki, mint a gyorsítók kezelése, a csoportos ütemezés, az automatikus méretezés, a következtetési hálózatkezelés, a megfigyelhetőség és a biztonság.
A CNCF szerint a program a Kubernetes eredeti megfelelőségi modelljét követi. Az eredeti Certified Kubernetes Conformance Program több mint 100 disztribúció és platform működésében teremtett következetességet a nagy felhőszolgáltatók és a helyszíni infrastruktúrák körében. Az AI Conformance Program ugyanezt a közösségi, gyártófüggetlen megközelítést alkalmazza az AI-infrastruktúrára.
GPU-k, ütemezés és automatikus méretezés
A megfelelőséget az NKP 2.18 Kubernetes v1.35-tel, NVIDIA GPU-kkal és Nutanix infrastruktúrán működő környezetben ellenőrizték. A platform része az NVIDIA GPU Operator, amely automatizálja a GPU-csomópontok illesztőprogramjának, konténereszköztárának, eszközbővítményének és futtatási környezetének életciklusát.
Az NKP készen biztosítja a Kubernetes v1.34 óta általánosan elérhető Dynamic Resource Allocation API-kat is. Ezek részletesebb, strukturált gyorsítóigényléseket tesznek lehetővé. A platform támogatja a GPU-k időosztásos megosztását, így több pod is használhat egy fizikai GPU-t, valamint vGPU-alapú csomópontkészleteket is kezel.
Az elosztott AI-munkaterhelésekhez az NKP a Kueue segítségével csoportos ütemezést kínál. Egy feladat akkor kerül be, ha a teljes kvótája rendelkezésre áll, így nem jön létre részleges elhelyezés vagy kihasználatlanul maradó gyorsító. A Cluster API alapjaira építve a Cluster Autoscaler külön méretezi a GPU-csomópontkészleteket. Új gyorsítókat ad hozzá, amikor GPU-t igénylő podok várakoznak, majd visszaveszi őket, amikor nincs rájuk szükség. A Horizontal Pod Autoscaler gyorsítókat használó podokon is működik, egyebek mellett olyan egyedi AI-mutatók alapján, mint az élő GPU-kihasználtság.
Biztonságosabb modellkiszolgálás és átlátható működés
Az NKP támogatja a Kubernetes Gateway API-t, és az Envoy Gateway elérhető a platform katalógusában. Ez lehetővé teszi, hogy egy új modellverzió forgalmának csak kis részét irányítsák át tesztelésre, vagy a kéréseket fejléc alapján meghatározott modellverzióhoz küldjék. Ha az új verzió gyengébben teljesít, a forgalom visszairányítható az ügyfélalkalmazások módosítása nélkül.
A megfigyelhetőséget a DCGM Exporter, valamint az NKP Prometheus, Grafana, Alertmanager, Loki és Thanos elemeket tartalmazó monitorozási rendszere támogatja. A megoldás gyűjti többek között az egyes GPU-k kihasználtságára, memóriájára, hőmérsékletére, fogyasztására és összeköttetéseire vonatkozó adatokat. Ugyanez a ServiceMonitor-szerződés az AI-munkaterhelések mutatóit is kezeli, például a Kueue feladatsorának hosszát és a KServe által kiszolgált modellek következtetési késleltetését.
A Nutanix közlése szerint egy konténer csak akkor kap hozzáférést GPU-hoz, ha a pod kifejezetten igényli azt. A vállalat állítása alapján minden GPU kizárólag a hozzárendelt munkaterhelésekhez kerül, ami erősebb elkülönítést támogathat a közösen használt fürtökben.
Egy platform felhőben, helyszíni környezetben és bare metalon
A Nutanix szerint a minősítés különösen az NKP ügyfelei számára lehet fontos, mivel a platform ugyanazt a szoftveres alapot biztosítja nyilvános felhőkben és helyszíni infrastruktúrán, beleértve a bare metal környezeteket is. A vállalat értelmezése szerint ez következetesebb működést adhat az alapvető AI-képességek számára, és megkönnyítheti a munkaterhelések áthelyezését újraplatformozás nélkül.
A CNCF AI Conformance Programjának célja az AI- és gépi tanulási munkaterhelések hordozhatóságának és együttműködésének támogatása. A Nutanix szerint a közös, gyártófüggetlen alap csökkentheti az egyedi platformokból, eltérő API-kból és nem hordozható munkaterhelésekből fakadó üzleti kockázatokat. A program nyíltan fejlesztett anyagai a CNCF GitHub-tárházában érhetők el, az NKP AI-képességeiről pedig a Nutanix dokumentációja és AI Applications katalógusa ad további részleteket.
