A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt

A Red Hat az MLPerf Inference v6.1 tesztjeiben magas teljesítményt ért el Kubernetes-alapú GPU-s rendszereken, miközben CPU-only konfigurációkon is erős eredményeket mutatott fel. A vállalat négy nyílt súlyú modellel, NVIDIA GB200 NVL4 rendszereken és Intel Xeon 6 processzorokon végzett méréseket.
- A Red Hat gpt-oss-120b alatt 61 205,6 tok/s eredményt ért el négy GB200 GPU-n.
- A vállalat szerint ez volt az egyetlen Kubernetes-alapú GB200-benyújtás ebben a fordulóban.
- A Qwen3-VL szerverüzemmódban 50,68 lekérdezést dolgozott fel másodpercenként.
- A Llama-3.1-8B és a Whisper-Large-v3 CPU-only konfiguráción is kiemelkedő magonkénti eredményt ért el.
- A 32 adatközponti benyújtó közül 22 használt vLLM-et valamilyen formában.
A GB200 NVL4 rendszeren is kiemelkedett az OpenShift
A Red Hat szeptember 29-én ismertette az MLPerf Inference v6.1 benchmarkban elért eredményeit. A vállalat szerint a mérési forduló három szempontból volt fontos: a Kubernetes-alapú infrastruktúrán elért teljesítmény, az egyetlen inferenciamotor, a vLLM használata GPU-kon és CPU-kon, valamint a kisebb modellek gyorsító nélküli kiszolgálásának lehetősége.
A tesztekben a gpt-oss-120b, a Qwen3-VL-235B-A22B, a Llama-3.1-8B és a Whisper-Large-v3 szerepelt. A GPU-s eredményekhez NVIDIA GB200 NVL4 rendszereket használtak, míg a CPU-only mérések kétfoglalatos Intel Xeon 6 szerveren készültek.
A gpt-oss-120b offline tesztjében a Red Hat 61 205,6 tok/s eredményt ért el egy négy GB200 GPU-t tartalmazó rendszeren. Ez a vállalat szerint 20 százalékkal magasabb volt az egyetlen másik, négy GPU-s GB200-benyújtás eredményénél. Szerverüzemmódban 51 095,2 tok/s értéket mértek, amely a Red Hat szerint a négy GPU-s GB200 konfigurációk között a legmagasabb volt.
A rendszer Red Hat OpenShift 4.21, Red Hat Enterprise Linux CoreOS 9.6 és vLLM 0.24.0 szoftverkörnyezettel futott. A Red Hat közlése szerint ez volt az egyetlen Kubernetes-alapú benyújtás a zárt adatközponti kategóriában. GPU-ra normalizálva az offline eredmény nagyjából 15 300 tok/s volt GPU-nként, amely a vállalat állítása szerint még a 72 GPU-s NVL72 rendszerek 12 300 és 12 700 tok/s közötti értékeit is meghaladta.
A multimodális modellnél a NUMA-beállítás döntőnek bizonyult
A Qwen3-VL-235B-A22B egy 235 milliárd paraméteres, Mixture of Experts alapú látás-nyelvi modell, amelyből 22 milliárd paraméter aktív. A teszt egy 48 289 multimodális mintát tartalmazó Shopify-termékkatalógus adathalmazán zajlott, ahol a képfelbontás akár hússzoros eltérést is mutatott.
A Red Hat, az NVIDIA és a Supermicro közös benyújtásában a rendszer szerverüzemmódban 50,68 lekérdezést másodpercenként, offline módban pedig 58,08 mintát másodpercenként dolgozott fel. A Red Hat szerint az első érték volt a legjobb a négy GPU-s GB200-benyújtások között, a második pedig a legjobbak között szerepelt.
A vállalat elemzése szerint a teljesítményt erősen befolyásolta a NUMA-topológia. Amikor a vLLM munkafolyamatait nem kötötték meghatározott processzorfoglalathoz, a munkafolyamatok memóriájának 61 és 89 százaléka a távoli foglalatra került, miközben a host és az eszköz közötti sávszélesség körülbelül 166 GB/s-ról 50 GB/s-ra esett. A socketenként rögzített munkafolyamatok, valamint a numactl használata a Red Hat szerint nagyjából 9 százalékkal növelte a végpontok közötti teljesítményt.
A CPU-only inferencia kisebb modelleknél is használható
A kétfoglalatos Intel Xeon 6972P szerveren 192 Granite Rapids mag állt rendelkezésre, gyorsító nélkül. A Llama-3.1-8B offline tesztje 1507,21 tok/s eredményt hozott, szerverüzemmódban pedig 644,79 tok/s értéket mértek. A Red Hat szerint az offline mérésben ez volt a legmagasabb magonkénti teljesítmény az összes kétfoglalatos CPU-only benyújtás között.
A Whisper-Large-v3 beszédfelismerési modell ugyanazon a rendszeren 1966,11 mintát dolgozott fel másodpercenként. A Red Hat közlése szerint ez 10,24 minta másodpercenként és mag értéket jelentett, 13 százalékkal többet a következő legjobb eredménynél.
A vállalat szerint ebben a tesztfordulóban hét benyújtó összesen kilenc CPU-only Llama-3.1-8B eredményt tett közzé. Ez arra utal, hogy a CPU-inferencia használható lehet késleltetésre kevésbé érzékeny kötegelt feladatoknál, illetve kisebb modellek mérsékelt áteresztőképességű kiszolgálására. A Red Hat azt is kiemeli, hogy a kisebb, például biztonsági korlátokhoz vagy vektorembeddingek előállításához finomhangolt modellek CPU-kon futhatnak, így a gyorsítók a nagyobb terhelések számára szabadon maradhatnak.
A vLLM több tucat benyújtásban szerepelt
A Red Hat szerint a mérési forduló 32 adatközponti benyújtója közül 22 valamilyen formában vLLM-et használt. A vállalat ezt az open source inferenciamotor széles körű iparági használatának jeleként értékeli.
A bemutatott eredmények azt támasztják alá, hogy ugyanaz a szoftveres réteg GPU- és CPU-architektúrákon is alkalmazható. A Red Hat számára ez különösen a Kubernetesen futó AI-inferencia szempontjából fontos, mivel a közlemény szerint az OpenShift és a vLLM kombinációja a GB200 rendszeren a bare metal környezetekhez képest nem okozott teljesítményhátrányt.

