Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt

2026. szeptember 29.Forrás: Red Hat
A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt
Kép: Red Hat

A Red Hat az MLPerf Inference v6.1 tesztjeiben magas teljesítményt ért el Kubernetes-alapú GPU-s rendszereken, miközben CPU-only konfigurációkon is erős eredményeket mutatott fel. A vállalat négy nyílt súlyú modellel, NVIDIA GB200 NVL4 rendszereken és Intel Xeon 6 processzorokon végzett méréseket.

A lényeg röviden
  • A Red Hat gpt-oss-120b alatt 61 205,6 tok/s eredményt ért el négy GB200 GPU-n.
  • A vállalat szerint ez volt az egyetlen Kubernetes-alapú GB200-benyújtás ebben a fordulóban.
  • A Qwen3-VL szerverüzemmódban 50,68 lekérdezést dolgozott fel másodpercenként.
  • A Llama-3.1-8B és a Whisper-Large-v3 CPU-only konfiguráción is kiemelkedő magonkénti eredményt ért el.
  • A 32 adatközponti benyújtó közül 22 használt vLLM-et valamilyen formában.

A GB200 NVL4 rendszeren is kiemelkedett az OpenShift

A Red Hat szeptember 29-én ismertette az MLPerf Inference v6.1 benchmarkban elért eredményeit. A vállalat szerint a mérési forduló három szempontból volt fontos: a Kubernetes-alapú infrastruktúrán elért teljesítmény, az egyetlen inferenciamotor, a vLLM használata GPU-kon és CPU-kon, valamint a kisebb modellek gyorsító nélküli kiszolgálásának lehetősége.

A tesztekben a gpt-oss-120b, a Qwen3-VL-235B-A22B, a Llama-3.1-8B és a Whisper-Large-v3 szerepelt. A GPU-s eredményekhez NVIDIA GB200 NVL4 rendszereket használtak, míg a CPU-only mérések kétfoglalatos Intel Xeon 6 szerveren készültek.

A gpt-oss-120b offline tesztjében a Red Hat 61 205,6 tok/s eredményt ért el egy négy GB200 GPU-t tartalmazó rendszeren. Ez a vállalat szerint 20 százalékkal magasabb volt az egyetlen másik, négy GPU-s GB200-benyújtás eredményénél. Szerverüzemmódban 51 095,2 tok/s értéket mértek, amely a Red Hat szerint a négy GPU-s GB200 konfigurációk között a legmagasabb volt.

A rendszer Red Hat OpenShift 4.21, Red Hat Enterprise Linux CoreOS 9.6 és vLLM 0.24.0 szoftverkörnyezettel futott. A Red Hat közlése szerint ez volt az egyetlen Kubernetes-alapú benyújtás a zárt adatközponti kategóriában. GPU-ra normalizálva az offline eredmény nagyjából 15 300 tok/s volt GPU-nként, amely a vállalat állítása szerint még a 72 GPU-s NVL72 rendszerek 12 300 és 12 700 tok/s közötti értékeit is meghaladta.

A multimodális modellnél a NUMA-beállítás döntőnek bizonyult

A Qwen3-VL-235B-A22B egy 235 milliárd paraméteres, Mixture of Experts alapú látás-nyelvi modell, amelyből 22 milliárd paraméter aktív. A teszt egy 48 289 multimodális mintát tartalmazó Shopify-termékkatalógus adathalmazán zajlott, ahol a képfelbontás akár hússzoros eltérést is mutatott.

A Red Hat, az NVIDIA és a Supermicro közös benyújtásában a rendszer szerverüzemmódban 50,68 lekérdezést másodpercenként, offline módban pedig 58,08 mintát másodpercenként dolgozott fel. A Red Hat szerint az első érték volt a legjobb a négy GPU-s GB200-benyújtások között, a második pedig a legjobbak között szerepelt.

A vállalat elemzése szerint a teljesítményt erősen befolyásolta a NUMA-topológia. Amikor a vLLM munkafolyamatait nem kötötték meghatározott processzorfoglalathoz, a munkafolyamatok memóriájának 61 és 89 százaléka a távoli foglalatra került, miközben a host és az eszköz közötti sávszélesség körülbelül 166 GB/s-ról 50 GB/s-ra esett. A socketenként rögzített munkafolyamatok, valamint a numactl használata a Red Hat szerint nagyjából 9 százalékkal növelte a végpontok közötti teljesítményt.

A CPU-only inferencia kisebb modelleknél is használható

A kétfoglalatos Intel Xeon 6972P szerveren 192 Granite Rapids mag állt rendelkezésre, gyorsító nélkül. A Llama-3.1-8B offline tesztje 1507,21 tok/s eredményt hozott, szerverüzemmódban pedig 644,79 tok/s értéket mértek. A Red Hat szerint az offline mérésben ez volt a legmagasabb magonkénti teljesítmény az összes kétfoglalatos CPU-only benyújtás között.

A Whisper-Large-v3 beszédfelismerési modell ugyanazon a rendszeren 1966,11 mintát dolgozott fel másodpercenként. A Red Hat közlése szerint ez 10,24 minta másodpercenként és mag értéket jelentett, 13 százalékkal többet a következő legjobb eredménynél.

A vállalat szerint ebben a tesztfordulóban hét benyújtó összesen kilenc CPU-only Llama-3.1-8B eredményt tett közzé. Ez arra utal, hogy a CPU-inferencia használható lehet késleltetésre kevésbé érzékeny kötegelt feladatoknál, illetve kisebb modellek mérsékelt áteresztőképességű kiszolgálására. A Red Hat azt is kiemeli, hogy a kisebb, például biztonsági korlátokhoz vagy vektorembeddingek előállításához finomhangolt modellek CPU-kon futhatnak, így a gyorsítók a nagyobb terhelések számára szabadon maradhatnak.

A vLLM több tucat benyújtásban szerepelt

A Red Hat szerint a mérési forduló 32 adatközponti benyújtója közül 22 valamilyen formában vLLM-et használt. A vállalat ezt az open source inferenciamotor széles körű iparági használatának jeleként értékeli.

A bemutatott eredmények azt támasztják alá, hogy ugyanaz a szoftveres réteg GPU- és CPU-architektúrákon is alkalmazható. A Red Hat számára ez különösen a Kubernetesen futó AI-inferencia szempontjából fontos, mivel a közlemény szerint az OpenShift és a vLLM kombinációja a GB200 rendszeren a bare metal környezetekhez képest nem okozott teljesítményhátrányt.

Kapcsolódó hírek

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia
Fejlesztőknek2026. október 2. 23:09

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia

A Baseten egy LLM által létrehozott, egyedi inferenciamotorral akár 90 százalékkal jobb egyfolyamos dekódolási sebességet ért el a vLLM-nél. A VibeQwen nevű motor…

Fejlesztőknek
Fejlesztőknek2026. október 2. 21:55

A Helion gyorsíthatja a vLLM LLM-inferenciáját NVIDIA GPU-kon

A PyTorch Helion-alapú lineáris backendet integrált a vLLM-be, hogy automatikus hangolással javítsa a nagy nyelvi modellek következtetési teljesítményét. Az NVIDIA…

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben

A Red Hat közzétette az MLPerf Inference v6.1 benchmarkban elért eredményeit. A vállalat szerint az OpenShift és a vLLM Kubernetes-alapú környezetben is versenyképes…