Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben

2026. szeptember 29.Forrás: Red Hat
A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben
Kép: Red Hat

A Red Hat közzétette az MLPerf Inference v6.1 benchmarkban elért eredményeit. A vállalat szerint az OpenShift és a vLLM Kubernetes-alapú környezetben is versenyképes teljesítményt nyújtott, miközben a CPU-only következtetés is használható opciónak bizonyult kisebb modelleknél.

A lényeg röviden
  • A Red Hat szerint a gpt-oss-120b 61 205,6 tokent ért el másodpercenként GB200 NVL4 rendszeren.
  • A gpt-oss-120b eredménye OpenShift 4.21-en és vLLM 0.24.0-val született.
  • A Qwen3-VL szerverforgatókönyvben 50,68 lekérdezés/másodpercet ért el.
  • A Llama-3.1-8B és a Whisper-Large-v3 Intel Xeon 6972P CPU-only rendszeren futott.
  • A Red Hat szerint a vLLM-et a forduló 32 adatközponti benyújtója közül 22 használta.

Négy modell, GPU-s és CPU-s rendszereken

A Red Hat szeptember 29-én ismertetett közleménye szerint négy nyílt súlyú modellen indult az MLPerf Inference v6.1 fordulójában. A gpt-oss-120b és a Qwen3-VL-235B-A22B NVIDIA GB200 NVL4 rendszereken futott, míg a Llama-3.1-8B és a Whisper-Large-v3 kétfoglalatos, kizárólag CPU-kat használó Intel Xeon 6972P szerveren szerepelt.

A vállalat az MLPerfet iparági, szabványosított és szakértők által ellenőrzött teljesítménymérésként írja le. A benchmark lehetővé teszi a hardveres és szoftveres összeállítások összehasonlítását, miközben a nyílt forrású technológiákat ugyanazon mérce szerint vizsgálja, mint a zárt alternatívákat.

Erős eredmény a GB200 rendszereken

A gpt-oss-120b offline forgatókönyvben másodpercenként 61 205,6 tokent ért el egy négy GB200 GPU-t tartalmazó NVL4 rendszeren. Ez a Red Hat szerint 20 százalékkal magasabb volt az egyetlen másik, négy GPU-s GB200-benyújtás eredményénél. Szerverforgatókönyvben 51 095,2 token/másodperc lett az eredmény, amely a négy GPU-s GB200 rendszerek között a legmagasabb volt.

A rendszer OpenShift 4.21-et, Red Hat Enterprise Linux CoreOS 9.6-ot és vLLM 0.24.0-t használt. A Red Hat szerint ez volt az egyetlen, Kubernetes-infrastruktúrán futó benyújtás a zárt adatközponti divízióban. GPU-ra normalizálva az offline teljesítmény körülbelül 15 300 token/másodperc volt GPU-nként, ami a vállalat szerint minden GB200-benyújtás között a legmagasabb értéknek számított ebben a fordulóban, a 72 GPU-s NVL72 rendszereket is beleértve.

A Qwen3-VL-235B-A22B szerverforgatókönyvben 50,68 lekérdezés/másodpercet, offline mérésben pedig 58,08 mintát/másodpercet ért el. A tesztben a vLLM mellett az NVIDIA Dynamo és a Red Hat Enterprise Linux is szerepelt.

CPU-val is futtathatók kisebb modellek

Az Intel Xeon 6972P alapú, kétfoglalatos, 192 Granite Rapids magot tartalmazó szerveren a Llama-3.1-8B offline teljesítménye 1507,21 token/másodperc volt. A Red Hat szerint ez adta a forduló legmagasabb magonkénti teljesítményét a kétfoglalatos, csak CPU-t használó benyújtások között. Szerverforgatókönyvben az eredmény 644,79 token/másodperc lett.

A Whisper-Large-v3 ugyanazon a rendszeren 1966,11 mintát/másodperc ért el. Ez 10,24 minta/másodperc/mag teljesítménynek felelt meg, és a Red Hat szerint 13 százalékkal múlta felül a következő legjobb eredményt a kategóriában.

A vállalat közlése szerint ebben a fordulóban kilenc, csak CPU-s Llama-3.1-8B eredmény született hét résztvevőtől. A Red Hat ezt annak jeleként értelmezi, hogy a CPU-s következtetés késleltetéstűrő kötegelt feladatoknál, illetve kisebb modellek mérsékelt forgalmú kiszolgálásánál is bevethető. Ilyen modellek futhatnak például gyorsítók mellett, így az azok kapacitása a nagyobb számítási igényű feladatokra maradhat.

A hangolás és a vLLM szerepe

A Qwen3-VL mérésénél a Red Hat szerint fontos tényező volt a NUMA-topológia. A vLLM-munkafolyamatok rögzítése nélkül a memória 61 és 89 százaléka a távoli foglalathoz került, a gazdagép és az eszköz közötti sávszélesség pedig körülbelül 166 GB/s-ról 50 GB/s-ra esett. A munkafolyamatok foglalatonkénti rögzítése nagyjából 9 százalékkal javította a teljes végponttól végpontig mért teljesítményt.

A CPU-s hangolásnál a Red Hat a memória-sávszélességet, az ütemezési zavarokat és a tétlen állapotból eredő késleltetést célozta. A vállalat szerint a vLLM környezetében lefoglalt magok biztosítanak helyet a kiszolgáló előtétjének és a benchmark terhelésgenerátorának, így ezek a szálak kevésbé zavarják az inferencia munkafolyamatait.

A közlemény szerint a forduló 32 adatközponti benyújtója közül 22 valahol használta a vLLM-et. A Red Hat eredményei így azt mutatják, hogy ugyanaz a nyílt forrású következtetési réteg GPU-s OpenShift-rendszereken és CPU-only szervereken is alkalmazható.

Kapcsolódó hírek

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia
Fejlesztőknek2026. október 2.

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia

A Baseten egy LLM által létrehozott, egyedi inferenciamotorral akár 90 százalékkal jobb egyfolyamos dekódolási sebességet ért el a vLLM-nél. A VibeQwen nevű motor…

Fejlesztőknek
Fejlesztőknek2026. október 2.

A Helion gyorsíthatja a vLLM LLM-inferenciáját NVIDIA GPU-kon

A PyTorch Helion-alapú lineáris backendet integrált a vLLM-be, hogy automatikus hangolással javítsa a nagy nyelvi modellek következtetési teljesítményét. Az NVIDIA…

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt

A Red Hat az MLPerf Inference v6.1 tesztjeiben magas teljesítményt ért el Kubernetes-alapú GPU-s rendszereken, miközben CPU-only konfigurációkon is erős eredményeket…