A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben

A Red Hat közzétette az MLPerf Inference v6.1 benchmarkban elért eredményeit. A vállalat szerint az OpenShift és a vLLM Kubernetes-alapú környezetben is versenyképes teljesítményt nyújtott, miközben a CPU-only következtetés is használható opciónak bizonyult kisebb modelleknél.
- A Red Hat szerint a gpt-oss-120b 61 205,6 tokent ért el másodpercenként GB200 NVL4 rendszeren.
- A gpt-oss-120b eredménye OpenShift 4.21-en és vLLM 0.24.0-val született.
- A Qwen3-VL szerverforgatókönyvben 50,68 lekérdezés/másodpercet ért el.
- A Llama-3.1-8B és a Whisper-Large-v3 Intel Xeon 6972P CPU-only rendszeren futott.
- A Red Hat szerint a vLLM-et a forduló 32 adatközponti benyújtója közül 22 használta.
Négy modell, GPU-s és CPU-s rendszereken
A Red Hat szeptember 29-én ismertetett közleménye szerint négy nyílt súlyú modellen indult az MLPerf Inference v6.1 fordulójában. A gpt-oss-120b és a Qwen3-VL-235B-A22B NVIDIA GB200 NVL4 rendszereken futott, míg a Llama-3.1-8B és a Whisper-Large-v3 kétfoglalatos, kizárólag CPU-kat használó Intel Xeon 6972P szerveren szerepelt.
A vállalat az MLPerfet iparági, szabványosított és szakértők által ellenőrzött teljesítménymérésként írja le. A benchmark lehetővé teszi a hardveres és szoftveres összeállítások összehasonlítását, miközben a nyílt forrású technológiákat ugyanazon mérce szerint vizsgálja, mint a zárt alternatívákat.
Erős eredmény a GB200 rendszereken
A gpt-oss-120b offline forgatókönyvben másodpercenként 61 205,6 tokent ért el egy négy GB200 GPU-t tartalmazó NVL4 rendszeren. Ez a Red Hat szerint 20 százalékkal magasabb volt az egyetlen másik, négy GPU-s GB200-benyújtás eredményénél. Szerverforgatókönyvben 51 095,2 token/másodperc lett az eredmény, amely a négy GPU-s GB200 rendszerek között a legmagasabb volt.
A rendszer OpenShift 4.21-et, Red Hat Enterprise Linux CoreOS 9.6-ot és vLLM 0.24.0-t használt. A Red Hat szerint ez volt az egyetlen, Kubernetes-infrastruktúrán futó benyújtás a zárt adatközponti divízióban. GPU-ra normalizálva az offline teljesítmény körülbelül 15 300 token/másodperc volt GPU-nként, ami a vállalat szerint minden GB200-benyújtás között a legmagasabb értéknek számított ebben a fordulóban, a 72 GPU-s NVL72 rendszereket is beleértve.
A Qwen3-VL-235B-A22B szerverforgatókönyvben 50,68 lekérdezés/másodpercet, offline mérésben pedig 58,08 mintát/másodpercet ért el. A tesztben a vLLM mellett az NVIDIA Dynamo és a Red Hat Enterprise Linux is szerepelt.
CPU-val is futtathatók kisebb modellek
Az Intel Xeon 6972P alapú, kétfoglalatos, 192 Granite Rapids magot tartalmazó szerveren a Llama-3.1-8B offline teljesítménye 1507,21 token/másodperc volt. A Red Hat szerint ez adta a forduló legmagasabb magonkénti teljesítményét a kétfoglalatos, csak CPU-t használó benyújtások között. Szerverforgatókönyvben az eredmény 644,79 token/másodperc lett.
A Whisper-Large-v3 ugyanazon a rendszeren 1966,11 mintát/másodperc ért el. Ez 10,24 minta/másodperc/mag teljesítménynek felelt meg, és a Red Hat szerint 13 százalékkal múlta felül a következő legjobb eredményt a kategóriában.
A vállalat közlése szerint ebben a fordulóban kilenc, csak CPU-s Llama-3.1-8B eredmény született hét résztvevőtől. A Red Hat ezt annak jeleként értelmezi, hogy a CPU-s következtetés késleltetéstűrő kötegelt feladatoknál, illetve kisebb modellek mérsékelt forgalmú kiszolgálásánál is bevethető. Ilyen modellek futhatnak például gyorsítók mellett, így az azok kapacitása a nagyobb számítási igényű feladatokra maradhat.
A hangolás és a vLLM szerepe
A Qwen3-VL mérésénél a Red Hat szerint fontos tényező volt a NUMA-topológia. A vLLM-munkafolyamatok rögzítése nélkül a memória 61 és 89 százaléka a távoli foglalathoz került, a gazdagép és az eszköz közötti sávszélesség pedig körülbelül 166 GB/s-ról 50 GB/s-ra esett. A munkafolyamatok foglalatonkénti rögzítése nagyjából 9 százalékkal javította a teljes végponttól végpontig mért teljesítményt.
A CPU-s hangolásnál a Red Hat a memória-sávszélességet, az ütemezési zavarokat és a tétlen állapotból eredő késleltetést célozta. A vállalat szerint a vLLM környezetében lefoglalt magok biztosítanak helyet a kiszolgáló előtétjének és a benchmark terhelésgenerátorának, így ezek a szálak kevésbé zavarják az inferencia munkafolyamatait.
A közlemény szerint a forduló 32 adatközponti benyújtója közül 22 valahol használta a vLLM-et. A Red Hat eredményei így azt mutatják, hogy ugyanaz a nyílt forrású következtetési réteg GPU-s OpenShift-rendszereken és CPU-only szervereken is alkalmazható.

