Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A vLLM szerint 7,8-szoros gyorsulást hoz a Vera Rubin NVL72

2026. október 9.Forrás: vLLM
A vLLM szerint 7,8-szoros gyorsulást hoz a Vera Rubin NVL72
Kép: vLLM

A vLLM már támogatja az NVIDIA Vera Rubin NVL72 platformot, amelyen a fejlesztők korai eredményei szerint GPU-nként akár 7,8-szoros átviteli teljesítmény érhető el a GB200 NVL72-höz képest. A rendszerhez napi konténerbuild és több modell támogatása is elérhető.

A lényeg röviden
  • A vLLM már támogatja az NVIDIA Vera Rubin NVL72 platformot.
  • A Rubin NVL72 a vLLM szerint ötször több NVFP4 FLOPS-ot kínál a GB200 NVL72-höz képest.
  • Az AgentX mérésben GPU-nként 7,8-szoros átvitelt értek el a GB200-hoz képest.
  • A platformon DeepSeek, Kimi, GLM és MiniMax modellek is futtathatók.
  • A locality domainek a MiniMax M3 MoE-rétegén átlagosan 1,2-szeres gyorsulást hoztak.

Nagyobb számítási és memóriaátvitel

A vLLM 2026. október 9-i bejelentése szerint az NVIDIA Vera Rubin NVL72 az ügynöki mesterségesintelligencia-feladatokra, köztük az úgynevezett agentic inference munkafolyamatokra készült platform. A vLLM közössége az Inferact, az NVIDIA és a Red Hat mérnökeivel együtt dolgozott a támogatáson azóta, hogy a platformot nyilvánosan bejelentették.

A vLLM által közölt specifikációk szerint a Vera Rubin NVL72 az előző generációs GB200 NVL72-höz képest ötször több NVFP4 következtetési FLOPS-ot, hozzávetőleg 2,4-szer nagyobb HBM-sávszélességet és 1,7-szer nagyobb kétirányú NVLink-sávszélességet kínál. A platform HBM3e helyett HBM4 memóriát használ.

A Rubin a softmax műveletet is gyorsítja, amely a nagy nyelvi modellek figyelmi mechanizmusának egyik alapvető művelete. Az exponential számítási teljesítmény a vLLM szerint FP32 esetén kétszeres, BF16 és FP16 esetén négyszeres a GB200-hoz viszonyítva.

A vLLM már futtat modelleket a Rubinen

A Rubin a Blackwell architektúracsaládra épül, ezért a vLLM Blackwellhez készült kerneljei módosítás nélkül is futtathatók rajta. A fejlesztők szerint ennek köszönhetően a platformon már olyan modellek is használhatók, mint a DeepSeek, a Kimi, a GLM és a MiniMax.

A Rubinhoz készült napi konténerbuild-ek elérhetők a vLLM Docker Hub-oldalán. A felhasználók a vllm/vllm-openai:cu134-nightly képet tölthetik le, amely CUDA 13.4 és PyTorch 2.15 használatával készült. A vLLM szerint a Rubinhoz kapcsolódó buildfolyamat már működik, a támogatás pedig folyamatosan bővül.

A projekt külön Rubinra hangolt figyelmi, GEMM- és MoE-kernelt is integrál a FlashInfer 0.7.0 révén. A MiniMax Sparse Attention, vagyis MSA előzetes feltöltésért felelős kernelét szintén optimalizálták a platformhoz.

A memória helyi használatával gyorsítanák a MoE-modelleket

A vLLM egyik fontos Rubin-specifikus fejlesztése a CUDA 13.4 locality domain funkciójára épül. Ez lehetővé teszi, hogy a számítás és az adat a hozzájuk legközelebbi memóriaterületen maradjon. A megközelítés különösen a memóriasávszélességre érzékeny MoE, vagyis kevert szakértős modellek dekódolását gyorsíthatja.

A fejlesztők a MiniMax M3 MoE-rétegeinek vizsgálatakor a súlyokat két memóriahelyi tartomány között osztották szét. A vLLM szerint kis tokenszámú előrehaladásnál a locality domainek bekapcsolása átlagosan 1,2-szeres gyorsulást hozott. A mérésben alapértelmezett módban 200, visszatöltési módban mind a 212 SM-et használták.

A vLLM korai teljesítménymérései szerint az AgentX tesztben, azonos interaktivitás mellett, a Rubin NVL72 GPU-nként 7,8-szoros átvitelre volt képes a GB200 NVL72-höz képest. Az MLPerfben a VLM-átvitel a GB300 NVL72-höz képest legfeljebb 3,7-szeres volt. A projekt szerint ezek korai eredmények, és a további optimalizálások még javíthatják a teljesítményt.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell
Chipek és infrastruktúra2026. október 2. 16:12

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell

A GPU-k önmagukban már nem bizonyítják, hogy egy AI-infrastruktúra készen áll a termelésre. A CoreWeave és az NVIDIA a számítási kapacitást, a hálózatot, a tárhelyet, az…

Az NVIDIA szerint három tényezőn múlik az AI-gyárak megtérülése
Chipek és infrastruktúra2026. október 1. 15:00

Az NVIDIA szerint három tényezőn múlik az AI-gyárak megtérülése

Az AI-gyárak megtérülését az NVIDIA szerint a megawattonkénti teljesítmény, a hardver hasznos élettartama és a kiszolgálható kereslet együtt határozza meg. A vállalat a…

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt

A Red Hat az MLPerf Inference v6.1 tesztjeiben magas teljesítményt ért el Kubernetes-alapú GPU-s rendszereken, miközben CPU-only konfigurációkon is erős eredményeket…