A vLLM szerint 7,8-szoros gyorsulást hoz a Vera Rubin NVL72

A vLLM már támogatja az NVIDIA Vera Rubin NVL72 platformot, amelyen a fejlesztők korai eredményei szerint GPU-nként akár 7,8-szoros átviteli teljesítmény érhető el a GB200 NVL72-höz képest. A rendszerhez napi konténerbuild és több modell támogatása is elérhető.
- A vLLM már támogatja az NVIDIA Vera Rubin NVL72 platformot.
- A Rubin NVL72 a vLLM szerint ötször több NVFP4 FLOPS-ot kínál a GB200 NVL72-höz képest.
- Az AgentX mérésben GPU-nként 7,8-szoros átvitelt értek el a GB200-hoz képest.
- A platformon DeepSeek, Kimi, GLM és MiniMax modellek is futtathatók.
- A locality domainek a MiniMax M3 MoE-rétegén átlagosan 1,2-szeres gyorsulást hoztak.
Nagyobb számítási és memóriaátvitel
A vLLM 2026. október 9-i bejelentése szerint az NVIDIA Vera Rubin NVL72 az ügynöki mesterségesintelligencia-feladatokra, köztük az úgynevezett agentic inference munkafolyamatokra készült platform. A vLLM közössége az Inferact, az NVIDIA és a Red Hat mérnökeivel együtt dolgozott a támogatáson azóta, hogy a platformot nyilvánosan bejelentették.
A vLLM által közölt specifikációk szerint a Vera Rubin NVL72 az előző generációs GB200 NVL72-höz képest ötször több NVFP4 következtetési FLOPS-ot, hozzávetőleg 2,4-szer nagyobb HBM-sávszélességet és 1,7-szer nagyobb kétirányú NVLink-sávszélességet kínál. A platform HBM3e helyett HBM4 memóriát használ.
A Rubin a softmax műveletet is gyorsítja, amely a nagy nyelvi modellek figyelmi mechanizmusának egyik alapvető művelete. Az exponential számítási teljesítmény a vLLM szerint FP32 esetén kétszeres, BF16 és FP16 esetén négyszeres a GB200-hoz viszonyítva.
A vLLM már futtat modelleket a Rubinen
A Rubin a Blackwell architektúracsaládra épül, ezért a vLLM Blackwellhez készült kerneljei módosítás nélkül is futtathatók rajta. A fejlesztők szerint ennek köszönhetően a platformon már olyan modellek is használhatók, mint a DeepSeek, a Kimi, a GLM és a MiniMax.
A Rubinhoz készült napi konténerbuild-ek elérhetők a vLLM Docker Hub-oldalán. A felhasználók a vllm/vllm-openai:cu134-nightly képet tölthetik le, amely CUDA 13.4 és PyTorch 2.15 használatával készült. A vLLM szerint a Rubinhoz kapcsolódó buildfolyamat már működik, a támogatás pedig folyamatosan bővül.
A projekt külön Rubinra hangolt figyelmi, GEMM- és MoE-kernelt is integrál a FlashInfer 0.7.0 révén. A MiniMax Sparse Attention, vagyis MSA előzetes feltöltésért felelős kernelét szintén optimalizálták a platformhoz.
A memória helyi használatával gyorsítanák a MoE-modelleket
A vLLM egyik fontos Rubin-specifikus fejlesztése a CUDA 13.4 locality domain funkciójára épül. Ez lehetővé teszi, hogy a számítás és az adat a hozzájuk legközelebbi memóriaterületen maradjon. A megközelítés különösen a memóriasávszélességre érzékeny MoE, vagyis kevert szakértős modellek dekódolását gyorsíthatja.
A fejlesztők a MiniMax M3 MoE-rétegeinek vizsgálatakor a súlyokat két memóriahelyi tartomány között osztották szét. A vLLM szerint kis tokenszámú előrehaladásnál a locality domainek bekapcsolása átlagosan 1,2-szeres gyorsulást hozott. A mérésben alapértelmezett módban 200, visszatöltési módban mind a 212 SM-et használták.
A vLLM korai teljesítménymérései szerint az AgentX tesztben, azonos interaktivitás mellett, a Rubin NVL72 GPU-nként 7,8-szoros átvitelre volt képes a GB200 NVL72-höz képest. Az MLPerfben a VLM-átvitel a GB300 NVL72-höz képest legfeljebb 3,7-szeres volt. A projekt szerint ezek korai eredmények, és a további optimalizálások még javíthatják a teljesítményt.


