Az NVIDIA Vera Rubin NVL72 akár 3,7-szer gyorsabb a GB300-nál

Az NVIDIA Vera Rubin NVL72 rendszerének első MLPerf Inference szereplése jelentős teljesítményelőnyt mutatott a GB300 NVL72-höz képest. A vállalat szerint Qwen3-VL alatt akár 3,7-szer nagyobb áteresztést ért el, miközben a GB300 négy rackből álló konfigurációja 99 százalékos skálázási hatékonyságot mutatott.
- A Vera Rubin NVL72 akár 3,7-szer nagyobb áteresztést ért el Qwen3-VL alatt a GB300 NVL72-höz képest.
- DeepSeek-R1 mérésben az előny legfeljebb 2,5-szeres volt.
- A GB300 NVL72 négy rackkel és 288 GPU-val 99 százalékos skálázási hatékonyságot mutatott.
- A GB300 NVL72 Qwen3-VL alatt akár 1,6-szor javult a v6.0 eredményeihez képest.
- Az NVIDIA 30-szoros előnyt közölt a Vera Rubin javára az AgentX előzetes tesztjeiben.
Erős rajt a Vera Rubin számára
Az NVIDIA szeptember 16-i közleménye szerint a Vera Rubin NVL72 a MLPerf Inference v6.1 tesztcsomagban jelent meg először előzetes eredményekkel. A rendszer a két nagy terhelést jelentő mérésen, a DeepSeek-R1 és a Qwen3-VL teszteken szerepelt.
Qwen3-VL esetében a Vera Rubin NVL72 offline, szerveres és interaktív forgatókönyvekben akár 3,7-szer nagyobb áteresztést ért el, mint a GB300 NVL72. A méréshez a vLLM-et és az NVIDIA Dynamo nyílt forráskódú következtetési keretrendszerét használták. DeepSeek-R1 alatt, az NVIDIA TensorRT-LLM könyvtárával, az előny legfeljebb 2,5-szeres volt.
Az NVIDIA szerint az eredmények azt mutatják, hogy a hardver és a szoftver együttes tervezése javíthatja a következtetés gazdaságosságát. A Vera Rubin továbbfejlesztett Tensor Core egységei és Transformer Engine-je a következtetés előkészítési és dekódolási szakaszát is gyorsítják. Az NVFP4 pontosság csökkenti a modellparaméterek, a figyelmi mechanizmus és a KV-gyorsítótár memóriaigényét.
A rackek közötti skálázás is fontos mérőszám
Az NVIDIA a GB300 NVL72 skálázási képességét is kiemelte. A DeepSeek-R1 offline mérésében egy 72 GPU-t tartalmazó rackről négy rackre, összesen 288 GPU-ra bővítették a rendszert. A skálázási hatékonyság 99 százalékot ért el, miközben az áteresztés közel arányosan nőtt a hardver hozzáadásával.
A vállalat szerint a hatékony skálázáshoz a racken belüli, nagy sávszélességű és alacsony késleltetésű összeköttetéseknek, a rackek közötti hálózatnak és a kérések csomópontok közötti összehangolásának együtt kell működnie. A Vera Rubin NVL72 hatodik generációs NVIDIA NVLink és NVLink Switch technológiára épül. Az NVIDIA állítása szerint ezek a kereskedelmi Ethernethez képest tízszer nagyobb csomagsebességet és háromszor kisebb késleltetést biztosítanak.
A GB300 NVL72 a WAN 2.2 szövegből videót készítő mérésében is rack szintű hatékonyságot mutatott. Négyzetes, 720p felbontású videóból másodpercenként 0,65-öt állított elő, videónként 5,7 másodperces idővel. Ez egyetlen csomóponthoz képest kilencszer nagyobb áteresztést és 7,5-szer kisebb késleltetést jelentett.
A szoftver tovább növelheti a teljesítményt
Az NVIDIA közlése szerint a GB300 NVL72 Qwen3-VL alatt a v6.1-es eredményekben akár 1,6-szor jobb teljesítményt ért el a v6.0-hoz képest. A javuláshoz az alacsonyabb KV-gyorsítótár-pontosság, további kernel-összevonások, jobb kernelek, valamint a vLLM és az NVIDIA Dynamo használatával megvalósított elkülönített kiszolgálás járult hozzá.
A Vera Rubin tesztjeiben az előfeldolgozást és a dekódolást külön kezelték, továbbá nagy léptékű szakértői párhuzamosítást alkalmaztak a DeepSeek-R1 és a Qwen3-VL kevert szakértői rétegeinél. Az NVIDIA szerint a v6.1 leadási határideje után is folytatódtak a szoftveres fejlesztések. A GPT-OSS-120B és a DLRMv3 további eredményeit a vállalat még nem ellenőrzött MLCommons-eredményként jelölte.
Az NVIDIA az AgentX előzetes tesztjeiben a Vera Rubin NVL72 esetében a GB300 NVL72-höz képest 30-szor jobb teljesítményt közölt. A vállalat szerint a közelgő MLPerf Endpoints mérés szabványosíthatja az ügynöki következtetési feladatok értékelését. A MLPerf Inference v6.1 eredményeit az MLCommons oldaláról szeptember 16-án kérdezték le.


