Az NVIDIA GB300 NVL72-n futtatja az Alibaba 2,4 billió paraméteres Qwen modelljét

Az NVIDIA 2026. augusztus 12-én ismertette, hogyan szolgálható ki az Alibaba nyílt súlyú Qwen3.8-2.4T-A95B modellje NVIDIA GB300 NVL72 rendszeren. A 2,4 billió paraméteres MoE modell legfeljebb egymillió tokenes kontextusablakot és kérésenként állítható következtetési mélységet kínál.
- Az Alibaba kiadta a Qwen3.8-2.4T-A95B nyílt súlyait, 2,4 billió paraméterrel.
- A modell tokenenként 95 milliárd paramétert aktivál, és legfeljebb egymillió tokenes kontextusablakot támogat.
- Az NVIDIA szerint GB300 NVL72-n FP8 pontossággal több mint 4K token/s/GPU érhető el Day 0 állapotban.
- A következtetési mélység kérésenként low, high és xhigh szinteken állítható.
- A modellhez SGLang, vLLM, NVIDIA Dynamo, NVIDIA NIM és NeMo AutoModel útvonalakat nevez meg az NVIDIA.
Nyílt súlyú óriásmodell hosszú kontextusra
Az Alibaba kiadta a Qwen3.8-2.4T-A95B, más néven Qwen3.8-Max nyílt súlyait. Az NVIDIA blogbejegyzése szerint ez az Alibaba legnagyobb nyílt súlyú modellje, amelyet a cég a nyílt ökoszisztémába szánt, near-frontier képességekkel.
A modell összesen 2,4 billió paramétert tartalmaz, tokenenként 95 milliárd aktivált paraméterrel. Finomszemcsés mixture-of-experts, röviden MoE architektúrát használ, teljes figyelmi és lineáris figyelmi rétegek hibridjével. A kontextusablak legfeljebb egymillió token, a kimeneti hossz pedig legfeljebb 128K lehet.
Az NVIDIA szerint a Qwen3.8-2.4T-A95B olyan terhelésekre készült, mint a kódolás, a nagyléptékű dokumentumelemzés és a hosszan futó, több lépésből álló munkafolyamatok. Az ilyen ügynökalapú alkalmazásokban a kontextus folyamatosan bővülhet rendszerutasításokkal, eszközkimenetekkel, visszakeresett dokumentumokkal, kóddal, naplókkal és következtetési nyomokkal.
Állítható következtetés és MoE kiszolgálás
A hosszú kontextus kiszolgálásánál az NVIDIA leírása szerint a figyelmi műveletek, a számítási igény és a KV cache memória válnak szűk keresztmetszetté. A Qwen3.8-2.4T-A95B ezért váltogatja a teljes figyelmi és a lineáris figyelmi rétegeket. A teljes figyelmi rétegekben minden token minden más tokenre figyel, a lineáris figyelmi rétegekben pedig a növekvő KV cache helyét korlátozott méretű, visszatérő állapot veszi át.
A finomszemcsés MoE felépítés célja, hogy a 2,4 billió paraméteres méret kiszolgálhatóbb legyen. A kapacitás sok kisebb szakértő között oszlik meg, és egy tanult útválasztó csak az adott tokenhez szükséges szakértőket aktiválja. Az NVIDIA megfogalmazása szerint így a kiszolgálási költségek az aktív paramétereket követik, nem a teljes 2,4 billió paramétert.
A modell beépített következtetési vezérlőket is kapott. A fejlesztők low, high és xhigh szintek között állíthatják a következtetés mélységét kérésenként, attól függően, hogy bonyolult, több lépéses feladatot vagy nagy áteresztőképességű dokumentumfeldolgozást futtatnak.
Teljesítmény GB300 NVL72 rendszeren
Az NVIDIA szerint egy 2,4 billió paraméteres nyílt súlyú modell telepítéséhez adatközponti léptékű gyorsított számítás szükséges. A vállalat a nyílt forrású ökoszisztémával dolgozik azon, hogy optimalizált kernelekkel, következtetési futtatókörnyezetekkel és elosztott kiszolgálási receptekkel többcsomópontos telepítésekre vigye a modellt.
A GB300 NVL72 rack-szintű architektúra, amely 72 NVIDIA Blackwell Ultra GPU-t integrál egyetlen platformba. A 72 GPU-s NVIDIA NVLink tartomány az NVIDIA közlése szerint 130 TB/s all-to-all kommunikációt tesz lehetővé, ami az expert forgalom hálózati szűk keresztmetszeteit hivatott csökkenteni.
A Qwen3.8-2.4T-A95B az NVIDIA állítása szerint további modellhangolás nélkül, FP8 pontosság mellett, Day 0 állapotban több mint 4K tokent ér el másodpercenként GPU-nként, valamint több mint 350 tokent másodpercenként felhasználónként NVIDIA GB300 NVL72 rendszeren. A vállalat további optimalizációktól, köztük az NVFP4 pontosságtól későbbi teljesítménynövekedést vár.
Mit kapnak a fejlesztők és a szolgáltatók
Az NVIDIA több kiszolgálási útvonalat nevez meg a modellhez. Az SGLang, a vLLM és az NVIDIA Dynamo nyílt forrású következtetési recepteket kínál azoknak a fejlesztőknek, akik részletesebb kontrollt szeretnének a teljesítmény felett NVIDIA gyorsított platformon. A modell emellett telepíthető model-free NVIDIA NIM konténerrel is az NVIDIA NGC kínálatából.
A Qwen3.8-2.4T-A95B súlyai Hugging Face-ről és ModelScope-ról tölthetők le. Az NVIDIA NeMo AutoModel támogatja a modell utótanítását szakterület-specifikus felhasználásokra, közvetlenül Hugging Face checkpointokon, modellkonverzió nélkül. A bejegyzés szerint teljes supervised fine-tuning, vagy memóriahatékony LoRA finomhangolás is használható.
A felhasználói és piaci jelentőség abból következik, hogy egy nagyon nagy, nyílt súlyú modellhez egyszerre jelennek meg hosztolt API-k, letölthető súlyok és produkciós kiszolgálási útvonalak. Az NVIDIA a kipróbáláshoz a DeepInfra, a DigitalOcean, a Fireworks AI, a Modal és az OpenRouter hosztolt API-it sorolja fel, ami többféle belépési pontot ad a fejlesztőknek a helyi futtatástól a szolgáltatott következtetésig.


