Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az NVIDIA GB300 NVL72-n futtatja az Alibaba 2,4 billió paraméteres Qwen modelljét

2026. augusztus 12. 20:23Forrás: NVIDIA Developer
Az NVIDIA GB300 NVL72-n futtatja az Alibaba 2,4 billió paraméteres Qwen modelljét
Kép: NVIDIA Developer

Az NVIDIA 2026. augusztus 12-én ismertette, hogyan szolgálható ki az Alibaba nyílt súlyú Qwen3.8-2.4T-A95B modellje NVIDIA GB300 NVL72 rendszeren. A 2,4 billió paraméteres MoE modell legfeljebb egymillió tokenes kontextusablakot és kérésenként állítható következtetési mélységet kínál.

A lényeg röviden
  • Az Alibaba kiadta a Qwen3.8-2.4T-A95B nyílt súlyait, 2,4 billió paraméterrel.
  • A modell tokenenként 95 milliárd paramétert aktivál, és legfeljebb egymillió tokenes kontextusablakot támogat.
  • Az NVIDIA szerint GB300 NVL72-n FP8 pontossággal több mint 4K token/s/GPU érhető el Day 0 állapotban.
  • A következtetési mélység kérésenként low, high és xhigh szinteken állítható.
  • A modellhez SGLang, vLLM, NVIDIA Dynamo, NVIDIA NIM és NeMo AutoModel útvonalakat nevez meg az NVIDIA.

Nyílt súlyú óriásmodell hosszú kontextusra

Az Alibaba kiadta a Qwen3.8-2.4T-A95B, más néven Qwen3.8-Max nyílt súlyait. Az NVIDIA blogbejegyzése szerint ez az Alibaba legnagyobb nyílt súlyú modellje, amelyet a cég a nyílt ökoszisztémába szánt, near-frontier képességekkel.

A modell összesen 2,4 billió paramétert tartalmaz, tokenenként 95 milliárd aktivált paraméterrel. Finomszemcsés mixture-of-experts, röviden MoE architektúrát használ, teljes figyelmi és lineáris figyelmi rétegek hibridjével. A kontextusablak legfeljebb egymillió token, a kimeneti hossz pedig legfeljebb 128K lehet.

Az NVIDIA szerint a Qwen3.8-2.4T-A95B olyan terhelésekre készült, mint a kódolás, a nagyléptékű dokumentumelemzés és a hosszan futó, több lépésből álló munkafolyamatok. Az ilyen ügynökalapú alkalmazásokban a kontextus folyamatosan bővülhet rendszerutasításokkal, eszközkimenetekkel, visszakeresett dokumentumokkal, kóddal, naplókkal és következtetési nyomokkal.

Állítható következtetés és MoE kiszolgálás

A hosszú kontextus kiszolgálásánál az NVIDIA leírása szerint a figyelmi műveletek, a számítási igény és a KV cache memória válnak szűk keresztmetszetté. A Qwen3.8-2.4T-A95B ezért váltogatja a teljes figyelmi és a lineáris figyelmi rétegeket. A teljes figyelmi rétegekben minden token minden más tokenre figyel, a lineáris figyelmi rétegekben pedig a növekvő KV cache helyét korlátozott méretű, visszatérő állapot veszi át.

A finomszemcsés MoE felépítés célja, hogy a 2,4 billió paraméteres méret kiszolgálhatóbb legyen. A kapacitás sok kisebb szakértő között oszlik meg, és egy tanult útválasztó csak az adott tokenhez szükséges szakértőket aktiválja. Az NVIDIA megfogalmazása szerint így a kiszolgálási költségek az aktív paramétereket követik, nem a teljes 2,4 billió paramétert.

A modell beépített következtetési vezérlőket is kapott. A fejlesztők low, high és xhigh szintek között állíthatják a következtetés mélységét kérésenként, attól függően, hogy bonyolult, több lépéses feladatot vagy nagy áteresztőképességű dokumentumfeldolgozást futtatnak.

Teljesítmény GB300 NVL72 rendszeren

Az NVIDIA szerint egy 2,4 billió paraméteres nyílt súlyú modell telepítéséhez adatközponti léptékű gyorsított számítás szükséges. A vállalat a nyílt forrású ökoszisztémával dolgozik azon, hogy optimalizált kernelekkel, következtetési futtatókörnyezetekkel és elosztott kiszolgálási receptekkel többcsomópontos telepítésekre vigye a modellt.

A GB300 NVL72 rack-szintű architektúra, amely 72 NVIDIA Blackwell Ultra GPU-t integrál egyetlen platformba. A 72 GPU-s NVIDIA NVLink tartomány az NVIDIA közlése szerint 130 TB/s all-to-all kommunikációt tesz lehetővé, ami az expert forgalom hálózati szűk keresztmetszeteit hivatott csökkenteni.

A Qwen3.8-2.4T-A95B az NVIDIA állítása szerint további modellhangolás nélkül, FP8 pontosság mellett, Day 0 állapotban több mint 4K tokent ér el másodpercenként GPU-nként, valamint több mint 350 tokent másodpercenként felhasználónként NVIDIA GB300 NVL72 rendszeren. A vállalat további optimalizációktól, köztük az NVFP4 pontosságtól későbbi teljesítménynövekedést vár.

Mit kapnak a fejlesztők és a szolgáltatók

Az NVIDIA több kiszolgálási útvonalat nevez meg a modellhez. Az SGLang, a vLLM és az NVIDIA Dynamo nyílt forrású következtetési recepteket kínál azoknak a fejlesztőknek, akik részletesebb kontrollt szeretnének a teljesítmény felett NVIDIA gyorsított platformon. A modell emellett telepíthető model-free NVIDIA NIM konténerrel is az NVIDIA NGC kínálatából.

A Qwen3.8-2.4T-A95B súlyai Hugging Face-ről és ModelScope-ról tölthetők le. Az NVIDIA NeMo AutoModel támogatja a modell utótanítását szakterület-specifikus felhasználásokra, közvetlenül Hugging Face checkpointokon, modellkonverzió nélkül. A bejegyzés szerint teljes supervised fine-tuning, vagy memóriahatékony LoRA finomhangolás is használható.

A felhasználói és piaci jelentőség abból következik, hogy egy nagyon nagy, nyílt súlyú modellhez egyszerre jelennek meg hosztolt API-k, letölthető súlyok és produkciós kiszolgálási útvonalak. Az NVIDIA a kipróbáláshoz a DeepInfra, a DigitalOcean, a Fireworks AI, a Modal és az OpenRouter hosztolt API-it sorolja fel, ami többféle belépési pontot ad a fejlesztőknek a helyi futtatástól a szolgáltatott következtetésig.

Kapcsolódó hírek

64 GB memóriával jön az NVIDIA DGX Spark új változata
Chipek és infrastruktúra2026. október 2. 15:00

64 GB memóriával jön az NVIDIA DGX Spark új változata

Az NVIDIA 2026. október 2-án bejelentette a DGX Spark 64 GB-os, egyesített memóriával szerelt konfigurációját. A rendszer október 23-án érkezik az Acer, ASUS, Dell…

Az Ai2 megnyitotta az Olmo-core 3 MoE-képzési rendszerét
Fejlesztőknek2026. október 1. 10:00

Az Ai2 megnyitotta az Olmo-core 3 MoE-képzési rendszerét

Az Ai2 kiadta az Olmo-core 3-at, a nagy kevert szakértői modellek, vagyis MoE-k képzésére fejlesztett nyílt infrastruktúrát. A rendszerrel 1,2 billió paraméteres modellt…

Az Ai2 megnyitotta az Olmo-core 3 MoE-tréningrendszerét
Fejlesztőknek2026. október 1. 10:00

Az Ai2 megnyitotta az Olmo-core 3 MoE-tréningrendszerét

Az Ai2 bemutatta az Olmo-core 3-at, egy nyílt tréninginfrastruktúrát, amelyet nagy, szakértőkeverékes, vagyis MoE-modellek fejlesztésére terveztek. A rendszerrel a…