Qwen3.8-Flash-Next: Alibaba új modellje NVIDIA GB300 NVL72 rendszeren fut

Az NVIDIA Developer 2026. augusztus 26-án közölt technikai bejegyzést a Qwen3.8-Flash-Next modellről és annak NVIDIA GB300 NVL72 rendszeren futtatásáról. Az Alibaba által kiadott modell egy multimodális mixture-of-experts rendszer, amelyet nagy kontextusú, agentic coding jellegű feladatokra szánnak.
- Az Alibaba kiadta a Qwen3.8-Flash-Next modell súlyait a Qwen4 architektúra előzeteseként.
- A modell 125 milliárd paraméteres fő rendszerrel, 51 milliárd N-gram beágyazással és 262 144 tokenes natív kontextusablakkal rendelkezik.
- A QSA az Alibaba benchmarkjai szerint 1 millió tokenes terhelésnél legfeljebb 7,6-szoros prefill és 4,9-szeres dekódolási gyorsulást hozott a teljes figyelemhez képest.
- NVIDIA GB300 NVL72 rendszeren a modell GPU-nként több mint 16 ezer tokent másodpercenként és felhasználónként több mint 200 tokent másodpercenként ér el az NVIDIA szerint.
- A fejlesztők QwenCloudon próbálhatják ki, Hugging Face-ről vagy ModelScope-ról tölthetik le, és NeMo eszközökkel finomhangolhatják.
Előzetes a Qwen4 architektúra előtt
Az Alibaba a Qwen3.8-Flash-Next modell súlyait az NVIDIA bejegyzése szerint az érkező Qwen4 architektúra előzeteseként tette elérhetővé, hogy a fejlesztők kísérletezhessenek vele és értékelhessék. A modell multimodális mixture-of-experts, vagyis MoE felépítésű, 125 milliárd paraméteres fő modellel és további 51 milliárd N-gram beágyazással. Tokenenként 6 milliárd paraméter aktiválódik.
A modell natív kontextusablaka 262 144 token, amely YaRN használatával 1 millió tokenig bővíthető. Az NVIDIA szerint a Qwen3.8-Flash-Next nagy volumenű, kontextusigényes alkalmazásokhoz készült, például agentic coding, dokumentumfeldolgozási és eszközvezérelt munkafolyamatokhoz.
Az NVIDIA Day 0 jellegű, best-effort funkcionális támogatást ad SGLang, vLLM és NVIDIA TensorRT LLM környezetben, validációt végez NVIDIA GB300 NVL72 platformon következtetéshez, valamint utótanítási recepteket kínál NVIDIA NeMo AutoModel és NVIDIA NeMo RL eszközökkel.
Hibrid architektúra a hosszú kontextus kezelésére
A bejegyzés szerint a hosszabb kontextusoknál a figyelmi számítás és a KV cache memóriahasználata válhat szűk keresztmetszetté. A Qwen3.8-Flash-Next ezt egy hibrid architektúrával kezeli, amely Gated DeltaNet, röviden GDN, és Qwen Sparse Attention, röviden QSA rétegeket kombinál.
Minden négy rétegből három GDN-t használ, amely a korábbi kontextust folyamatosan egy fix méretű visszatérő állapotba tömöríti. Ez az NVIDIA leírása szerint megszünteti a KV cache növekedését a szekvencia hosszának növekedésével. A fennmaradó réteg QSA-t használ, amely a teljes kontextuson belüli pontos visszakeresést szolgálja.
A QSA nem tokenszintű indexelőkre támaszkodik, hanem a szekvenciát mikroblokkokba rendezi, blokkszinten becsüli meg azok fontosságát, és csak a legrelevánsabb régiókat választja ki. Az Alibaba közzétett benchmarkjai alapján a QSA javíthatja az 1 millió tokenes munkaterhelések hatékonyságát. A teljes figyelemhez képest az attention kernel legfeljebb 7,6-szoros gyorsulást ért el prefill közben és 4,9-szerest dekódolás közben. Egy cache-intenzív online kiszolgálási tesztben, 1 millió tokenes kontextushossznál és 90 százalékos prefix-cache találati aránynál, a Qwen3.8-Flash-Next a Qwen3.7-Plus prefill áteresztőképességének 8,6-szorosát érte el.
GB300 NVL72: nagy sávszélesség a MoE kiszolgáláshoz
Az NVIDIA GB300 NVL72 rack-szintű architektúrát használ, amely 72 NVIDIA Blackwell Ultra GPU-t integrál egyetlen platformba. A rendszer 72 GPU-s NVIDIA NVLink tartománya 130 TB/s all-to-all kommunikációt tesz lehetővé. Az NVIDIA szerint ez eltávolítja azokat a szűk keresztmetszeteket, amelyek akkor jelenhetnek meg, amikor az expert forgalom hagyományos, kereskedelmi hálózatokon halad át.
A Qwen3.8-Flash-Next a GB300 NVL72 rendszeren GPU-nként több mint 16 ezer tokent másodpercenként, felhasználónként pedig több mint 200 tokent másodpercenként teljesít az NVIDIA közlése szerint. A vállalat ezt nagy áteresztőképességű és alacsony késleltetésű agentic coding alkalmazások kísérletezéséhez kapcsolja.
A modell nem csak rack-szintű telepítésen fut. Az NVIDIA felsorolása szerint helyi NVIDIA hardveren is használható, ideértve az NVIDIA DGX Stationt, az NVIDIA DGX Spark klasztereket, valamint a négy NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition GPU-val szerelt munkaállomásokat. A fejlesztők így helyi hardveren prototipizálhatnak és értékelhetnek agentic coding munkafolyamatokat, majd ugyanazt a modellt GB300 NVL72-re skálázhatják éles kiszolgáláshoz.
Finomhangolás és következtetés több eszközzel
A fejlesztők a modellt NVIDIA NeMo AutoModel használatával finomhangolhatják domain-specifikus felhasználási esetekre. Ez egy PyTorch-natív finomhangoló könyvtár, amely Day-0 Hugging Face checkpoint támogatást kínál. A bejegyzés szerint meglévő checkpointokon közvetlenül lehet tanítani modellkonverzió nélkül, teljes SFT vagy memóriahatékony LoRA finomhangolással.
A forrás szerint a felhasználók NVIDIA NeMo RL receptekkel megerősítéses tanulást is végezhetnek. Következtetéshez az NVIDIA több stacket támogat: az SGLang, a vLLM és a TokenSpeed nyílt forrású inference recepteket ad azoknak a fejlesztőknek, akik nagyobb kontrollt szeretnének a teljesítmény felett NVIDIA-gyorsított platformon.
Az induláshoz a modell közvetlenül kipróbálható QwenCloudon. A modell súlyai Hugging Face-ről vagy ModelScope-ról tölthetők le, a telepítéshez pedig az NVIDIA NGC-n elérhető model-free NVIDIA NIM is használható.
Mit jelent ez a fejlesztőknek
A bejelentés gyakorlati jelentősége abban áll, hogy a Qwen3.8-Flash-Next egyszerre célozza a hosszú kontextusú feldolgozást, az MoE-alapú hatékonyságot és a többféle telepítési módot. A forrás alapján a fejlesztők felhőben kipróbálhatják a modellt, letölthetik a súlyokat helyi fejlesztéshez, finomhangolhatják NeMo eszközökkel, majd NVIDIA-gyorsított infrastruktúrán szolgálhatják ki.
Az NVIDIA által kiemelt agentic coding felhasználásnál a nagy kontextusablak és az alacsony késleltetés azért fontos, mert a modellnek hosszabb kódbázisokkal, dokumentumokkal és eszközhasználattal kell dolgoznia. A közölt adatok alapján a GB300 NVL72 célja, hogy ezt nagy áteresztőképességgel támogassa, miközben a modell helyi hardveren is kipróbálható fejlesztési és értékelési célokra.
NVIDIA Developer: Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding


