Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A vLLM már az első napon támogatja a 2,4 billió paraméteres Qwen3.8-at

2026. augusztus 12.Forrás: vLLM
A vLLM már az első napon támogatja a 2,4 billió paraméteres Qwen3.8-at
Kép: vLLM

A vLLM már a megjelenés napjától futtatja a Qwen3.8-2.4T-A95B modellt, amely a Qwen család első nyílt súlyú, Qwen-Max kategóriájú modellje. A 2,4 billió paraméteres, ritka Mixture of Experts modellhez hivatalos FP8 és BF16, valamint Inferact által készített MXFP4 és NVFP4 súlyok is elérhetők.

A lényeg röviden
  • A vLLM már a megjelenés napjától támogatja a Qwen3.8-2.4T-A95B modellt.
  • A modell 2,4 billió paramétert és 512 szakértőt tartalmaz.
  • FP8, BF16, NVFP4 és MXFP4 súlyok is elérhetők.
  • A teljes modell futtatásához legalább két NVIDIA B300 vagy AMD MI355X csomópont kell.
  • Az FP4-változat egyetlen csomóponton is futtatható.

A Qwen3.8 már módosítás nélkül fut a vLLM-ben

A vLLM augusztus 12-én jelentette be a Qwen3.8-2.4T-A95B Day 0 támogatását. A modell a Qwen 3.5 architektúrájára épül, ezért a vLLM szerint azonnal futtatható, és ehhez nem volt szükség architekturális változtatásokra a kiszolgálórendszerben.

A Qwen3.8-2.4T-A95B egy ritka Mixture of Experts, vagyis szakértői keverék modell, összesen 512 szakértővel. A hálózat 92 rétegből álló, hibrid felépítést használ: minden negyedik rétegben teljes figyelmi mechanizmus működik, a fennmaradó 69 réteg pedig lineáris figyelmet alkalmaz.

A vLLM szerint a modell a jelenleg kiadott egyik legnagyobb nyílt súlyú modell. A teljesítményéhez legalább két NVIDIA B300 vagy AMD MI355X csomópont szükséges. Az FP4-re kvantált változat egyetlen csomóponton is futtatható.

Négyféle pontosság és kisebb memóriaigény

A Qwen3.8-hoz FP8 és BF16 ellenőrzőpontok érhetők el, az Inferact pedig MXFP4 és NVFP4 kvantált súlyokat is kiadott. A vLLM közlése szerint ezek a változatok a teljes pontosságú modellek minőségét célozzák, miközben jelentősen csökkentik a memória- és sávszélességigényt.

Az Inferact egyes rétegeket, köztük az útválasztott szakértőket, FP4 súlyokra kvantált. Ehhez Round-to-Nearest, vagyis RTN módszert használt aktivációs kalibrációval, amely 4 bites aktivációkat tesz lehetővé. A vLLM kezdeti ellenőrzései szerint a kvantálás után megmaradt a modell pontossága, ugyanakkor az értékelések reprodukálásához nagyobb következtetési keretre van szükség.

A közzétett eredményekben az FP8 változat a GSM8K feladaton 89,61 százalékos szigorú, illetve 90,52 százalékos rugalmas eredményt ért el. Az NVFP4 változatnál ezek az értékek 90,37, illetve 91,05 százalék voltak. Az AIME25 három próbálkozásra számított átlagos eredménye FP8 esetén 87,78, a pass érték 93,33 százalék lett, NVFP4-nél pedig 92,22 és 96,67 százalék.

NVIDIA és AMD hardverén is optimalizálták

A vLLM a Qwen 3.5 korábbi támogatására építve az NVIDIA és az AMD csapataival közösen dolgozott a 2,4 billió paraméteres modell hatékony futtatásán. NVIDIA platformokon a partnerek optimalizált kerneleket készítettek többek között a lineáris figyelemhez, a GQA figyelmi mechanizmushoz, a sűrű GEMM műveletekhez és a MoE-útválasztáshoz. Új összevont kernelek bevezetésével a kommunikációs többletet is csökkentették.

A teljesítmény javításához az adatpárhuzamosságot és a tenzorpárhuzamosságot is kombinálták a figyelmi rétegeknél, míg a szakértői keverékhez szakértőpárhuzamosságot használtak. AMD Instinct GPU-kon az AITER-féle összevont Gated DeltaNet dekódolás, figyelmi és MoE-kernelek csökkentik a kernelindításból és az adatmozgatásból eredő többletet. Az MXFP4 telepítését az AMD Quark kvantálási támogatása segíti.

A felhasználóknak nagy teljesítményű hardverre lesz szükségük

A vLLM receptjei NVFP4 és MXFP4 változathoz is tartalmaznak indítási példát, mindkettőnél nyolcas tenzorpárhuzamossági beállítással. A konfiguráció támogatja az automatikus eszközválasztást, a Qwen3 kódhívási és következtetési elemzőt, valamint három spekulatív tokent.

A modellkártya ajánlása szerint a generálásnál 1,0-s hőmérsékletet, 0,95-ös top_p és 20-as top_k értéket érdemes használni. Mivel a Qwen3.8 következtetési modell, a vLLM elegendő tokenkeret kiosztását javasolja ügynöki munkafolyamatokhoz. A példakódban a max_tokens értéke 128 000.

A bejelentés alapján a Qwen3.8 azonnali vLLM-támogatása többféle hardver- és pontossági konfigurációt tesz elérhetővé, de a teljes modell futtatása jelentős infrastruktúrát igényel. Az FP4-változat egyetlen csomópontos futtatása csökkenti a memóriaigényt, miközben a vLLM által közölt ellenőrzések szerint a kvantált modell eredményei közel maradnak az FP8 változatéhoz.

Kapcsolódó hírek

Az Ai2 megnyitotta az Olmo-core 3 MoE-képzési rendszerét
Fejlesztőknek2026. október 1. 10:00

Az Ai2 megnyitotta az Olmo-core 3 MoE-képzési rendszerét

Az Ai2 kiadta az Olmo-core 3-at, a nagy kevert szakértői modellek, vagyis MoE-k képzésére fejlesztett nyílt infrastruktúrát. A rendszerrel 1,2 billió paraméteres modellt…

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt

A Red Hat az MLPerf Inference v6.1 tesztjeiben magas teljesítményt ért el Kubernetes-alapú GPU-s rendszereken, miközben CPU-only konfigurációkon is erős eredményeket…

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben

A Red Hat közzétette az MLPerf Inference v6.1 benchmarkban elért eredményeit. A vállalat szerint az OpenShift és a vLLM Kubernetes-alapú környezetben is versenyképes…