Day 0 támogatást kapott a Nemotron 3.5 Lightning a vLLM-ben

A vLLM bejelentette az NVIDIA Nemotron 3.5 Lightning modell Day 0 támogatását. A 30 milliárd paraméteres, hibrid MoE modell helyi asszisztensekhez és nagy volumenű ügynökalapú feladatokhoz is használható.
- A vLLM Day 0 támogatást adott az NVIDIA Nemotron 3.5 Lightning modellhez.
- A modell 30 milliárd paraméteres, ebből egyszerre 3 milliárd aktív.
- Legfeljebb 1 millió tokenes kontextust és három spekulatív dekódolási módszert támogat.
- BF16 és NVFP4 formátumban, több NVIDIA platformon is elérhető.
- A vLLM szerint hasonló méretű nyílt modellekhez képest akár négyszeres áteresztőképességet kínálhat.
Kompakt modell, nagy kontextusablak
A vLLM 2026. augusztus 10-i bejelentése szerint a Nemotron 3.5 Lightning az NVIDIA testreszabható, nyílt modellje. A rendszert folyamatosan futó ügynökökhöz tervezték, a helyben működő személyi asszisztensektől az adatközponti és felhős, nagy mennyiségű ügynökalapú feladatokig.
A modell hibrid kevert szakértői, vagyis mixture of experts architektúrát használ. Összesen 30 milliárd paramétert tartalmaz, egy időben azonban csak 3 milliárd aktív paraméterrel dolgozik. A vLLM szerint a Nemotron 3.5 Lightning kódolásban, eszközhasználatban, utasításkövetésben és többfordulós feladatokban teljesít jól. A modell az NVIDIA Nemotron 3 Ultra desztillációjával készült, fejlesztésében pedig a Nemotron Coalition is részt vett.
A rendszer legfeljebb 1 millió tokenes kontextushosszt támogat, bemenetként és kimenetként szöveget kezel. A gondolkodási mód kérésenként be- és kikapcsolható, valamint konfigurálható a gondolkodási tokenek kerete. A modellt a vLLM közleménye szerint népszerű ügynöki keretrendszerekhez is betanították, és utólagos tanítással specializált munkafolyamatokra szabható.
Gyorsabb kis lépések ügynökrendszerekben
A modern ügynökplatformok gyakran több modell között osztják fel a feladatokat. Egy nagyobb modell végezheti a nehéz tervezést és koordinációt, míg egy kisebb rendszer a gyakori, jól körülhatárolt részfeladatokat kezeli. A vLLM szerint a Nemotron 3.5 Lightning ezt a második szerepet célozza, miközben támogatja a valós ügynöki munkafolyamatokhoz szükséges képességeket.
A hibrid MoE felépítés tokenenként a 30 milliárd paraméterből 3 milliárdot aktivál. Ezt többtokenes előrejelzéssel egészíti ki, amely a vLLM állítása szerint csökkenti a számítási igényt és gyorsítja a generálást. A közlemény alapján ezek az optimalizációk a hasonló méretű nyílt modellekhez képest akár négyszer nagyobb áteresztőképességet biztosíthatnak.
A vLLM három spekulatív dekódolási technikát támogat a modellhez: a Multi Token Predictiont, a DFlash rendszert és a DSparkot. Az MTP modellbe épített előrejelző fejekkel javasol jövőbeli tokeneket, a DFlash egy diffúzióalapú segédmodellel párhuzamosan állít elő tokenblokkokat, a DSpark pedig az autoregresszív és a diffúzióalapú megközelítést kombinálja. A vLLM szerint a megfelelő módszer a késleltetés, az áteresztőképesség és a telepítési környezet közötti kompromisszum alapján választható ki.
OpenAI-kompatibilis API és széles NVIDIA-támogatás
A vLLM szolgáltatási rétege folyamatos kötegelt feldolgozást, prefixgyorsítótárat, spekulatív dekódolást és OpenAI-kompatibilis API-t biztosít. Ennek segítségével a fejlesztők a modellt meglévő ügynöki keretrendszerekhez, helyi alkalmazásokhoz és vállalati automatizációs rendszerekhez kapcsolhatják.
A modell BF16 és NVFP4 formátumban érhető el az induláskor. A BF16 ellenőrzőpont egyszerű kiindulási lehetőséget kínál, míg az NVFP4 az alacsonyabb pontosságú következtetést támogató környezetekhez készült. A modell a közlemény szerint NVIDIA DGX Spark, DGX Station, RTX PRO, RTX, NVIDIA Jetson, H100, H200, A100, L40S, B200 és GB200, valamint B300 és GB300 platformokon telepíthető.
A vLLM fejlesztői több módosítást is beépítettek a támogatásba. Integrálták a DSparkot, W4A16 formátumra kvantálták a segédmodell előrejelző fejét, és bekapcsolták az aszinkron ütemezést. A közlemény szerint a Hopperre optimalizált Humming háttér a Nemotron nem kapuzott ReLU 2 MoE rétegénél nagyjából 20 százalékos áteresztőképesség-növekedést hozhat. A fejlesztők a Mamba2 állapottér-rétegekhez a ReplaySSM integrációját is elkészítették.
Mit jelent ez a felhasználóknak?
A Nemotron 3.5 Lightning a vLLM támogatásával közvetlenül olyan környezetekbe illeszthető, ahol sok rövid ügynöki lépést kell kiszolgálni. A post-training lehetősége miatt a modell szervezetspecifikus kifejezésekhez, szabályokhoz, eszközökhöz és munkafolyamatokhoz igazítható, a vLLM által felsorolt felhasználási területek között pedig szerepel a pénzügyi és kockázati automatizáció, a kiberbiztonsági vizsgálat, a távközlési üzemeltetés, a kiskereskedelmi élmények és a helyi személyi asszisztens.
A modell súlyai a vLLM bejegyzése szerint Hugging Face-ről tölthetők le, a futtatáshoz pedig külön kezdő útmutató és nagy áteresztőképességű következtetési példa áll rendelkezésre. Alacsony késleltetésű kiszolgáláshoz a vLLM a DSpark használatát javasolja H100, H200 és DGX Spark rendszereken. A legnagyobb aktuális áteresztőképességhez ugyanakkor a közlemény szerint a spekulatív dekódolás nélküli futtatás ajánlott.


