Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Day 0 támogatást kapott a Nemotron 3.5 Lightning a vLLM-ben

2026. augusztus 10.Forrás: vLLM
Day 0 támogatást kapott a Nemotron 3.5 Lightning a vLLM-ben
Kép: vLLM

A vLLM bejelentette az NVIDIA Nemotron 3.5 Lightning modell Day 0 támogatását. A 30 milliárd paraméteres, hibrid MoE modell helyi asszisztensekhez és nagy volumenű ügynökalapú feladatokhoz is használható.

A lényeg röviden
  • A vLLM Day 0 támogatást adott az NVIDIA Nemotron 3.5 Lightning modellhez.
  • A modell 30 milliárd paraméteres, ebből egyszerre 3 milliárd aktív.
  • Legfeljebb 1 millió tokenes kontextust és három spekulatív dekódolási módszert támogat.
  • BF16 és NVFP4 formátumban, több NVIDIA platformon is elérhető.
  • A vLLM szerint hasonló méretű nyílt modellekhez képest akár négyszeres áteresztőképességet kínálhat.

Kompakt modell, nagy kontextusablak

A vLLM 2026. augusztus 10-i bejelentése szerint a Nemotron 3.5 Lightning az NVIDIA testreszabható, nyílt modellje. A rendszert folyamatosan futó ügynökökhöz tervezték, a helyben működő személyi asszisztensektől az adatközponti és felhős, nagy mennyiségű ügynökalapú feladatokig.

A modell hibrid kevert szakértői, vagyis mixture of experts architektúrát használ. Összesen 30 milliárd paramétert tartalmaz, egy időben azonban csak 3 milliárd aktív paraméterrel dolgozik. A vLLM szerint a Nemotron 3.5 Lightning kódolásban, eszközhasználatban, utasításkövetésben és többfordulós feladatokban teljesít jól. A modell az NVIDIA Nemotron 3 Ultra desztillációjával készült, fejlesztésében pedig a Nemotron Coalition is részt vett.

A rendszer legfeljebb 1 millió tokenes kontextushosszt támogat, bemenetként és kimenetként szöveget kezel. A gondolkodási mód kérésenként be- és kikapcsolható, valamint konfigurálható a gondolkodási tokenek kerete. A modellt a vLLM közleménye szerint népszerű ügynöki keretrendszerekhez is betanították, és utólagos tanítással specializált munkafolyamatokra szabható.

Gyorsabb kis lépések ügynökrendszerekben

A modern ügynökplatformok gyakran több modell között osztják fel a feladatokat. Egy nagyobb modell végezheti a nehéz tervezést és koordinációt, míg egy kisebb rendszer a gyakori, jól körülhatárolt részfeladatokat kezeli. A vLLM szerint a Nemotron 3.5 Lightning ezt a második szerepet célozza, miközben támogatja a valós ügynöki munkafolyamatokhoz szükséges képességeket.

A hibrid MoE felépítés tokenenként a 30 milliárd paraméterből 3 milliárdot aktivál. Ezt többtokenes előrejelzéssel egészíti ki, amely a vLLM állítása szerint csökkenti a számítási igényt és gyorsítja a generálást. A közlemény alapján ezek az optimalizációk a hasonló méretű nyílt modellekhez képest akár négyszer nagyobb áteresztőképességet biztosíthatnak.

A vLLM három spekulatív dekódolási technikát támogat a modellhez: a Multi Token Predictiont, a DFlash rendszert és a DSparkot. Az MTP modellbe épített előrejelző fejekkel javasol jövőbeli tokeneket, a DFlash egy diffúzióalapú segédmodellel párhuzamosan állít elő tokenblokkokat, a DSpark pedig az autoregresszív és a diffúzióalapú megközelítést kombinálja. A vLLM szerint a megfelelő módszer a késleltetés, az áteresztőképesség és a telepítési környezet közötti kompromisszum alapján választható ki.

OpenAI-kompatibilis API és széles NVIDIA-támogatás

A vLLM szolgáltatási rétege folyamatos kötegelt feldolgozást, prefixgyorsítótárat, spekulatív dekódolást és OpenAI-kompatibilis API-t biztosít. Ennek segítségével a fejlesztők a modellt meglévő ügynöki keretrendszerekhez, helyi alkalmazásokhoz és vállalati automatizációs rendszerekhez kapcsolhatják.

A modell BF16 és NVFP4 formátumban érhető el az induláskor. A BF16 ellenőrzőpont egyszerű kiindulási lehetőséget kínál, míg az NVFP4 az alacsonyabb pontosságú következtetést támogató környezetekhez készült. A modell a közlemény szerint NVIDIA DGX Spark, DGX Station, RTX PRO, RTX, NVIDIA Jetson, H100, H200, A100, L40S, B200 és GB200, valamint B300 és GB300 platformokon telepíthető.

A vLLM fejlesztői több módosítást is beépítettek a támogatásba. Integrálták a DSparkot, W4A16 formátumra kvantálták a segédmodell előrejelző fejét, és bekapcsolták az aszinkron ütemezést. A közlemény szerint a Hopperre optimalizált Humming háttér a Nemotron nem kapuzott ReLU 2 MoE rétegénél nagyjából 20 százalékos áteresztőképesség-növekedést hozhat. A fejlesztők a Mamba2 állapottér-rétegekhez a ReplaySSM integrációját is elkészítették.

Mit jelent ez a felhasználóknak?

A Nemotron 3.5 Lightning a vLLM támogatásával közvetlenül olyan környezetekbe illeszthető, ahol sok rövid ügynöki lépést kell kiszolgálni. A post-training lehetősége miatt a modell szervezetspecifikus kifejezésekhez, szabályokhoz, eszközökhöz és munkafolyamatokhoz igazítható, a vLLM által felsorolt felhasználási területek között pedig szerepel a pénzügyi és kockázati automatizáció, a kiberbiztonsági vizsgálat, a távközlési üzemeltetés, a kiskereskedelmi élmények és a helyi személyi asszisztens.

A modell súlyai a vLLM bejegyzése szerint Hugging Face-ről tölthetők le, a futtatáshoz pedig külön kezdő útmutató és nagy áteresztőképességű következtetési példa áll rendelkezésre. Alacsony késleltetésű kiszolgáláshoz a vLLM a DSpark használatát javasolja H100, H200 és DGX Spark rendszereken. A legnagyobb aktuális áteresztőképességhez ugyanakkor a közlemény szerint a spekulatív dekódolás nélküli futtatás ajánlott.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

64 GB memóriával jön az NVIDIA DGX Spark új változata
Chipek és infrastruktúra2026. október 2. 15:00

64 GB memóriával jön az NVIDIA DGX Spark új változata

Az NVIDIA 2026. október 2-án bejelentette a DGX Spark 64 GB-os, egyesített memóriával szerelt konfigurációját. A rendszer október 23-án érkezik az Acer, ASUS, Dell…

NVIDIA Blackwell GPU-kon gyorsul az OpenAI GPT-6 Astra UltrafastFontos hír
Modellek2026. október 2. 01:44

NVIDIA Blackwell GPU-kon gyorsul az OpenAI GPT-6 Astra Ultrafast

Az NVIDIA 2026. október 1-jén közölte, hogy az OpenAI GPT-6 Astra Ultrafast módja NVIDIA Blackwell GPU-kon fut, és már elérhető az OpenAI API-ban, valamint jogosult…

Az NVIDIA új modellje az ügynöki feladatok tömeges végrehajtására készült
Modellek2026. szeptember 22.

Az NVIDIA új modellje az ügynöki feladatok tömeges végrehajtására készült

Az NVIDIA Nemotron 3.5 Lightning nevű modellje a sok, jól körülhatárolható ügynöki feladat végrehajtására készült. A 30 milliárd paraméteres kevert szakértői modell…