Az NVIDIA új modellje az ügynöki feladatok tömeges végrehajtására készült

Az NVIDIA Nemotron 3.5 Lightning nevű modellje a sok, jól körülhatárolható ügynöki feladat végrehajtására készült. A 30 milliárd paraméteres kevert szakértői modell tokenenként körülbelül 3 milliárd paramétert aktivál.
- A Nemotron 3.5 Lightning 30 milliárd paraméteres MoE-modell, tokenenként körülbelül 3 milliárd aktív paraméterrel.
- Az NVIDIA a sok, jól körülhatárolható ügynöki feladat végrehajtására pozicionálja.
- A modell szintjén legfeljebb 1 millió tokenes kontextust támogat.
- A Nemotron 3 Ultra összetett gondolkodásra és koordinációra, a Lightning nagy volumenű végrehajtásra készült.
- A standard és az ingyenes OpenRouter-végpont eltérő kontextus- és funkciókorlátokat kínál.
Nagy modell, korlátozott aktív paraméterszámmal
Az OpenRouter szeptember 22-i, szeptember 24-én frissített bemutatója szerint a Nemotron 3.5 Lightning egy hibrid Mamba-2, figyelmi és kevert szakértői, vagyis mixture-of-experts modell. Összesen 30 milliárd paramétert tartalmaz, tokenenként azonban körülbelül 3 milliárd aktív paraméterrel dolgozik. Ezt a felépítést 30B-A3B jelöléssel is megadják.
A modell egy útválasztó segítségével választja ki, hogy az egyes tokenek feldolgozásakor mely szakértői részeket használja. Így a 3 milliárd paraméteres, sűrű modelleknél nagyobb teljes kapacitást kínálhat anélkül, hogy minden tokennél mind a 30 milliárd paraméter futna. Az OpenRouter ugyanakkor külön felhívja a figyelmet arra, hogy az aktív paraméterszám önmagában nem írja le a számítási vagy memóriaigényt. A teljes modellt tárolni kell, a megosztott rétegek pedig szintén futnak a következtetés során.
A Nemotron 3.5 Lightning támogatja a konfigurálható gondolkodást, többtokenes előrejelzéssel érkezik, és két spekulatív dekódoló modult is tartalmaz, ezek a DSpark és a DFlash. Elérhető hozzá BF16 referencia-súly, valamint optimalizált NVFP4 és GGUF kiadás. A licenc neve OpenMDW-1.1, a modell pedig 2026. augusztus 11-én jelent meg.
Az ügynöki munkafolyamat végrehajtási rétegére szánják
Az OpenRouter leírása szerint egy ügynök egy összetett feladat megtervezéséhez kevés, nehéz modellszintű hívást végezhet, a terv végrehajtásához viszont több tucat további hívásra lehet szüksége. Ezek során fájlokat olvas, eszközöket választ, argumentumokat készít, ellenőrzi az eredményeket, fájlokat módosít, majd eldönti a következő lépést.
A Lightninget az NVIDIA erre a nagy számú, szűkebb célú feladatra pozicionálja. Alkalmas lehet eszközhívásokra, programozási feladatokra, utasításkövetésre és strukturált adatok visszaadására. Különösen azokban a munkafolyamatokban lehet hasznos, ahol egy ügynök sok hívást indít, ezért a késleltetés és a költség minden egyes lépéssel összeadódik.
Egy kódoló ügynök például egy nagyobb, összetettebb gondolkodásra képes modellel vizsgálhatja át a tárházat és készítheti el a megvalósítási tervet. A Lightning ezután megkereshet egy szimbólumot, módosíthat egy fájlt, futtathat egy eszközt, majd értelmezheti az eredményt.
Más szerepet kap, mint a Nemotron 3 Ultra
A Nemotron 3.5 Lightning nevét könnyű összekeverni a Nemotron 3 Ultra modellel, de az OpenRouter szerint eltérő feladatokra készültek. Az NVIDIA a Lightninget a Nemotron 3 Ultrából desztillálta. A Lightning 30 milliárd teljes és 3 milliárd aktív paraméterrel rendelkezik, míg a Nemotron 3 Ultra 550 milliárd, illetve 55 milliárd paraméteres. Előbbit a nagy volumenű végrehajtásra és specializált feladatokra, utóbbit összetett gondolkodásra és koordinációra szánják.
Az OpenRouter táblázata szerint a Lightning ára 2026. szeptember 11-én 0,065 és 0,10 dollár között mozgott egymillió bemeneti tokenenként, kimeneti tokenenként pedig 0,18 és 0,25 dollár között. A Nemotron 3 Ultra ugyanebben az összevetésben 0,50 és 0,625 dollár közötti bemeneti, valamint 2,20 és 3,125 dollár közötti kimeneti árat kínált.
Az NVIDIA saját mérése szerint a Lightning hasonló méretű nyílt modelleknél akár négyszer nagyobb áteresztőképességet érhet el. A cég PinchBench tesztjében 10 ezer ügynöki feladatot legfeljebb 30 százalékkal gyorsabban teljesített hasonló pontosság mellett. Az OpenRouter ezeket gyártói eredményként kezeli, ezért saját munkafolyamaton végzett tesztelést javasol.
A kontextus mérete szolgáltatónként eltérhet
Modellszinten a Nemotron 3.5 Lightning legfeljebb 1 millió tokenes kontextusablakot támogat. Az OpenRouteren azonban az elérhető méret az adott végponttól függ. 2026. szeptember 11-én a standard modellazonosító mögötti valamennyi szolgáltató 262 144 tokenes kontextust biztosított, a kimeneti korlát pedig szolgáltatónként 32 768 és 235 929 token között változott.
A nvidia/nemotron-3.5-lightning:free modellazonosító a teljes, 1 millió tokenes kontextust kínálja, legfeljebb 65 536 kimeneti tokennel. Az OpenRouter szerint a 262 144 tokennél hosszabb kérésekhez jelenleg csak ez az ingyenes végpont biztosítja a teljes modellkontextust. A szolgáltató ugyanakkor közli, hogy ezen a végponton a használatot biztonsági okokból és az NVIDIA termékeinek, szolgáltatásainak fejlesztéséhez naplózzák, ezért bizalmas információk és személyes adatok feltöltését nem javasolják.
A modellazonosítók között a strukturált kimenet támogatása is különbözik. A standard modellnél mind a négy jelenlegi szolgáltató listázza ezt a funkciót, az ingyenes változatnál viszont nem. A felhasználóknak ezért az adott modelloldal korlátait kell ellenőrizniük, mielőtt egy ügynöki rendszert erre építenek.
OpenRouter: What Is Nemotron 3.5 Lightning


