NVIDIA: a Jetson már helyben futtat kompakt érvelő AI-modelleket

Az NVIDIA Developer 2026. szeptember 4-én bemutatta, hogyan telepíthetők és optimalizálhatók új, kompakt érvelő modellek NVIDIA Jetson eszközökön. A cég példaként a Nemotron 3.5 Lightning és a Qwen3.8-27B modelleket használja.
- Az NVIDIA szerint 2026-os kompakt nyílt modellek már Jetsonon is futtathatók helyben.
- A Nemotron 3.5 Lightning 30 milliárd paraméteres MoE modell, tokenenként 3 milliárdot aktivál.
- A Qwen3.8-27B sűrű modell, minden tokenhez mind a 27 milliárd paramétert használja.
- Az NVFP4 és a spekulatív dekódolás együtt akár 6,28-szoros dekódolási gyorsulást adhat BF16-hoz képest.
- Az NVIDIA reprezentatív promptokkal végzett alkalmazásszintű validálást javasol.
A nagy adatközpontoktól az edge eszközökig
Az NVIDIA Developer bejegyzése szerint az edge környezetben futó érvelő és ügynök jellegű AI eddig azért volt nehézkes, mert a többlépéses gondolkodásra képes modellek túl nagyok voltak a helyi hardverekhez. A fejlesztőknek gyakran adatközpontba kellett irányítaniuk az inferenciát, ami hálózati függőséget, magasabb költségeket és olyan adatkezelési kockázatokat hozott, amikor az adatoknak az eszközön kellene maradniuk.
Az NVIDIA szerint ez a korlát most enyhül. A vállalat azt írja, hogy a nyár folyamán megjelent több modellcsalád együtt fordulópontot jelent az edge AI számára. A 2026-ban kiadott kompakt nyílt modellek már olyan érvelési és ügynök képességeket adnak, amelyekhez néhány hónappal korábban még nagy adatközponti rendszerek kellettek, és ezeket a Jetson eszközök ma helyben is futtathatják.
A cég példái között szerepelnek járműfülkében működő asszisztensek, valós idejű anomáliadetektálás és olyan robotok, amelyek zord vagy távoli környezetben dolgoznak. A bejegyzés szerint ilyen esetekben a helyszíni szakértők kevesebb időt tölthetnek hibakereséssel, a kritikus rendszerek pedig akkor is működhetnek, ha a kapcsolat korlátozott vagy nem elérhető.
Nemotron 3.5 Lightning és Qwen3.8-27B: eltérő architektúrák
Az NVIDIA két modellt emel ki példaként: a Nemotron 3.5 Lightninget és a Qwen3.8-27B-t. A bejegyzés szerint a jobb tanítási módszerek és a hatékonyabb architektúrák vezetik ezt a változást. Példaként említi a desztillációt, amely a Nemotron 3 Ultra képességeinek egy részét viszi át a kisebb Nemotron 3.5 Lightning modellbe.
A Qwen3.8-27B sűrű modell, vagyis minden tokenhez mind a 27 milliárd paramétert aktiválja. A Nemotron 3.5 Lightning ezzel szemben mixture-of-experts, röviden MoE architektúrát használ. Összesen 30 milliárd paramétere van, de tokenenként csak 3 milliárdot aktivál.
Az NVIDIA szerint ezek a különbségek különösen a hosszabban futó ügynökfolyamatoknál fontosak. Egy ügynök például élő szenzoradatok és eszköznaplók alapján figyelhet egy rendszert, jóváhagyott javító lépéseket hajthat végre, az eredményt előre meghatározott tesztekkel ellenőrizheti, és csak szükség esetén vonhat be szakértőt. A vállalat leírása szerint mindez helyben, internetkapcsolat nélkül is futhat az edge oldalon, alacsonyan tartva a késleltetést.
A bejegyzés szerint a Nemotron 3.5 Lightning azokhoz a válaszközpontú munkafolyamatokhoz illik jól, ahol a gyorsabb tokengenerálás lerövidítheti a teljes folyamatot. A Qwen3.8-27B azoknál a feladatoknál lehet jobb választás, amelyek kevesebb, de nehezebb döntést igényelnek, és megengedik, hogy az ügynök több időt töltsön egy válasz előállításával. Az NVIDIA azt javasolja, hogy a fejlesztők a saját alkalmazásuk döntésein, eszközein és válaszmintáin mérjék össze a modelleket a választás előtt.
A Jetson platformon ezek az ügynökciklusok a szenzorok és a vezérelt rendszerek közelében futhatnak. A vállalat szerint a modellek népszerű keretrendszerekkel, köztük vLLM és llama.cpp használatával telepíthetők helyben, így az érvelési ciklus nem függ teljesen az adatközponttól. A bejegyzés a Jetson Orin Nano esetében a Gemma 4 E4B-t nevezi erős kiindulópontnak, míg Jetson AGX Orin és Jetson AGX Thor esetében a Nemotron 3.5 Lightninget és a Qwen3.8-27B-t említi erős opcióként.
NVFP4 és spekulatív dekódolás gyorsítja az inferenciát
Az NVIDIA két egymást kiegészítő optimalizálási technikát emel ki. Az NVFP4 kvantálás csökkenti a modellműveletekhez szükséges számítási munkát és memóriát, a spekulatív dekódolás pedig több elfogadott tokent állíthat elő egy ellenőrzési lépésben.
A bejegyzés szerint a BF16 szolgál kiinduló állapotként. Ehhez képest az NVFP4 kvantálást ad, a végső konfiguráció pedig az NVFP4-et kombinálja az adott modellhez a tesztekben leggyorsabb spekulatív dekódolási beállítással. Az NVIDIA azt állítja, hogy a két technika együtt akár 6,28-szoros dekódolási áteresztőképesség-gyorsulást ad BF16-hoz képest Jetsonon.
A dekódolás során a modell tokenenként generálja a választ, és egy token általában újabb átfutást igényel a modellen. A kvantálás az egyes átfutások költségét csökkenti: az alacsonyabb pontosságú értékek miatt a GPU-nak kevesebb adatot kell mozgatnia és feldolgoznia. Az NVIDIA szerint az NVFP4 formátummal javítható a generálási sebesség és csökkenthető a memóriahasználat, miközben a minőség közel marad a BF16-hoz.
A spekulatív dekódolás más úton gyorsít. Egy kisebb draft modell több tokent javasol, a fő modell pedig együtt ellenőrzi ezeket. A végső döntést továbbra is a fő modell hozza meg. Ha több javasolt tokent elfogad, a generálás egyetlen ellenőrzési lépésben több tokennel halad előre.
Az NVIDIA több draftkészítési módszert említ, köztük az MTP, DFlash és DSpark megoldásokat. Mindhárom fut Jetsonon, de eltérően állítják elő és értékelik a javaslatokat. A vállalat szerint nem érdemes feltételezni, hogy egyetlen konfiguráció minden modellnél a legjobb lesz. A saját tesztjeikben a Nemotron 3.5 Lightning a DSparkkal teljesített a legjobban, míg a Qwen3.8-27B a DFlash2-vel érte el a legjobb eredményt.
Mit jelent ez a fejlesztőknek és a piacnak
A bejegyzés közvetlen üzenete a fejlesztőknek az, hogy az edge oldali érvelő AI tervezésénél már nem csak a modell neve vagy mérete számít. Az architektúra, a kvantált checkpointok, az inferenciamotor, a spekulatív dekódolási módszer és a draft checkpoint együtt határozza meg, hogy egy konfiguráció hogyan viselkedik valós feladatokon.
Az NVIDIA külön kiemeli az alkalmazásszintű validálás szükségességét. A teljesítmény a munkaterhelés kategóriájától függően változhat, az általános benchmarkok pedig önmagukban nem igazolják, hogy egy checkpoint megőrzi-e az adott alkalmazás szempontjából kritikus viselkedést. A vállalat ezért reprezentatív promptokkal végzett tesztelést javasol.
A telepítéshez a forrás előfeltételként Jetson AGX Thor vagy Jetson AGX Orin eszközt, JetPack 7.2 környezetet NVIDIA Container Runtime-mal és Dockerrel, elegendő tárhelyet a modellhez és a draft checkpointokhoz, valamint az NVIDIA Nemotron és Qwen3.8 checkpointok licencfeltételeinek elfogadását említi.
A piac számára a hír azt jelzi, hogy az NVIDIA szerint a 2026-os kompakt nyílt modellek már olyan helyi edge feladatokra is alkalmasak lehetnek, amelyekhez korábban adatközponti háttér kellett. Ez különösen ott lehet fontos, ahol a késleltetés, a kapcsolat elérhetősége vagy az adatok helyben tartása meghatározó szempont.
NVIDIA Developer: Frontier Reasoning Reaches the Edge: How to Deploy and Optimize Models on NVIDIA Jetson


