Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

NVIDIA Alpamayo 2 Super: nyílt VLA-modell önvezető autók fejlesztéséhez

2026. augusztus 4.Forrás: NVIDIA Developer
NVIDIA Alpamayo 2 Super: nyílt VLA-modell önvezető autók fejlesztéséhez
Kép: NVIDIA Developer

Az NVIDIA Developer 2026. augusztus 4-én mutatta be az Alpamayo 2 Super modellt, egy nyílt, 34 milliárd paraméteres vision-language-action rendszert autonóm járművek fejlesztéséhez. A modell pályákat, következtetési nyomokat, meta-akciókat, vizuális kérdésválaszokat és automatikus címkéket is képes előállítani ugyanabból az alapból.

A lényeg röviden
  • Az Alpamayo 2 Super nyílt, 34 milliárd paraméteres VLA-modell autonóm járművek fejlesztéséhez.
  • Legfeljebb hét kamerát dolgoz fel, és pályákat, CoC nyomokat, meta-akciókat, kérdésválaszokat és automatikus címkéket generál.
  • A LingoQA benchmarkon 79,2 pontot ért el, az NVIDIA szerint első lett 37 vizsgált modell között.
  • Az AlpaSim zárt hurkú szimuláció 913 rekonstruált jeleneten 1,50 ± 0,13 AlpaSim Score eredményt adott.
  • A modell súlyai Hugging Face-en, az inference notebookok GitHubon érhetők el OpenMDW-1.1 licenc alatt.

Egy közös alap több önvezető fejlesztési feladathoz

Az NVIDIA szerint az autonóm járművek fejlesztése gyakran külön modellekre támaszkodik a pályatervezéshez, a magas szintű szándék előrejelzéséhez, a jelenet megértéséhez és az adatcímkézéshez. Ez megnehezíti az összetartozó kimenetek összevetését, a modellviselkedés vizsgálatát és ugyanazon reprezentációk újrafelhasználását a fejlesztési folyamatban.

Erre kínál megoldást az NVIDIA Alpamayo 2 Super, amely egy nyílt, 34 milliárd paraméteres reasoning vision-language-action, röviden VLA-modell. A rendszer a 32 milliárd paraméteres NVIDIA Cosmos 3 Super Reasonerre és egy 2 milliárd paraméteres, diffúziós alapú Action Expert komponensre épül, és megerősítéses tanulással utótanították.

A leírás szerint a Reasoner többkamerás videót, nyelvi kontextust és korábbi mozgástörténetet értelmez, az Action Expert pedig a modell belső reprezentációját alakítja át az ego-jármű jövőbeli pályájává. Az Alpamayo 2 Super legfeljebb hét kamerából dolgozik, így 360 fokos érzékelést támogat.

Pályák, ok-okozati nyomok és kérdésválaszok

Az Alpamayo 2 Super több kimenetet is adhat ugyanabból a modellalapból: jövőbeli pályákat, Chain-of-Causation, röviden CoC következtetési nyomokat, magas szintű meta-akciókat, jelenetre vonatkozó, 2D földeléssel ellátott válaszokat, valamint strukturált automatikus címkéket.

A CoC nyomok célja, hogy betekintést adjanak abba, miért hozott a modell egy adott vezetési döntést a megfigyelt jelenet alapján. Az NVIDIA példái szerint ez segíthet a nehéz esetek válogatásában, egy telepített irányítási házirend és egy nagyobb tanítómodell összehasonlításában, valamint annak diagnosztizálásában, hogy egy hiba az érzékelésből, a következtetésből vagy az akciógenerálásból ered.

A vállalat szerint a CoC nyomok az NVIDIA Halos biztonsági validációs munkafolyamataiba is illeszkednek, mert lehetővé teszik a modell jelenetértésének vizsgálatát. A bejegyzés négy munkafolyamatot emel ki: pályák és CoC nyomok generálását nyílt hurkú és zárt hurkú kiértékeléssel, meta-akciók előrejelzését például elsőbbségadásra, sávváltásra és megállásra, természetes nyelvű kérdések megválaszolását többkamerás vezetési jelenetekről, valamint CoC automatikus címkék generálását 2D földeléssel saját klipeken.

Mérési eredmények nyílt és zárt hurkú kiértékelésben

Az NVIDIA nyílt hurkú kiértékelésben, a Physical AI AV Dataset 1 434 nehéz mintáján 6,4 másodperces minADE_6 értéket közölt, amely 0,911 méter volt. A Physical AI AV Reasoning Benchmarkon az Alpamayo 2 Super 0,433 pontot ért el.

A LingoQA benchmarkon a modell 79,2 pontot kapott, az NVIDIA közlése szerint ezzel első lett 37 vizsgált modell között. A 34 milliárd paraméteres Alpamayo 2 Super a forrás szerint 17,0 ponttal előzte meg a Qwen2.5-VL 72B modellt, 7,0 ponttal a Qwen3-VL 32B-t, 15,1 ponttal a Gemini 2.5 Pro-t és 23,2 ponttal a GPT-4o-t. A bejegyzés hozzáteszi, hogy az alacsonyabb minADE_6 jobb pályaelőrejelzést, a magasabb következtetési pontszám jobb teljesítményt jelez.

Az NVIDIA külön hangsúlyozza a nyílt hurkú metrikák korlátját: ezek rögzített, előre felvett jövőhöz hasonlítják az előrejelzést, ezért nem mutatják meg, mi történik a modell első akciója után. Zárt hurkú szimulációban az előrejelzett akciókat a jeleneten belül hajtják végre, és ha a szimulátor reaktív viselkedési modelleket is tartalmaz, a környező szereplők reakciói is mérhetők.

Az NVIDIA AlpaSim zárt hurkú szimulációban, 913 rekonstruált jeleneten 1,50 ± 0,13 AlpaSim Score eredményt adott. A forrás szerint ez olyan ütközéseket és közeli találkozásokat is feltárhat, amelyeket a nyílt hurkú metrikák elmulasztanak.

Automatikus címkézés és fejlesztői hozzáférés

A meta-akciók előrejelzésénél az NVIDIA egy belső, 94K klipből álló készleten 74,59 laterális IoU, 61,91 longitudinális IoU és 73,55 sávszintű IoU értéket közölt. A vizuális kérdésválasz feladat 8K kérdés-válasz páron 0,652 válaszhasonlóságot és 0,71 grounding IoU-t ért el.

A CoC automatikus címkézés 8K belső klipen 0,652 hasonlósági pontszámot ért el szakértői annotációkhoz képest. Az NVIDIA szerint ez nagy léptékben teszi lehetővé strukturált következtetési címkék előállítását adatmotoros munkafolyamatokhoz.

A modell súlyai a Hugging Face-en, az inference notebookok a GitHubon érhetők el. Az NVIDIA közlése szerint az Alpamayo 2 Super OpenMDW-1.1 licenc alatt jelenik meg, amely a Linux Foundation megengedő licence nyílt modelldisztribúciókhoz. A forrás alapján a licenc kiterjed a finomhangolásra, a származtatott modellekre és a kereskedelmi újraterjesztésre, a desztillált modellek pedig további NVIDIA-engedély nélkül kereskedelmi célra telepíthetők, miközben a modellkimenetekre nem vonatkoznak licencfeltételek.

Mit jelent ez a fejlesztőknek

Az Alpamayo 2 Super jelentősége a forrás alapján abban áll, hogy több, eddig gyakran külön kezelt önvezető fejlesztési feladatot egy közös modellalapra hoz. Ugyanaz a rendszer használható offline házirendtanítóként, kiértékelő kritikusként, adatmotorként vagy új feladatok testreszabásának kiindulópontjaként.

Ez a gyakorlatban azt ígéri, hogy a fejlesztők ugyanazon jelenetből nemcsak pályát, hanem magyarázható következtetési nyomot, meta-akciót, kérdésválaszt és automatikus címkét is kaphatnak. A zárt hurkú AlpaSim kiértékelés szerepe azért fontos, mert a bejegyzés szerint olyan biztonsági szempontból lényeges helyzetekre is rávilágíthat, amelyeket a rögzített jövőhöz kötött nyílt hurkú tesztek nem feltétlenül fednek fel.

Kapcsolódó hírek

Az NVIDIA AI-ügynökökre szabott TensorRT-projekt tanulságait mutatja be
Fejlesztőknek2026. szeptember 29.

Az NVIDIA AI-ügynökökre szabott TensorRT-projekt tanulságait mutatja be

Az NVIDIA olyan fejlesztési módszereket ismertetett, amelyekkel a TensorRT Model Connect nyílt forráskódú projektet kezdettől fogva kódoló AI-ügynökökre építve…

Az NVIDIA AI-ügynökökre szabott TensorRT-projektet épít
Fejlesztőknek2026. szeptember 29.

Az NVIDIA AI-ügynökökre szabott TensorRT-projektet épít

Az NVIDIA olyan nyílt forráskódú projektet épít, amelyben a kódoló AI-ügynökök önálló, ellenőrizhető feladatokon dolgoznak. A TensorRT Model Connect július 29-i kiadása…

Olcsóbban építhetők videóelemző AI-ügynökök az NVIDIA VSS 3.3-mal
Fejlesztőknek2026. szeptember 29.

Olcsóbban építhetők videóelemző AI-ügynökök az NVIDIA VSS 3.3-mal

Az NVIDIA bemutatta a Metropolis Video Search and Summarization Blueprint 3.3 verzióját, amely természetes nyelvű utasításból állít össze videóelemző AI-ügynököket. Az…