Az NVIDIA szerint a világ-akciómodellek javíthatják a robotok alkalmazkodását

Az NVIDIA Developer 2026. augusztus 4-én ismertette, hogyan alakíthatók a videós világmodellekre épülő world action modellek robotmanipulációs irányelvekké. A cég szerint a Cosmos 3 alapmodell fizikai előzetes tudást adhat a robotoknak, így kevesebb demonstrációval is jobban alkalmazkodhatnak új helyzetekhez.
- Az NVIDIA a VLA-k helyett videós világmodellekre épülő WAM-megközelítést mutat be robotmanipulációhoz.
- A Cosmos 3 adatkészlete körülbelül 767M képet, 348M valós dinamikát rögzítő videót és 8M akciómintát tartalmaz.
- A Cosmos3-Nano-Policy-DROID 16B paraméteres modell, a Cosmos3-Edge-Policy-DROID 4B változat eszközön futó telepítéshez készült.
- A technikai jelentés szerint az omni-ellenőrzőpont 28.1%-ról 36.8%-ra emelte a RoboLab-sikert.
- A 4B Edge modell Jetson Thoron 15 Hz vezérlési frekvenciát ér el a forrás szerint.
Mi a gond a mai VLA-megközelítéssel?
Az NVIDIA bejegyzése szerint a robotikában központi probléma, hogy a robotirányelvek gyakran csak azokban a helyzetekben működnek jól, amelyekhez hasonló demonstrációkon tanították őket. Ha megváltozik a tárgy alakja, helyzete vagy a megvilágítás, a betanított irányelv könnyen hibázhat.
A ma elterjedt nyelvi utasításokat követő robotirányelvek egyik útja, hogy egy előre betanított vision-language modelre, vagyis látás-nyelvi modellre akciómodult építenek. Ebből lesz a vision-language-action model, röviden VLA. Az NVIDIA szerint ez a megközelítés sokat vitt előre az általános robotmanipulációban, de a VLM-háttér elsősorban képek leírására optimalizált, nem arra, hogy megjósolja, miként változik a jelenet.
A cég érvelése szerint ez különösen akkor számít, amikor a robotnak előre kell látnia, mi történik például egy tárggyal megfogás, elengedés vagy mozgatás közben. A bejegyzésben idézett irányváltás lényege, hogy a nyelvi háttérmodellt videós világmodell váltsa fel. Ezt nevezi az NVIDIA world action modelnek, röviden WAM-nak.
Mit ad hozzá a WAM a robotirányelvekhez?
A world action model alapja egy videós világmodell, amely azt tanulja, hogyan fejlődik tovább a látott fizikai világ. Az NVIDIA szerint így az utólagos betanításnak nem kell a dinamikát nulláról megtanítania, inkább egy már meglévő fizikai előzetes tudást specializál robotfeladatokra.
A bejegyzés a World Action Models are Zero-shot Policies című NVIDIA-kutatási anyagra hivatkozva azt állítja, hogy a videó és az akciók közös előrejelzése olyan tulajdonságokat adhat a robotirányelveknek, amelyeket egy VLA nehezebben sajátít el. A WAM a cég szerint sokféle interakciós adatból tanulhat, mert minden tárgymozgás, tolás, fogás vagy ejtés hordoz információt a fizikáról.
Az NVIDIA szerint a fizikai törvényszerűségek általánosabbak a szemantikai leírásoknál: egy tárgy esése vagy csúszása nem attól függ, milyen néven hivatkozunk rá. A vállalat ebből vezeti le, hogy a WAM jobban viheti át a megtanult dinamikát ismeretlen környezetekbe és mozgásokba. A bejegyzés szerint az ilyen modell új robotkarhoz vagy megfogóhoz is kevesebb demonstrációval igazítható, mert már rendelkezik a fizikai interakciók modelljével.
Cosmos 3: omni-modell robotikai alapnak
Az NVIDIA a Cosmos 3-at olyan világ-alapmodellként mutatja be, amely Mixture-of-Transformers, röviden MoT architektúrára épül. A multimodális bemenet egy autoregresszív transzformeren halad át, amely diszkrét tokeneket, például szöveget állít elő. Ez irányít egy diffúziós transzformert a folytonos modalitásokhoz, köztük képhez, videóhoz, hanghoz és akcióhoz.
A modellcsalád három méretben szerepel a forrásban: 4B NVIDIA Cosmos Edge, 16B NVIDIA Cosmos Nano és 64B NVIDIA Cosmos 3 Super. Az NVIDIA szerint a Cosmos 3 erejét a fizikai világot lefedő adatkészlet adja: körülbelül 767M kép, 348M valós dinamikát rögzítő videó és 8M akcióminta szerepel benne. Ezek robotmanipulációt, autonóm vezetést, kameramozgást és egocentrikus mozgást fednek le.
A Cosmos 3 Policy DROID modellek a Cosmos 3 specializált változatai. A Cosmos3-Nano-Policy-DROID egy 16B paraméteres irányelv, amelyet a Cosmos 3 Nano modellből képeztek tovább a DROID platformra, egy Franka Panda karra Robotiq megfogóval. A Cosmos3-Edge-Policy-DROID 4B változat ugyanilyen módon készült, és a forrás szerint eszközön futó telepítéshez használható.
Akcióterv és jövőkép ugyanabból a modellből
A DROID-modellek nyelvi utasításból és többkamerás megfigyelésből robotakció-pályákat generálnak. Az NVIDIA szerint az omni-alap miatt a modell akciók kiadása közben videót is elő tud állítani arról, mit látnának a robot kamerái, ha az adott akciók végrehajtódnának. A bejegyzés hangsúlyozza, hogy az utólagos betanítás nem távolítja el a teljes omni-architektúrát, így az irányelv-ellenőrzőpont továbbra is képes következtetésre és videógenerálásra, nem csak ízületi pozíciók kiadására.
A forrás egy mérési eredményt is közöl a Cosmos 3 technikai jelentéséből. Két DROID-irányelvet hasonlítottak össze azonos recepttel, adattal és számítási kapacitással. Az egyik az alap-ellenőrzőpontból indult, a másik egy több terület akcióadataival betanított omni-ellenőrzőpontból. Az omni-ellenőrzőpont a RoboLab-sikert 28.1%-ról 36.8%-ra emelte.
Az NVIDIA értelmezése szerint ez arra utal, hogy a javulás az architektúrából és az előzetes tanításból ered, nem pusztán a méretből.
Mit jelent ez a fejlesztőknek és a robotikai piacnak?
A WAM teljes generatív világmodellt hordoz, ezért az NVIDIA szerint nagyobb, mint a kompakt VLA-megoldások. A Cosmos 3-at a cég több telepítési szintre pozicionálja. Munkaállomásos kiszolgálásnál a 16B Nano modell a robot mellett fut, nem a robot fedélzetén. A valós DROID-telepítésnél a Cosmos3-Nano-Policy egyetlen NVIDIA RTX PRO 6000 rendszeren szolgál ki, a robot hálózaton küldi a megfigyeléseket, és akcióblokkokat kap vissza.
Eszközön futó megoldásként a 4B Edge modell szerepel. A forrás szerint a Cosmos 3 Edge 640×360 felbontású megfigyelésekkel dolgozik, következtetésenként 32 akciót generál NVIDIA Jetson Thor hardveren, és 15 Hz vezérlési frekvenciát ér el. A támogatott NVIDIA edge számítógépek között a bejegyzés RTX PRO GPU-kat, DGX-et, GeForce RTX GPU-kat és Jetson rendszereket említ, köztük az új Jetson T2000 és T3000 modulokat.
A fejlesztők számára az NVIDIA azt emeli ki, hogy a Cosmos 3 alapmodellje, adatkészletei, utólagos betanítási receptje, betanított súlyai, értékelőeszközei és kiszolgáló stackje olyan licenc alatt érhetők el, amely kereskedelmi használatot is megenged. A cég állítása szerint a WAM-megközelítés gyakorlati előnye a kevesebb feladatspecifikus adat, a jobb viselkedés a tanítási eloszláson kívül, valamint a rövidebb út új robotkivitelig.
NVIDIA Developer: Beyond VLAs: How World Action Models Reshape Robot Manipulation


