Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az NVIDIA szerint a világ-akciómodellek javíthatják a robotok alkalmazkodását

2026. augusztus 4.Forrás: NVIDIA Developer
Az NVIDIA szerint a világ-akciómodellek javíthatják a robotok alkalmazkodását
Kép: NVIDIA Developer

Az NVIDIA Developer 2026. augusztus 4-én ismertette, hogyan alakíthatók a videós világmodellekre épülő world action modellek robotmanipulációs irányelvekké. A cég szerint a Cosmos 3 alapmodell fizikai előzetes tudást adhat a robotoknak, így kevesebb demonstrációval is jobban alkalmazkodhatnak új helyzetekhez.

A lényeg röviden
  • Az NVIDIA a VLA-k helyett videós világmodellekre épülő WAM-megközelítést mutat be robotmanipulációhoz.
  • A Cosmos 3 adatkészlete körülbelül 767M képet, 348M valós dinamikát rögzítő videót és 8M akciómintát tartalmaz.
  • A Cosmos3-Nano-Policy-DROID 16B paraméteres modell, a Cosmos3-Edge-Policy-DROID 4B változat eszközön futó telepítéshez készült.
  • A technikai jelentés szerint az omni-ellenőrzőpont 28.1%-ról 36.8%-ra emelte a RoboLab-sikert.
  • A 4B Edge modell Jetson Thoron 15 Hz vezérlési frekvenciát ér el a forrás szerint.

Mi a gond a mai VLA-megközelítéssel?

Az NVIDIA bejegyzése szerint a robotikában központi probléma, hogy a robotirányelvek gyakran csak azokban a helyzetekben működnek jól, amelyekhez hasonló demonstrációkon tanították őket. Ha megváltozik a tárgy alakja, helyzete vagy a megvilágítás, a betanított irányelv könnyen hibázhat.

A ma elterjedt nyelvi utasításokat követő robotirányelvek egyik útja, hogy egy előre betanított vision-language modelre, vagyis látás-nyelvi modellre akciómodult építenek. Ebből lesz a vision-language-action model, röviden VLA. Az NVIDIA szerint ez a megközelítés sokat vitt előre az általános robotmanipulációban, de a VLM-háttér elsősorban képek leírására optimalizált, nem arra, hogy megjósolja, miként változik a jelenet.

A cég érvelése szerint ez különösen akkor számít, amikor a robotnak előre kell látnia, mi történik például egy tárggyal megfogás, elengedés vagy mozgatás közben. A bejegyzésben idézett irányváltás lényege, hogy a nyelvi háttérmodellt videós világmodell váltsa fel. Ezt nevezi az NVIDIA world action modelnek, röviden WAM-nak.

Mit ad hozzá a WAM a robotirányelvekhez?

A world action model alapja egy videós világmodell, amely azt tanulja, hogyan fejlődik tovább a látott fizikai világ. Az NVIDIA szerint így az utólagos betanításnak nem kell a dinamikát nulláról megtanítania, inkább egy már meglévő fizikai előzetes tudást specializál robotfeladatokra.

A bejegyzés a World Action Models are Zero-shot Policies című NVIDIA-kutatási anyagra hivatkozva azt állítja, hogy a videó és az akciók közös előrejelzése olyan tulajdonságokat adhat a robotirányelveknek, amelyeket egy VLA nehezebben sajátít el. A WAM a cég szerint sokféle interakciós adatból tanulhat, mert minden tárgymozgás, tolás, fogás vagy ejtés hordoz információt a fizikáról.

Az NVIDIA szerint a fizikai törvényszerűségek általánosabbak a szemantikai leírásoknál: egy tárgy esése vagy csúszása nem attól függ, milyen néven hivatkozunk rá. A vállalat ebből vezeti le, hogy a WAM jobban viheti át a megtanult dinamikát ismeretlen környezetekbe és mozgásokba. A bejegyzés szerint az ilyen modell új robotkarhoz vagy megfogóhoz is kevesebb demonstrációval igazítható, mert már rendelkezik a fizikai interakciók modelljével.

Cosmos 3: omni-modell robotikai alapnak

Az NVIDIA a Cosmos 3-at olyan világ-alapmodellként mutatja be, amely Mixture-of-Transformers, röviden MoT architektúrára épül. A multimodális bemenet egy autoregresszív transzformeren halad át, amely diszkrét tokeneket, például szöveget állít elő. Ez irányít egy diffúziós transzformert a folytonos modalitásokhoz, köztük képhez, videóhoz, hanghoz és akcióhoz.

A modellcsalád három méretben szerepel a forrásban: 4B NVIDIA Cosmos Edge, 16B NVIDIA Cosmos Nano és 64B NVIDIA Cosmos 3 Super. Az NVIDIA szerint a Cosmos 3 erejét a fizikai világot lefedő adatkészlet adja: körülbelül 767M kép, 348M valós dinamikát rögzítő videó és 8M akcióminta szerepel benne. Ezek robotmanipulációt, autonóm vezetést, kameramozgást és egocentrikus mozgást fednek le.

A Cosmos 3 Policy DROID modellek a Cosmos 3 specializált változatai. A Cosmos3-Nano-Policy-DROID egy 16B paraméteres irányelv, amelyet a Cosmos 3 Nano modellből képeztek tovább a DROID platformra, egy Franka Panda karra Robotiq megfogóval. A Cosmos3-Edge-Policy-DROID 4B változat ugyanilyen módon készült, és a forrás szerint eszközön futó telepítéshez használható.

Akcióterv és jövőkép ugyanabból a modellből

A DROID-modellek nyelvi utasításból és többkamerás megfigyelésből robotakció-pályákat generálnak. Az NVIDIA szerint az omni-alap miatt a modell akciók kiadása közben videót is elő tud állítani arról, mit látnának a robot kamerái, ha az adott akciók végrehajtódnának. A bejegyzés hangsúlyozza, hogy az utólagos betanítás nem távolítja el a teljes omni-architektúrát, így az irányelv-ellenőrzőpont továbbra is képes következtetésre és videógenerálásra, nem csak ízületi pozíciók kiadására.

A forrás egy mérési eredményt is közöl a Cosmos 3 technikai jelentéséből. Két DROID-irányelvet hasonlítottak össze azonos recepttel, adattal és számítási kapacitással. Az egyik az alap-ellenőrzőpontból indult, a másik egy több terület akcióadataival betanított omni-ellenőrzőpontból. Az omni-ellenőrzőpont a RoboLab-sikert 28.1%-ról 36.8%-ra emelte.

Az NVIDIA értelmezése szerint ez arra utal, hogy a javulás az architektúrából és az előzetes tanításból ered, nem pusztán a méretből.

Mit jelent ez a fejlesztőknek és a robotikai piacnak?

A WAM teljes generatív világmodellt hordoz, ezért az NVIDIA szerint nagyobb, mint a kompakt VLA-megoldások. A Cosmos 3-at a cég több telepítési szintre pozicionálja. Munkaállomásos kiszolgálásnál a 16B Nano modell a robot mellett fut, nem a robot fedélzetén. A valós DROID-telepítésnél a Cosmos3-Nano-Policy egyetlen NVIDIA RTX PRO 6000 rendszeren szolgál ki, a robot hálózaton küldi a megfigyeléseket, és akcióblokkokat kap vissza.

Eszközön futó megoldásként a 4B Edge modell szerepel. A forrás szerint a Cosmos 3 Edge 640×360 felbontású megfigyelésekkel dolgozik, következtetésenként 32 akciót generál NVIDIA Jetson Thor hardveren, és 15 Hz vezérlési frekvenciát ér el. A támogatott NVIDIA edge számítógépek között a bejegyzés RTX PRO GPU-kat, DGX-et, GeForce RTX GPU-kat és Jetson rendszereket említ, köztük az új Jetson T2000 és T3000 modulokat.

A fejlesztők számára az NVIDIA azt emeli ki, hogy a Cosmos 3 alapmodellje, adatkészletei, utólagos betanítási receptje, betanított súlyai, értékelőeszközei és kiszolgáló stackje olyan licenc alatt érhetők el, amely kereskedelmi használatot is megenged. A cég állítása szerint a WAM-megközelítés gyakorlati előnye a kevesebb feladatspecifikus adat, a jobb viselkedés a tanítási eloszláson kívül, valamint a rövidebb út új robotkivitelig.

Kapcsolódó hírek

Egyetlen videóból tanulhat új feladatokat a Skild AI robotmodellje
Cégek és üzlet2026. szeptember 10.

Egyetlen videóból tanulhat új feladatokat a Skild AI robotmodellje

Egy videós bemutató is elég lehet a Skild AI új S1 robot alapmodelljének ahhoz, hogy korábban nem látott, több lépésből álló feladatokat hajtson végre. Az NVIDIA szerint…

A Jetson Thoron futó Cosmos 3 Edge robotvezérlést mutatott be az NVIDIA
Modellek2026. augusztus 19.

A Jetson Thoron futó Cosmos 3 Edge robotvezérlést mutatott be az NVIDIA

Az NVIDIA Developer 2026. augusztus 19-én ismertette, hogyan tanítható tovább a Cosmos 3 Edge helyben futó robotmanipulációs irányításra. A cég szerint a 4B méretű…

Az NVIDIA nyílt világmodellekkel gyorsítaná a fizikai AI fejlesztését
Modellek2026. augusztus 6.

Az NVIDIA nyílt világmodellekkel gyorsítaná a fizikai AI fejlesztését

Az NVIDIA 2026. augusztus 6-án részletezte, hogyan építené a fizikai AI fejlesztését nyílt világmodellekre. A vállalat szerint a Cosmos 3 modellcsalád, az Omniverse…