A Jetson Thoron futó Cosmos 3 Edge robotvezérlést mutatott be az NVIDIA

Az NVIDIA Developer 2026. augusztus 19-én ismertette, hogyan tanítható tovább a Cosmos 3 Edge helyben futó robotmanipulációs irányításra. A cég szerint a 4B méretű omni-modell Jetson Thoron is futtatható, és zárt hurkú szimulációban értékelték.
- A Cosmos 3 Edge egy 4B omni-modell, 2B NVIDIA Nemotron-alapú következtető komponenssel.
- Jetson AGX Thor T5000-en egy akciócsomag körülbelül 1,53 másodperc alatt készül el 640×540 felbontás és 15 Hz mellett.
- A továbbtanított policy zárt hurkú RoboLab értékelésben 22,9 százalékos sikerességet ért el 120 feladaton.
- A Cosmos3-DROID adatkészlet 76k sikeres trajektóriát, körülbelül 350 órát, 86 feladatot és 564 jelenetet tartalmaz.
- Az NVIDIA szerint a modell körülbelül 9 GB BF16 súllyal elfér a Jetson Thor fedélzeti memóriájában.
Helyben futó robotikai irányítás a Cosmos 3 Edge-re építve
Az NVIDIA bejegyzése szerint a robotoknak olyan irányítási modellekre van szükségük, amelyek alkalmazkodni tudnak a szenzorokhoz, a környezethez és a feladatokhoz, miközben a robot fedélzeti számítógépén futnak. A vállalat erre a Cosmos 3 Edge-et mutatta be példaként, amely a Cosmos 3 család 4B méretű omni-modellje, egy 2B méretű, NVIDIA Nemotron-alapú következtető komponenssel.
A Cosmos 3 Edge-et az NVIDIA szerint ugyanazon a fizikai világból származó adaton előtanították, mint a NVIDIA Cosmos 3 Nano és a NVIDIA Cosmos 3 Super modelleket. A cég állítása szerint ez közös alapot ad ahhoz, hogyan mozognak az objektumok és hogyan lépnek kölcsönhatásba egymással. A cél ebben az esetben az, hogy a modell robotkaros manipulációs irányítási modellként működjön, és közvetlenül NVIDIA Jetson Thor hardveren szolgálja ki a vezérlést.
A tutorial végére az NVIDIA szerint egy továbbtanított Cosmos 3 Edge manipulációs policy állítható elő, amely Jetson Thoron fut, zárt hurkú szimulációban értékelhető, képes robotakciók előrejelzésére, WebSocket policy szerveren keresztüli kiszolgálásra, valamint visszalépő horizontú vezérlési ciklusban történő inferenciára.
Késleltetés, memória és valós idejű működés
Az NVIDIA két gyakorlati korlátot emel ki a fizikai robotokon futó világmodelleknél: az eszköz memóriáját és a vezérlési késleltetést. A modellnek és a futásidejű állapotának el kell férnie a robot memóriájában, az inferencia teljes folyamatának pedig elég gyorsnak kell lennie a szükséges vezérlési frekvenciához.
A vállalat szerint a Cosmos 3 Edge továbbtanítása ezekre a korlátokra ad választ. A kapott policy modell elfér a Jetson Thor memóriájában, ezért az inferencia közvetlenül a roboton fut, adatközponti GPU nélkül. NVIDIA Jetson AGX Thor T5000 rendszeren a DROID action policy egy akciócsomagot körülbelül 1,53 másodperc alatt generál, 640×540 felbontás és 15 Hz mellett. Egy akciócsomag nagyjából 2,13 másodpercnyi robotmozgást fed le.
Az NVIDIA leírása alapján a következő akciócsomag elkészül, mielőtt az aktuális mozgás véget érne, így a robotkar folyamatosan mozoghat. A policy akciócsomagokat generál, és minden inferenciaciklus után újratervez, nem minden egyes megfigyelés után. Zárt hurkú RoboLab feladatokon a továbbtanított policy 22,9 százalékos sikerességet ért el 120, nyelvi utasítással feltételes manipulációs feladaton.
Milyen adaton tanították tovább a modellt?
A bemutatott policy a nvidia/Cosmos3-DROID adatkészleten tanul. A forrás szerint ez 76k sikeres, távműködtetéssel rögzített trajektóriát tartalmaz, körülbelül 350 órányi adatot 86 feladaton és 564 jeleneten keresztül. Az adatokat Franka Panda karral és Robotiq megfogóval gyűjtötték.
Az adatkészlet LeRobotDataset v3.0 formátumban érhető el, 640 × 360 felbontással. Az NVIDIA három előkészítési lépést ír le: az üresjárati és nem feladathoz tartozó képkockák szűrését, a sikeres demonstrációk kiválasztását, valamint tanítás közben véletlenszerű vágás, átméretezés és színjitter alkalmazását.
A saját robotadat használatához a forrás szerint az adatokat LeRobot Dataset v3 formátumba kell konvertálni, képkockánkénti kameravideóval, ízületi állapotokkal, megfogóállapottal, akciókkal és feladatutassítással. DROID-szerű Franka beállításnál a fő változás az adatkészlet útvonala, eltérő robotfelépítésnél saját kísérleti konfiguráció kell az akciótérhez, a dimenziókhoz, a kamerák elrendezéséhez és a normalizálási beállításokhoz. A Cosmos 3 több robotfelépítést támogat, köztük dual-arm Franka, UR, WidowX 250 és LeRobot SO101 rendszereket.
Nagy számítási igényű továbbtanítás
Az NVIDIA hangsúlyozza, hogy itt alapmodell továbbtanításáról van szó, nem egyetlen GPU-n futó finomhangolásról. A validált futtatás 64 csomópontot használt, csomópontonként 4× GB200-zal, 60K iteráción keresztül. Ez körülbelül 68 órát, illetve nagyjából 17,4K GB200-órát jelent.
A megadott előfeltételek között szerepel a legfrissebb Cosmos framework kiadás, validált tanítóhardverként NVIDIA DGX Station NVIDIA GB200 Grace Blackwell Superchip vagy NVIDIA GB300 Grace Blackwell Ultra Desktop Superchip rendszerrel, továbbá CUDA 13.0, az NGC 26.06-py3 konténerverzió, hozzáférés a Cosmos 3 Edge alap checkpointjához, a Cosmos3-DROID adatkészlethez és egy Hugging Face hozzáférési token.
A konfiguráció szerint a modell inicializálása Cosmos3 Edge checkpointból történik, az akciótér 8 dimenziós abszolút joint_pos, 7 ízülettel és megfogóval. Az állapotban a propriocepció engedélyezett, a megfigyelés háromkamerás vászon: 360×640-es csuklókamera két 180×320-as külső nézettel, összesen 540×640-es elrendezésben. Egy előrejelzés 32 jövőbeli akciót ad 15 Hz mellett. A tanulási ráta 2e-4, a globális batch 8192, az ütemezés long-cosine decay 100K ciklussal, 10K iterációs futáson, 1K-nkénti checkpointtal.
Mit jelent ez a felhasználóknak és a robotikai piacnak?
A bejelentés fő üzenete, hogy az NVIDIA szerint egy 4B méretű világ-alapmodell gyakorlati, valós idejű, helyben futó robotikai policy gerincként használható. A modell körülbelül 9 GB BF16 súllyal elfér a Thor fedélzeti memóriájában, így a policy szerver és a vezérlő kliens is a roboton fut.
A fejlesztők számára a Cosmos framework nyílt cosmos-framework tárolója reprodukálható továbbtanítási és telepítési szkripteket ad. A kiadott checkpoint HuggingFace-en érhető el, a deployment oldalon pedig a policyt egy WebSocket policy server szolgálja ki OpenPI protokollon keresztül, amelyet a DROID policy ökoszisztémában is használnak. A kliens megfigyelési szótárat küld, a szerver akciócsomagot ad vissza.
A forrás alapján ez azoknak lehet fontos, akik a robotvezérlést közvetlenül a roboton akarják futtatni, és a felhős vagy adatközponti GPU-s kiszolgálást ki akarják venni a vezérlési hurokból. A közölt eredmények ugyanakkor zárt hurkú RoboLab értékelésből és a megadott DROID-alapú beállításból származnak, ezért a használatot a saját robotfelépítéshez és adatokhoz külön konfigurálni kell.
NVIDIA Developer: Post-Train NVIDIA Cosmos 3 Edge for On-Device Robot Control


