A LiveKit több szereplős architektúrát kínál robotikai rendszerekhez

A LiveKit olyan robotikai architektúrákat mutatott be, amelyekben a robot, több mesterségesintelligencia-modell, emberi operátor és adatrögzítő ugyanahhoz a valós idejű munkamenethez csatlakozik. A megközelítés célja, hogy az egyes résztvevők csak a számukra szükséges video-, hang- és adatfolyamokat kapják meg.
- A LiveKit Room robotokat, modelleket, operátorokat és rögzítőket kapcsolhat össze.
- A résztvevők csak a működésükhöz szükséges adatfolyamokra iratkoznak fel.
- A VLM feladatszinten koordinálhat több különálló robotikai szabályozót.
- A Portal szinkronizálja a robot video- és állapotadatait.
- A vezérlési jogosultság a feladat egyes szakaszaiban másik résztvevőre ruházható át.
Egy Room több résztvevővel
A LiveKit augusztus 18-i mérnöki blogbejegyzése szerint ügyfelei egyre gyakrabban lépnek túl az egyetlen, ponttól pontig működő kapcsolaton. Erre példa, amikor egy rendszer több modellt használ, távoli irányítást támogat, vagy emberi operátort von be a vezérlésbe.
A LiveKit SFU-architektúrájában egy munkamenet Roomként működik. Ehhez új résztvevőként csatlakozhat egy kamera, egy modell, egy operátor vagy egy további szolgáltatás, így nem kell újratervezni az adatátviteli architektúrát. A Room közzétételi és feliratkozási modellt használ. Minden résztvevő video-, hang- és adatfolyamokat tehet közzé, a többiek pedig kiválaszthatják, mely folyamokra iratkoznak fel.
Így egy szabályozó modell például a csuklókamera képét és az ízületi állapotot kaphatja meg, az operátor a felülnézeti kamerát figyelheti, a rögzítő pedig minden adatfolyamhoz hozzáférhet. A robot, a modell, az operátor és a rögzítő közös valós idejű munkamenetben működhet, miközben mindegyikük a saját média-, adat- és vezérlési jeleit kezeli.
Emberi beavatkozás és modellvezérelt feladatok
A LiveKit által bemutatott egyik felállásban négy résztvevő osztozik a Roomon: a robot, a szabályozó modell, az emberi operátor és a rögzítő. A vállalat példája szerint a robot és a modell az Egyesült Államokban, az operátor pedig Mexikóban lehet. A hálózati oda-vissza késleltetés ebben az esetben 60 és 80 milliszekundum között mozoghat, miközben egy 30 Hz-es vezérlőnek vezérlési ciklusonként 33 milliszekunduma van.
A Roomban a robot megfigyelései egyidejűleg juthatnak el a modellhez, az operátorhoz és a rögzítőhöz. A modell műveletei és az emberi beavatkozások egymástól függetlenül térhetnek vissza a robothoz, a rögzítő pedig a vezérlési útvonalon kívül mentheti a szinkronizált adatfolyamokat.
A LiveKit egy olyan példát is ismertet, amelyben egy látás és nyelv alapú modell, egy VLM, feladatszintű koordinátorként működik. Egy természetes nyelvű utasítás, például a kék csatlakozók bal oldali tálcába rendezése, több különálló készséget igényelhet. Ilyen lehet a megfogás, az elhelyezés, a behelyezés, az ellenőrzés és a helyreállítás. A VLM a munkaterület időszakos képét és a feladat állapotát használja a következő készség kiválasztására, miközben az egyes műveleteket különálló szabályozó modellek hajtják végre.
A gyors, alacsony szintű modellek akár másodpercenként több tíz alkalommal dolgozhatnak csuklókamerás képekkel, erőjelekkel és ízületi adatokkal. A VLM ezzel szemben másodpercenkénti felülnézeti képpel, illetve tömör állapotinformációval is működhet, mivel a következő manipulációs lépést választja ki, nem pedig motorparancsokat generál.
Eszkaláció, helyreállítás és vegyes modellek
A LiveKit szerint a VLM nem feltétlenül kerül a vezérlési útvonalba. Míg egy VLM 1 Hz-en frissíthet, egy behelyezési szabályozó és a hozzá tartozó jutalmazó modell 30 Hz-en vagy annál magasabb frekvencián is működhet. A jutalmazó modell olyan adatokat is elemezhet, amelyeket az aktív szabályozó nem használ, például az ízületi áramot, az erőnyomaték-érzékelők jeleit, a végrehajtó sebességét, a parancsolt és mért pozíció eltérését, valamint a felülnézeti kamerát.
A modell rövid állapotokat adhat vissza, például in_progress, success, stuck vagy unsafe. Ha a rendszer elakadást vagy veszélyes állapotot jelez, a robot visszavonhatja a specialista vezérlési jogosultságát, és átadhatja azt egy általánosabb modellnek. A LiveKit leírása szerint ehhez nem kell új következtetési munkamenetet indítani, mivel az általános modell már csatlakozott a Roomhoz, és hozzáfér az aktuális képi, állapot- és feladatkörnyezethez.
A Roomba klasszikus és végponttól végpontig tanított komponensek is beléphetnek. Egy klasszikus tervező térképet, robotpozíciót és célt használhat, majd ütközésmentes pályát tehet közzé. Egy tanult modell kameraképek és propriocepciós adatok alapján hajthat végre olyan helyi manővert, amelyet nehéz analitikus módszerekkel leírni. Egy külön biztonsági résztvevő ellenőrizheti az ízületi határokat, az ütközési távolságot és a munkatér korlátait.
A Portal a robot és az operátor közös szerződése
A bemutatott architektúrák közvetlenül LiveKit Roomokon is felépíthetők. A vállalat ehhez a LiveKit Portalt is kínálja azoknak, akik nem maguk akarják megvalósítani a robotikai szállítási réteget. A Portal közös szerződést biztosít a robot és az operátor között.
A robot kameraképeket és típusos állapotadatokat tesz közzé, majd műveleteket fogad. Az operátor lehet szabályozó modell, távoli irányítási felület, rögzítő vagy más szolgáltatás. Több operátor is csatlakozhat ugyanahhoz a Roomhoz, de a robot csak az aktív operátortól fogad el parancsokat.
A Portal az észlelések szinkronizálását is kezeli. A video- és állapotadatok külön átviteli útvonalakon érkezhetnek, még akkor is, ha ugyanabban a pillanatban készültek. A rendszer a robot monoton órájával látja el őket, a fogadó oldalon puffereli az adatokat, majd összehangolt képkocka-, állapot- és időbélyegcsomagot állít elő. A felek kapcsolódás előtt ugyanazt a sémát deklarálják, így a szabályozó kódnak nem kell külön kezelnie az órák szinkronizálását, a folyamok párosítását vagy az állapotok szerializálását.
LiveKit: Beyond 1:1: multi-participant robotics with LiveKit


