A Google új robotikai modellje videóból követi a feladatok haladását

A Google DeepMind bemutatta a Gemini Robotics ER 2 modellt, amely a robotok magas szintű irányítójaként valós idejű térbeli következtetésre, több lépés megtervezésére és több robot együttműködésére szolgál. A modell a Gemini API-n és a Google AI Studio felületén már elérhető a fejlesztők számára.
- A Gemini Robotics ER 2 több lépésből álló robotikai feladatokat tervez és hangol össze.
- Folyamatos videó alapján követi a feladatok előrehaladását, és hibák esetén módosíthatja a működését.
- A modell több, eltérő típusú robot együttműködését is támogatja.
- A Google mérése szerint a pillanatfelismerési pontossága 91,3 százalék.
- A fejlesztők a Gemini API-n és a Google AI Studio-ban férhetnek hozzá.
Videó alapján követi a feladatok állapotát
A Google DeepMind július 30-i bejelentése szerint a Gemini Robotics ER 2 a vállalat eddigi legfejlettebb, robotikai célú „testet öltött következtetési” modellje. A rendszer magas szintű agyként működik: képes emberekkel kommunikálni, értelmezni a fizikai környezetet, majd több lépésből álló feladatokat tervezni. A tényleges mozgás végrehajtását az adott, alacsonyabb szintű látásnyelvi cselekvési modellre, vagyis VLA-modellre bízza.
A Gemini Robotics ER 2 folyamatos videófolyamot is képes figyelni. Így követheti a saját előrehaladását, felismerheti, ha valami rosszul sikerült, és szükség esetén újrapróbálhat egy lépést a teljes munkafolyamat újrakezdése nélkül. A Google példái között szerepel egy villanykörte becsavarása és egy szemeteszsák megkötése, amelyeknél a modellnek azt is ellenőriznie kell, hogy a feladat valóban az előírásoknak megfelelően készült-e el.
Eszközöket hangol össze, és robotokat kapcsol össze
A fejlesztők alacsony szintű vezérlőfelületeket, például VLA-modelleket vagy navigációs programozási felületeket adhatnak meg eszközként. A modell multimodális videó-, hang- és szövegbemenetet fogad, és olyan eszközöket is használhat, mint a Google Search vagy egy fejlesztő által megadott saját függvény. A Google szerint az ER 2 az ER 1.6 modellnél jobban teljesít az eszközök összehangolásában valós VLA-, szimulációs VLA- és távoli emberi vezérléses környezetben.
A rendszer a Gemini Live API kétirányú adatfolyamához is kapcsolódik, amelyet a késleltetésre érzékeny feladatokhoz optimalizáltak. A Google egy Boston Dynamics által készített Spot robottal mutatta be a működést. A bemutatóban a Gemini Robotics ER 2 a Spot navigációs és manipulátormozgató programozási felületeit hangolta össze, így a robot természetes nyelvi utasításra egy tárgyat, például egy pattogatott kukoricát, hozott oda.
A Gemini Robotics ER 2 több, eltérő képességű robot együttműködését is támogatja. A Google szerint a gépek közös szemantikai értelmezésen keresztül kommunikálhatnak, átadhatják egymásnak a feladatokat, és olyan összetett munkafolyamatokat is végrehajthatnak, amelyekhez egyetlen robot nem lenne elegendő. A vállalat az Apptronik Apollo 2 és a Franka F3 Duo együttműködését is bemutatja.
Mérési eredmények és fejlesztői hozzáférés
A Google értékeléseiben a modell a videó egyes képkockáihoz öt előrehaladási szintet rendelt, 0 és 20, 20 és 40, 40 és 60, 60 és 80, valamint 80 és 100 százalék között. A Gemini Robotics ER 2 ezen a feladaton 57,4 százalékos pontosságot ért el. A kritikus esemény pontos időpontjának megkeresésében 91,3 százalékos pontosságot és 0,96 másodperces átlagos abszolút eltérést mért a Google. A vállalat szerint a modell ezt a pontosságot a nagyobb modellkategóriákhoz hasonlóan, a számítási költség töredékével és négyszeres végrehajtási sebességgel nyújtja.
A rendszer a Google szerint a siker vagy kudarc felismerését már nyers videófolyamokon is végzi, képes digitális kijelzők, lineáris skálák, vonalzók és folyadékhőmérők leolvasására, és javítja a vizuális kérdésválaszolást. A vállalat biztonsági tesztjein a modell megállította a humanoid robotot, amikor ember került a közelébe, majd csak a terület szabaddá válása után folytatta a munkát.
A Gemini Robotics ER 2 a Gemini API-n és a Google AI Studio-ban érhető el nyilvánosan a fejlesztőknek. A Gemini Enterprise Agent Platformon privát előzetes hozzáférésben használható. A Google konfigurációs és promptolási példákat is közzétett fizikai mesterségesintelligencia-ügynökök építéséhez.


