Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Google új robotikai modellje videóból követi a feladatok haladását

2026. július 30. 17:00Forrás: Google DeepMind
A Google új robotikai modellje videóból követi a feladatok haladását
Kép: Google DeepMind

A Google DeepMind bemutatta a Gemini Robotics ER 2 modellt, amely a robotok magas szintű irányítójaként valós idejű térbeli következtetésre, több lépés megtervezésére és több robot együttműködésére szolgál. A modell a Gemini API-n és a Google AI Studio felületén már elérhető a fejlesztők számára.

A lényeg röviden
  • A Gemini Robotics ER 2 több lépésből álló robotikai feladatokat tervez és hangol össze.
  • Folyamatos videó alapján követi a feladatok előrehaladását, és hibák esetén módosíthatja a működését.
  • A modell több, eltérő típusú robot együttműködését is támogatja.
  • A Google mérése szerint a pillanatfelismerési pontossága 91,3 százalék.
  • A fejlesztők a Gemini API-n és a Google AI Studio-ban férhetnek hozzá.

Videó alapján követi a feladatok állapotát

A Google DeepMind július 30-i bejelentése szerint a Gemini Robotics ER 2 a vállalat eddigi legfejlettebb, robotikai célú „testet öltött következtetési” modellje. A rendszer magas szintű agyként működik: képes emberekkel kommunikálni, értelmezni a fizikai környezetet, majd több lépésből álló feladatokat tervezni. A tényleges mozgás végrehajtását az adott, alacsonyabb szintű látásnyelvi cselekvési modellre, vagyis VLA-modellre bízza.

A Gemini Robotics ER 2 folyamatos videófolyamot is képes figyelni. Így követheti a saját előrehaladását, felismerheti, ha valami rosszul sikerült, és szükség esetén újrapróbálhat egy lépést a teljes munkafolyamat újrakezdése nélkül. A Google példái között szerepel egy villanykörte becsavarása és egy szemeteszsák megkötése, amelyeknél a modellnek azt is ellenőriznie kell, hogy a feladat valóban az előírásoknak megfelelően készült-e el.

Eszközöket hangol össze, és robotokat kapcsol össze

A fejlesztők alacsony szintű vezérlőfelületeket, például VLA-modelleket vagy navigációs programozási felületeket adhatnak meg eszközként. A modell multimodális videó-, hang- és szövegbemenetet fogad, és olyan eszközöket is használhat, mint a Google Search vagy egy fejlesztő által megadott saját függvény. A Google szerint az ER 2 az ER 1.6 modellnél jobban teljesít az eszközök összehangolásában valós VLA-, szimulációs VLA- és távoli emberi vezérléses környezetben.

A rendszer a Gemini Live API kétirányú adatfolyamához is kapcsolódik, amelyet a késleltetésre érzékeny feladatokhoz optimalizáltak. A Google egy Boston Dynamics által készített Spot robottal mutatta be a működést. A bemutatóban a Gemini Robotics ER 2 a Spot navigációs és manipulátormozgató programozási felületeit hangolta össze, így a robot természetes nyelvi utasításra egy tárgyat, például egy pattogatott kukoricát, hozott oda.

A Gemini Robotics ER 2 több, eltérő képességű robot együttműködését is támogatja. A Google szerint a gépek közös szemantikai értelmezésen keresztül kommunikálhatnak, átadhatják egymásnak a feladatokat, és olyan összetett munkafolyamatokat is végrehajthatnak, amelyekhez egyetlen robot nem lenne elegendő. A vállalat az Apptronik Apollo 2 és a Franka F3 Duo együttműködését is bemutatja.

Mérési eredmények és fejlesztői hozzáférés

A Google értékeléseiben a modell a videó egyes képkockáihoz öt előrehaladási szintet rendelt, 0 és 20, 20 és 40, 40 és 60, 60 és 80, valamint 80 és 100 százalék között. A Gemini Robotics ER 2 ezen a feladaton 57,4 százalékos pontosságot ért el. A kritikus esemény pontos időpontjának megkeresésében 91,3 százalékos pontosságot és 0,96 másodperces átlagos abszolút eltérést mért a Google. A vállalat szerint a modell ezt a pontosságot a nagyobb modellkategóriákhoz hasonlóan, a számítási költség töredékével és négyszeres végrehajtási sebességgel nyújtja.

A rendszer a Google szerint a siker vagy kudarc felismerését már nyers videófolyamokon is végzi, képes digitális kijelzők, lineáris skálák, vonalzók és folyadékhőmérők leolvasására, és javítja a vizuális kérdésválaszolást. A vállalat biztonsági tesztjein a modell megállította a humanoid robotot, amikor ember került a közelébe, majd csak a terület szabaddá válása után folytatta a munkát.

A Gemini Robotics ER 2 a Gemini API-n és a Google AI Studio-ban érhető el nyilvánosan a fejlesztőknek. A Gemini Enterprise Agent Platformon privát előzetes hozzáférésben használható. A Google konfigurációs és promptolási példákat is közzétett fizikai mesterségesintelligencia-ügynökök építéséhez.

Kapcsolódó hírek

Új Gemini hangmodellek érkeztek egyedi beszédhangokhoz
Modellek2026. szeptember 23. 17:25

Új Gemini hangmodellek érkeztek egyedi beszédhangokhoz

Két új szövegfelolvasó modellel bővül a Gemini család: a Gemini 3.8 Flash TTS a kreatív hangtervezésre, a Gemini 3.8 Flash-Lite TTS pedig nagy volumenű használatra…

Kevesebb tokennel elemez videókat a Gemini új agentic funkciója
Termékek és eszközök2026. szeptember 1. 19:08

Kevesebb tokennel elemez videókat a Gemini új agentic funkciója

A Google DeepMind 2026. szeptember 1-jén bemutatta az agentic video understanding nevű új Gemini képességet. A funkció a Gemini 3.7 Flash, 3.6 Flash és 3.5 Flash-Lite…

Megjelent a Gemini Omni 1.1 Flash, több kontrollt kapnak a videós fejlesztők
Termékek és eszközök2026. augusztus 27. 18:11

Megjelent a Gemini Omni 1.1 Flash, több kontrollt kapnak a videós fejlesztők

A Google DeepMind 2026. augusztus 27-én bemutatta a Gemini Omni 1.1 Flash modellt, amely fejlesztőknek szánt, éles használatra kész frissítés a generatív videóhoz. Az…