Az Apple 829 órányi videóval tanítaná ügyesebb robotkezeket

Az Apple bemutatta az EgoDex nevű, nyílt forrású adatbázist és benchmarkot, amely 829 órányi, emberi kézmozdulatokat rögzítő, nézőponti videót tartalmaz. A kutatók 194 háztartási feladaton vizsgálták, hogyan tanulhatják meg a robotok az ügyes tárgymozgatást.
- Az EgoDex 829 órányi egocentrikus videót tartalmaz.
- A felvételekhez rögzítés közbeni 3D kéz- és ujjkövetési adatok társulnak.
- Az adatbázis 194, hétköznapi tárgyakkal végzett asztali feladatot fed le.
- A kutatók kézpálya-előrejelző utánzásos tanulási rendszereket és benchmarkot is készítettek.
- Az Apple az EgoDexet nyílt forrású adatbázisként és mérési rendszerként mutatja be.
A robotikai tanulás egyik szűk keresztmetszete az adat
Az Apple kutatói szerint a tárgyak ügyes, kézzel végzett mozgatásának utánzásos tanulását régóta akadályozza az adatok hiánya. A természetes nyelv és a kétdimenziós számítógépes látás területén nagy internetes adathalmazok állnak rendelkezésre, a kézügyességet igénylő manipulációhoz azonban nincs hasonló méretű korpusz.
A kutatók ezért az emberi nézőpontból rögzített videókat vizsgálták lehetséges adatforrásként. Ez a videótípus passzívan, nagy léptékben gyűjthető, a meglévő nagyméretű adatbázisok, például az Ego4D azonban nem rendelkeznek natív kéztartás-annotációkkal, és nem kifejezetten a tárgyak mozgatására összpontosítanak.
829 óra videó, rögzítés közbeni 3D kézkövetéssel
Az EgoDex adatbázisát Apple Vision Pro használatával gyűjtötték. A csomag 829 órányi, egocentrikus, vagyis a viselő nézőpontjából készült videót tartalmaz, a felvételekhez pedig a rögzítés időpontjában párosított 3D kéz- és ujjkövetési adatok társulnak.
A rendszer több kalibrált kamerát és eszközön futó SLAM-ot használ. A forrás szerint ez lehetővé teszi minden egyes kéz ízületének pontos pózkövetését. Az Apple kutatói az EgoDexet az eddigi legnagyobb és legváltozatosabb, ügyes emberi tárgymozgatást bemutató adathalmazként írják le.
A felvételek hétköznapi háztartási tárgyakkal végzett műveleteket mutatnak be. A feladatok között szerepel a cipőfűző megkötése és a ruhák összehajtása is. Az adatbázis összesen 194 különböző, asztalon végzett feladatot fed le.
Tanulási feladatokkal és mérési rendszerrel egészül ki
A kutatók nem csak videógyűjteményként készítették el az EgoDexet. Az adathalmazon utánzásos tanulási szabályzatokat, vagyis a robot viselkedését meghatározó tanuló modelleket képeztek ki és rendszerszerűen értékeltek a kéz pályájának előrejelzésére.
A munkához mérőszámokat és benchmarkokat is bevezettek. Ezek a kézmozgás-előrejelző rendszerek fejlődésének összehasonlítható mérését szolgálják. A benchmark különösen olyan kutatásokhoz adhat közös kiindulópontot, amelyek robotikai, számítógépes látási és alapmodell-alapú megoldásokat vizsgálnak.
Az Apple kutatói az EgoDexet nyílt forrású, nagyméretű egocentrikus videós adatbázisként és benchmarkként teszik közzé. A tanulmány címe EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video, szerzői Ryan Hoque, Peide Huang, David J. Yoon, Mouli Sivapurapu és Jian Zhang. Hoque, Huang és Yoon egyenlő mértékben járultak hozzá a munkához. Az Apple kutatási oldala a tanulmányt 2025 júliusában publikált anyagként jelöli.
Mit jelent ez a felhasználóknak és a kutatóknak?
Az EgoDex közvetlenül a robotok kézügyességének tanításához szükséges adathiányra kínál kutatási alapot. A videó és a rögzítéskor felvett 3D kéz- és ujjkövetés együtt részletesebb kapcsolatot teremt az emberi mozdulatok és az előrejelzendő kézpályák között, mint egy olyan videó, amelyhez nem tartozik natív kézpozíció-adat.
A nyílt adatbázis és a hozzá tartozó benchmark lehetőséget ad a különböző utánzásos tanulási módszerek összevetésére. Az Apple célja szerint a közzététel a robotika, a számítógépes látás és az alapmodellek kutatásának további fejlődését segítheti.


