Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A fizikai MI következő lépése az aktív érzékelés lehet

2026. október 2. 00:37Forrás: Lambda
A fizikai MI következő lépése az aktív érzékelés lehet
Kép: Lambda

A fizikai világban működő mesterséges intelligenciának nem elég valósághű jövőképeket generálnia. A Lambda szerint az ilyen rendszereknek fel kell ismerniük a bizonytalanságot, új információt kell gyűjteniük, majd a következmények alapján módosítaniuk kell a terveiket.

A lényeg röviden
  • A vizuálisan hihető generált videó nem garantál végrehajtható robotikus viselkedést.
  • A GEM-4D szerzői 61 százalékról 81 százalékra javuló manipulációs sikerarányról számoltak be.
  • A SAW-Bench 24 modellnél 37,66 százalékos különbséget mért az emberekhez képest.
  • Az aktív érzékelés lehetővé teszi, hogy a rendszer célzottan új információt gyűjtsön.
  • A fizikai MI működési ciklusa az érzékelést, a tervezést és a cselekvést folyamatos körbe kapcsolja.

A valósághű videó önmagában kevés

A generatív MI fejlődésével az image modellek egyre élethűbb jeleneteket hoznak létre, a videómodellek pedig összetett, időben változó mozgásokat képesek megjeleníteni. A világmodellek ennél tovább mennek, a geometria, a mozgás és az interakciók megragadására törekednek.

A Lambda október 1-jei beszámolója szerint azonban egy fizikai környezetben működő rendszernek ennél többre van szüksége. A RoboWM-Bench azt vizsgálja, hogy a videó-világmodellek által generált jelenetekből származtatott manipulációs viselkedések képesek-e valódi feladatokat végrehajtani. A benchmark eredményei alapján a vizuálisan hihető videók mögött is állhat hibás térbeli következtetés, bizonytalan kontaktusjóslás vagy fizikailag következetlen deformáció.

A GEM-4D a geometriai következetességet erősíti sűrű, négydimenziós megfeleltetési felügyelettel egy videó-világmodellben. A szerzők szerint az erre épülő megközelítés a valós manipulációs sikerarányt 61 százalékról 81 százalékra javította. A rendszer egy inverz dinamikai modullal alakítja a generált lefutásokat végrehajtható, hat szabadságfokú robotpályákká.

A rendszernek azt is tudnia kell, mit érzékeljen

A fizikai MI számára a jelenlegi helyzet megértése önmagában is nehéz. A SAW-Bench 786 valós, nézőpontfüggő videót és 2071, emberek által felcímkézett kérdést tartalmaz hat, helyzethez kötött tudatossági feladattal. A Lambda által ismertetett eredmények szerint 24 vizsgált modell esetében a legjobban teljesítő modell és az emberek közötti különbség 37,66 százalék volt.

Az elemzés szerint a modellek részleges geometriai jeleket fel tudnak használni, mégis nehézséget okoz számukra az egységes, a megfigyelő nézőpontjához kötött térbeli kép kialakítása. Egy robotnak ugyanis nem elvont, külső nézőpontból kell értelmeznie a környezetet, hanem saját helyzetéhez, mozgásához és lehetséges cselekvéseihez viszonyítva.

Innen következik az aktív érzékelés szerepe. Ha egy tárgy részben takarásban van, a robot megváltoztathatja a kamera nézőpontját, más szögből vizsgálhatja meg az objektumot, vagy eldöntheti, hogy egy újabb kép helyett tapintási információra van szüksége. Az érzékelés így a döntéshozatal részévé válik.

A generálás bekerül a cselekvési körbe

A Lambda által társszervezett és támogatott, CVPR 2026-os WMAS workshop a világmodellek, az aktív érzékelés és a zárt hurkú tervezés kapcsolatát vizsgálta. A rendezvényen a generatív modellezés, a számítógépes látás, a robotika és a megtestesített MI kutatói találkoztak. Az eseményen 20 elfogadott tanulmányt mutattak be, többek között világmodellekről, robotikai szabályozásról, multimodális vezérlésről és értékelésről.

A bemutatott megközelítések egy folyamatos ciklust írnak le: érzékelés, megértés, előrejelzés, tervezés, cselekvés, majd ismételt érzékelés. A világmodell lehetséges jövőket jelenít meg, az aktív érzékelés kijelöli a következő hasznos információt, a szabályozási rendszer pedig kiválasztja a következő műveletet.

Ez a fizikai MI szempontjából azt jelenti, hogy a generált jövőkép nem feltétlenül a rendszer végső kimenete. Köztes reprezentációként is szolgálhat, amely segít mérlegelni a lehetséges következményeket és kiválasztani a következő lépést. A Lambda szerint a kutatási irány célja olyan rendszerek kialakítása, amelyek nemcsak modellezik a fizikai világot, hanem információt keresnek, érvelnek róla és cselekszenek benne.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A Sanctuary AI módszere felgyorsítja a robotok tanulását
Kutatás2026. október 2. 22:17

A Sanctuary AI módszere felgyorsítja a robotok tanulását

A Sanctuary AI TIGER nevű módszere sűrű jutalmazási jelet ad a robotoknak a megerősítéses tanulás során, így a rendszer a tesztelt feladatokon 20-57 százalékkal kevesebb…

A világ modellezésétől az aktív robotokig lépne a fizikai AI
Kutatás2026. október 2. 00:37

A világ modellezésétől az aktív robotokig lépne a fizikai AI

A fizikai környezetben működő mesterséges intelligenciának az élethű világmodellezés mellett azt is tudnia kell, mikor van szüksége új információra, hogyan tervezzen, és…

A Lambda térbeli gondolkodásra tanított multimodális modellt mutatott be
Kutatás2026. szeptember 24. 21:58

A Lambda térbeli gondolkodásra tanított multimodális modellt mutatott be

A Lambda és a UC San Diego kutatói olyan multimodális modellt fejlesztettek, amely 3D környezetekben próbálja egyszerre felismerni a feladat szempontjából fontos…