A patchenkénti skalár gyorsabb robotnavigációt tehet lehetővé

A NAVER LABS Europe nagyszabású vizsgálatban elemezte, milyen vizuális információkra van szüksége egy gyorsan mozgó robotnak a valós környezetben végzett navigációhoz. A kutatók 966 navigációs epizódot futtattak le egy épületben, összesen 24 kilométeren.
- 966 navigációs epizódot futtattak le egy valós épületben.
- A gyorsan mozgó robot összesen 24 kilométert tett meg a kísérletek során.
- Előre betanított ViT-alapú vizuális kódolókat hasonlítottak össze.
- Több tanármodell tudását és térben szűkített vizuális információt is vizsgáltak.
- A kutatást a 2026-os ECCV konferencián mutatják be.
Valós környezetben tesztelték a vizuális modelleket
A kutatás középpontjában az előre betanított vizuális kódolók álltak. Ezek jellemzően Vision Transformer, vagyis ViT-alapú rendszerek, amelyek a robotikai irányítási rendszerek számítógépes látási komponenseként szolgálnak. A tanulmány szerint az ilyen kódolók teljesítményét nem kizárólag a robotikai feladatokra épülő tanítás határozza meg.
A NAVER LABS Europe kutatói azt vizsgálták, hogy a számítógépes látás különböző előtanítási feladatai milyen hatással vannak a robotok teljesítményére. A kísérletben korszerű vizuális kódolókat értékeltek valós körülmények között, köztük olyan modelleket is, amelyeket általános számítógépes látási feladatokban használnak.
A vizsgálatot Steeven Janny, Leonid Antsfeld és Christian Wolf jegyzi. A tanulmányt 2026. szeptember 8-án publikálták, és a 19. European Conference on Computer Vision konferencián mutatják be Malmöben, szeptember 8. és 12. között.
Több tanármodellt és szűkített információt is vizsgáltak
A kutatás egyik iránya a heterogén, több tanármodellre épülő tudásátadás volt. Ennek célja olyan vizuális kódolók létrehozása, amelyek több, egymást kiegészítő képességet egyesítenek. A kutatók emellett azt is elemezték, hogy a robotikának valójában mekkora mennyiségű információra van szüksége ezekből a kódolókból.
Ezt az információt egy elvi alapon kialakított, térben hasznos szűk keresztmetszettel korlátozták. A leírás szerint ennek során értelmezhető, a környezetben elérhető cselekvési lehetőségekhez kapcsolódó jellemzők jelentek meg. A tanulmány címe is erre a megközelítésre utal, amely minden képponthoz vagy képrészlethez egy skaláris értéket társít.
A kutatók azt is megállapításként mutatják be, hogy a kizárólag RGB-adatokon tanított irányítási stratégiák nem használják feltétlenül optimálisan a vizuális jellemzőket. Ennek vizsgálatára olyan stratégiákat finomhangoltak, amelyeket korábban többletinformációt, úgynevezett privilegizált információt használó adatokon tanítottak.
A módszer a robotok önálló tájékozódását célozza
A NAVER LABS Europe kutatása a valós épületekben közlekedő, gyorsan mozgó robotok navigációjára összpontosít. A vállalat robotikai kutatási területei között szerepel a környezet vizuális érzékelése, a gépi tanulás, az adaptív tervezés és az irányítás bizonytalan környezetben.
A vizuális komponensek feladata, hogy segítsenek a robotoknak felismerni környezetük szerkezetét, tárgyait és az embereket. A kutatás eredményei ezért ahhoz járulhatnak hozzá, hogy pontosabban meghatározható legyen, milyen látási képességekre van szükség az önálló navigációhoz, és hogyan lehet ezeket a képességeket robotikai rendszerekben felhasználni.
A tanulmány a NAVER LABS Europe szerint teljesebb képet ad arról, hogy a számítógépes látás mely elemei relevánsak a valós környezetben végzett navigációhoz. A vizsgálat nem egyetlen modell teljesítményét állítja a középpontba, hanem a vizuális reprezentációk, a többletinformáció és az információ térbeli szűrésének szerepét elemzi.
NAVER LABS Europe: A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world


