Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A patchenkénti skalár gyorsabb robotnavigációt tehet lehetővé

2026. szeptember 8. 16:42Forrás: NAVER LABS Europe
A patchenkénti skalár gyorsabb robotnavigációt tehet lehetővé
Kép: NAVER LABS Europe

A NAVER LABS Europe nagyszabású vizsgálatban elemezte, milyen vizuális információkra van szüksége egy gyorsan mozgó robotnak a valós környezetben végzett navigációhoz. A kutatók 966 navigációs epizódot futtattak le egy épületben, összesen 24 kilométeren.

A lényeg röviden
  • 966 navigációs epizódot futtattak le egy valós épületben.
  • A gyorsan mozgó robot összesen 24 kilométert tett meg a kísérletek során.
  • Előre betanított ViT-alapú vizuális kódolókat hasonlítottak össze.
  • Több tanármodell tudását és térben szűkített vizuális információt is vizsgáltak.
  • A kutatást a 2026-os ECCV konferencián mutatják be.

Valós környezetben tesztelték a vizuális modelleket

A kutatás középpontjában az előre betanított vizuális kódolók álltak. Ezek jellemzően Vision Transformer, vagyis ViT-alapú rendszerek, amelyek a robotikai irányítási rendszerek számítógépes látási komponenseként szolgálnak. A tanulmány szerint az ilyen kódolók teljesítményét nem kizárólag a robotikai feladatokra épülő tanítás határozza meg.

A NAVER LABS Europe kutatói azt vizsgálták, hogy a számítógépes látás különböző előtanítási feladatai milyen hatással vannak a robotok teljesítményére. A kísérletben korszerű vizuális kódolókat értékeltek valós körülmények között, köztük olyan modelleket is, amelyeket általános számítógépes látási feladatokban használnak.

A vizsgálatot Steeven Janny, Leonid Antsfeld és Christian Wolf jegyzi. A tanulmányt 2026. szeptember 8-án publikálták, és a 19. European Conference on Computer Vision konferencián mutatják be Malmöben, szeptember 8. és 12. között.

Több tanármodellt és szűkített információt is vizsgáltak

A kutatás egyik iránya a heterogén, több tanármodellre épülő tudásátadás volt. Ennek célja olyan vizuális kódolók létrehozása, amelyek több, egymást kiegészítő képességet egyesítenek. A kutatók emellett azt is elemezték, hogy a robotikának valójában mekkora mennyiségű információra van szüksége ezekből a kódolókból.

Ezt az információt egy elvi alapon kialakított, térben hasznos szűk keresztmetszettel korlátozták. A leírás szerint ennek során értelmezhető, a környezetben elérhető cselekvési lehetőségekhez kapcsolódó jellemzők jelentek meg. A tanulmány címe is erre a megközelítésre utal, amely minden képponthoz vagy képrészlethez egy skaláris értéket társít.

A kutatók azt is megállapításként mutatják be, hogy a kizárólag RGB-adatokon tanított irányítási stratégiák nem használják feltétlenül optimálisan a vizuális jellemzőket. Ennek vizsgálatára olyan stratégiákat finomhangoltak, amelyeket korábban többletinformációt, úgynevezett privilegizált információt használó adatokon tanítottak.

A módszer a robotok önálló tájékozódását célozza

A NAVER LABS Europe kutatása a valós épületekben közlekedő, gyorsan mozgó robotok navigációjára összpontosít. A vállalat robotikai kutatási területei között szerepel a környezet vizuális érzékelése, a gépi tanulás, az adaptív tervezés és az irányítás bizonytalan környezetben.

A vizuális komponensek feladata, hogy segítsenek a robotoknak felismerni környezetük szerkezetét, tárgyait és az embereket. A kutatás eredményei ezért ahhoz járulhatnak hozzá, hogy pontosabban meghatározható legyen, milyen látási képességekre van szükség az önálló navigációhoz, és hogyan lehet ezeket a képességeket robotikai rendszerekben felhasználni.

A tanulmány a NAVER LABS Europe szerint teljesebb képet ad arról, hogy a számítógépes látás mely elemei relevánsak a valós környezetben végzett navigációhoz. A vizsgálat nem egyetlen modell teljesítményét állítja a középpontba, hanem a vizuális reprezentációk, a többletinformáció és az információ térbeli szűrésének szerepét elemzi.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Syn4D: új szintetikus adatkészlet segítheti a dinamikus 3D-s kutatásokat
Kutatás2026. szeptember 8. 16:19

Syn4D: új szintetikus adatkészlet segítheti a dinamikus 3D-s kutatásokat

A NAVER LABS Europe bemutatta a Syn4D nevű, dinamikus jelenetekhez készült multinézetű szintetikus 4D-adatkészletet. A kutatók szerint az adatbázis a 3D-s rekonstrukció…

Whareformer: így követi a robot szemszögéből eltűnő tárgyakat
Kutatás2026. szeptember 8. 15:26

Whareformer: így követi a robot szemszögéből eltűnő tárgyakat

A NAVER LABS Europe bemutatta a Whareformer nevű, transzformer-alapú modellt, amely hosszú, viselői nézőpontból rögzített videókban követi a tárgyakat akkor is, ha azok…

A NAVER LABS Europe új módszere képekből gyorsítja a 3D rekonstrukciót
Kutatás2026. szeptember 8. 14:15

A NAVER LABS Europe új módszere képekből gyorsítja a 3D rekonstrukciót

A NAVER LABS Europe bemutatta a BLASt3R nevű módszert, amely többnézetű képegyeztetést és egyképes becsléseket használ a 3D rekonstrukció és a robotok vizuális…