Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A 95 százalékos LIBERO-eredmény nem feltétlenül jelent működő robotot

2026. augusztus 12.Forrás: HumanSignal (Label Studio)
A 95 százalékos LIBERO-eredmény nem feltétlenül jelent működő robotot
Kép: HumanSignal (Label Studio)

A Vision-Language-Action modellek LIBERO-benchmarkon elért 95 százalékos sikerrátája a valós robotikai környezetben könnyen összeomolhat. A HumanSignal elemzése szerint a tesztek gyakran a betanult pályák memorizálását mérik, a bináris értékelés pedig tovább torzíthatja a képet.

A lényeg röviden
  • A LIBERO-Plus tesztjeiben a sikerráta nagyjából 95 százalékról 30 százalék alá esett.
  • A LIBERO-PRO szerint 90 százalék feletti eredmények 0,0 százalékra is visszaeshetnek.
  • A MetaFine alapján a bináris pontozás akár 70 százalékkal is felfújhatja a teljesítményt.
  • Egy adatpoisoning támadás 0,31 százaléknyi módosított epizóddal 98 és 99 százalékos hátsóajtó-sikert ért el.
  • A HumanSignal held-out, részletesen pontozott és ember által ellenőrzött értékelést sürget.

A kis változtatások lenullázhatják a sikert

A HumanSignal augusztus 12-én közzétett bejegyzése a Vision-Language-Action, vagyis VLA-modellek adat- és értékelési problémáit vizsgáló sorozat negyedik része. A vállalat 1228, az arXiv cs.RO kategóriájában megjelent VLA-tanulmányt elemzett, amelyek 2023 februárja és 2026 júniusa között jelentek meg.

A LIBERO a manipulációs VLA-modellek egyik leggyakrabban használt értékelési környezete. A HumanSignal számlálása szerint a vizsgált 1228 tanulmány közül több mint 300 használta a benchmarkot. Ez azért jelent problémát, mert ha ugyanazok a környezetek jelennek meg a tanításban és a tesztelésben, a rendszer megtanulhatja a pályákat és az elrendezéseket anélkül, hogy valóban általánosítható feladatmegértést szerezne.

A 2025-ös LIBERO-Plus tanulmányban a kutatók kisebb változtatásokat vezettek be a standard feladatokon. Módosították többek között a megvilágítást, a kamera szögét és a tárgyak elhelyezését. Az eredmények szerint a sikerráta nagyjából 95 százalékról 30 százalék alá esett. A HumanSignal értelmezése szerint a modellek inkább a benchmarkot tanulták meg, mint magát a feladatot.

A LIBERO-PRO ennél is súlyosabb eltérést talált. A tanulmány szerint a 90 százalék feletti sikerrátát jelentő modellek a módosított körülmények között 0,0 százalékra estek vissza. A szerzők ezt a cselekvéssorozatok és a környezeti elrendezések bemagolásával magyarázták. Ugyanez a kutatás arra is jutott, hogy a modellek figyelmen kívül hagyták a nyelvi utasításokat, és az instrukciótól függetlenül hajtották végre a megtanult sorozatot.

A sikerráta önmagában túl keveset mutat

A HumanSignal szerint a probléma nem csak a tesztkörnyezetek átfedéséből ered. Egy, a VLA-modellek belső működését vizsgáló sparse-autoencoder elemzés arra jutott, hogy a kis adathalmazokon finomhangolt modellek által megtanult jellemzők többsége memorizált tanítási sorozatokhoz kapcsolódik. Ilyenkor a rendszer nem feltétlenül egy általánosítható műveletet, például egy bögre felemelését tanulja meg, hanem azt, hogy egy adott elrendezésben milyen pályát kell kibocsátania.

A mérési módszer is torzíthat. A MetaFine című kutatás szerint a bináris sikerráta akár 70 százalékkal is felfújhatja a teljesítményt a fokozatos értékeléshez képest. A passz vagy bukás típusú pontozás ugyanúgy kezeli azt a próbálkozást, amelyben a robot meg sem mozdította a tárgyat, és azt, amelyben a megfelelő tárgyat megfogta, majd majdnem a célba juttatta.

A mintaelemszám tovább növeli a bizonytalanságot. A forrás szerint a valós robotikai VLA-értékelések jellemzően legfeljebb 25 próbálkozásra épülnek, és gyakran nem közölnek konfidenciaintervallumokat. Ilyen elemszám mellett egy 72 és egy 80 százalékos eredmény közötti különbség a zajon belül lehet. A HumanSignal szerint ennek ellenére a tanulmányok rendszeresen pontos összehasonlításokat és rangsorokat állítanak fel.

A pontatlan értékelés biztonsági kockázatot is jelenthet. Két 2025-ös tanulmány VLA-tanítási adatok ellen irányuló mérgezéses támadásokat mutatott be. Az egyikben a támadó a tanítási epizódok mindössze 0,31 százalékának módosításával 98 és 99 százalék közötti hátsóajtó-sikert ért el.

A HumanSignal szerint így lenne hitelesebb a tesztelés

A HumanSignal négy alapelvet emel ki a megbízható VLA-értékeléshez. Az első a szándékosan módosított, a tanításból kihagyott körülmények használata. Az értékelésben új megvilágításnak, kameraállásoknak, tárgyelrendezéseknek, háttereknek és átfogalmazott utasításoknak kell megjelenniük. A LIBERO-Plus és a LIBERO-PRO éppen ilyen változtatásokat épít be.

A második alapelv a részleges eredmények pontozása. Az értékelésnek külön kell vizsgálnia, hogy a robot elérte-e a tárgyat, megfelelően megfogta-e, végrehajtotta-e a szállítást, és teljesítette-e a célt. Az Eval-Actions ilyen megközelítést alkalmaz, szakértői értékeléssel, rangsorolt preferenciákkal, indoklási nyomokkal, valamint sikeres és sikertelen helyzetekkel.

A harmadik követelmény az elegendő számú próbálkozás és a konfidenciaintervallumok közlése. A negyedik az emberi ellenőrzés. A HumanSignal szerint annak eldöntése, hogy egy robot helyreállt-e egy hibából, részben teljesítette-e a feladatot, vagy két próbálkozás valóban összehasonlítható-e, olyan fizikai ok-okozati ítéletet igényel, amelyet egy általános automatikus értékelő nem feltétlenül tud biztosítani.

A vállalat gyakorlati ellenőrzőlistája szerint a következő benchmarkfutás előtt módosítani kell a megvilágítást, a kamera pozícióját és a tárgyak elhelyezését, majd újra kell futtatni a tesztet. Ezután részleges teljesítményt kell pontozni, a próbálkozások számát és az intervallumokat pedig jelenteni kell. A végső értékelési készletnek a tanításból elkülönített, emberek által ellenőrzött adathalmazként kell elkészülnie.

A megközelítés közvetlenül érinti a felhasználókat és a robotikai fejlesztőket is. Egy magas benchmarkpontszám önmagában nem garantálja, hogy a modell egy kissé eltérő szobában, új tárgyelrendezésben vagy más megfogalmazású utasítással is működik. A HumanSignal szerint a megbízható telepítéshez előbb olyan értékelésre van szükség, amely képes különbséget tenni a memorizálás és a valódi általánosítás között.

Forrás
HumanSignal (Label Studio): Is Your 95% on LIBERO Lying to You?

Kapcsolódó hírek

A világ modellezésétől az aktív robotokig lépne a fizikai AI
Kutatás2026. október 2. 00:37

A világ modellezésétől az aktív robotokig lépne a fizikai AI

A fizikai környezetben működő mesterséges intelligenciának az élethű világmodellezés mellett azt is tudnia kell, mikor van szüksége új információra, hogyan tervezzen, és…

A Label Studio egy felületre hozza a LiDAR-annotáció teljes folyamatát
Termékek és eszközök2026. szeptember 18.

A Label Studio egy felületre hozza a LiDAR-annotáció teljes folyamatát

A HumanSignal olyan LiDAR- és többérzékelős annotációs felületet mutatott be, amely a pontfelhők, a kameraképek, az objektumkövetés és a minőségellenőrzés kezelését…

A szintetikus robotikai adatok terjednek, de bizalmi réteg nélkül kockázatosak
Kutatás2026. augusztus 18.

A szintetikus robotikai adatok terjednek, de bizalmi réteg nélkül kockázatosak

A szintetikus adatok fontos megoldást kínálnak a robotikai látás, nyelv és cselekvés rendszereinek adatproblémájára, de a mennyiségük gyorsabban nő, mint a…