A 95 százalékos LIBERO-eredmény nem feltétlenül jelent működő robotot

A Vision-Language-Action modellek LIBERO-benchmarkon elért 95 százalékos sikerrátája a valós robotikai környezetben könnyen összeomolhat. A HumanSignal elemzése szerint a tesztek gyakran a betanult pályák memorizálását mérik, a bináris értékelés pedig tovább torzíthatja a képet.
- A LIBERO-Plus tesztjeiben a sikerráta nagyjából 95 százalékról 30 százalék alá esett.
- A LIBERO-PRO szerint 90 százalék feletti eredmények 0,0 százalékra is visszaeshetnek.
- A MetaFine alapján a bináris pontozás akár 70 százalékkal is felfújhatja a teljesítményt.
- Egy adatpoisoning támadás 0,31 százaléknyi módosított epizóddal 98 és 99 százalékos hátsóajtó-sikert ért el.
- A HumanSignal held-out, részletesen pontozott és ember által ellenőrzött értékelést sürget.
A kis változtatások lenullázhatják a sikert
A HumanSignal augusztus 12-én közzétett bejegyzése a Vision-Language-Action, vagyis VLA-modellek adat- és értékelési problémáit vizsgáló sorozat negyedik része. A vállalat 1228, az arXiv cs.RO kategóriájában megjelent VLA-tanulmányt elemzett, amelyek 2023 februárja és 2026 júniusa között jelentek meg.
A LIBERO a manipulációs VLA-modellek egyik leggyakrabban használt értékelési környezete. A HumanSignal számlálása szerint a vizsgált 1228 tanulmány közül több mint 300 használta a benchmarkot. Ez azért jelent problémát, mert ha ugyanazok a környezetek jelennek meg a tanításban és a tesztelésben, a rendszer megtanulhatja a pályákat és az elrendezéseket anélkül, hogy valóban általánosítható feladatmegértést szerezne.
A 2025-ös LIBERO-Plus tanulmányban a kutatók kisebb változtatásokat vezettek be a standard feladatokon. Módosították többek között a megvilágítást, a kamera szögét és a tárgyak elhelyezését. Az eredmények szerint a sikerráta nagyjából 95 százalékról 30 százalék alá esett. A HumanSignal értelmezése szerint a modellek inkább a benchmarkot tanulták meg, mint magát a feladatot.
A LIBERO-PRO ennél is súlyosabb eltérést talált. A tanulmány szerint a 90 százalék feletti sikerrátát jelentő modellek a módosított körülmények között 0,0 százalékra estek vissza. A szerzők ezt a cselekvéssorozatok és a környezeti elrendezések bemagolásával magyarázták. Ugyanez a kutatás arra is jutott, hogy a modellek figyelmen kívül hagyták a nyelvi utasításokat, és az instrukciótól függetlenül hajtották végre a megtanult sorozatot.
A sikerráta önmagában túl keveset mutat
A HumanSignal szerint a probléma nem csak a tesztkörnyezetek átfedéséből ered. Egy, a VLA-modellek belső működését vizsgáló sparse-autoencoder elemzés arra jutott, hogy a kis adathalmazokon finomhangolt modellek által megtanult jellemzők többsége memorizált tanítási sorozatokhoz kapcsolódik. Ilyenkor a rendszer nem feltétlenül egy általánosítható műveletet, például egy bögre felemelését tanulja meg, hanem azt, hogy egy adott elrendezésben milyen pályát kell kibocsátania.
A mérési módszer is torzíthat. A MetaFine című kutatás szerint a bináris sikerráta akár 70 százalékkal is felfújhatja a teljesítményt a fokozatos értékeléshez képest. A passz vagy bukás típusú pontozás ugyanúgy kezeli azt a próbálkozást, amelyben a robot meg sem mozdította a tárgyat, és azt, amelyben a megfelelő tárgyat megfogta, majd majdnem a célba juttatta.
A mintaelemszám tovább növeli a bizonytalanságot. A forrás szerint a valós robotikai VLA-értékelések jellemzően legfeljebb 25 próbálkozásra épülnek, és gyakran nem közölnek konfidenciaintervallumokat. Ilyen elemszám mellett egy 72 és egy 80 százalékos eredmény közötti különbség a zajon belül lehet. A HumanSignal szerint ennek ellenére a tanulmányok rendszeresen pontos összehasonlításokat és rangsorokat állítanak fel.
A pontatlan értékelés biztonsági kockázatot is jelenthet. Két 2025-ös tanulmány VLA-tanítási adatok ellen irányuló mérgezéses támadásokat mutatott be. Az egyikben a támadó a tanítási epizódok mindössze 0,31 százalékának módosításával 98 és 99 százalék közötti hátsóajtó-sikert ért el.
A HumanSignal szerint így lenne hitelesebb a tesztelés
A HumanSignal négy alapelvet emel ki a megbízható VLA-értékeléshez. Az első a szándékosan módosított, a tanításból kihagyott körülmények használata. Az értékelésben új megvilágításnak, kameraállásoknak, tárgyelrendezéseknek, háttereknek és átfogalmazott utasításoknak kell megjelenniük. A LIBERO-Plus és a LIBERO-PRO éppen ilyen változtatásokat épít be.
A második alapelv a részleges eredmények pontozása. Az értékelésnek külön kell vizsgálnia, hogy a robot elérte-e a tárgyat, megfelelően megfogta-e, végrehajtotta-e a szállítást, és teljesítette-e a célt. Az Eval-Actions ilyen megközelítést alkalmaz, szakértői értékeléssel, rangsorolt preferenciákkal, indoklási nyomokkal, valamint sikeres és sikertelen helyzetekkel.
A harmadik követelmény az elegendő számú próbálkozás és a konfidenciaintervallumok közlése. A negyedik az emberi ellenőrzés. A HumanSignal szerint annak eldöntése, hogy egy robot helyreállt-e egy hibából, részben teljesítette-e a feladatot, vagy két próbálkozás valóban összehasonlítható-e, olyan fizikai ok-okozati ítéletet igényel, amelyet egy általános automatikus értékelő nem feltétlenül tud biztosítani.
A vállalat gyakorlati ellenőrzőlistája szerint a következő benchmarkfutás előtt módosítani kell a megvilágítást, a kamera pozícióját és a tárgyak elhelyezését, majd újra kell futtatni a tesztet. Ezután részleges teljesítményt kell pontozni, a próbálkozások számát és az intervallumokat pedig jelenteni kell. A végső értékelési készletnek a tanításból elkülönített, emberek által ellenőrzött adathalmazként kell elkészülnie.
A megközelítés közvetlenül érinti a felhasználókat és a robotikai fejlesztőket is. Egy magas benchmarkpontszám önmagában nem garantálja, hogy a modell egy kissé eltérő szobában, új tárgyelrendezésben vagy más megfogalmazású utasítással is működik. A HumanSignal szerint a megbízható telepítéshez előbb olyan értékelésre van szükség, amely képes különbséget tenni a memorizálás és a valódi általánosítás között.
HumanSignal (Label Studio): Is Your 95% on LIBERO Lying to You?


