Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A szintetikus robotikai adatok terjednek, de bizalmi réteg nélkül kockázatosak

2026. augusztus 18.Forrás: HumanSignal (Label Studio)
A szintetikus robotikai adatok terjednek, de bizalmi réteg nélkül kockázatosak
Kép: HumanSignal (Label Studio)

A szintetikus adatok fontos megoldást kínálnak a robotikai látás, nyelv és cselekvés rendszereinek adatproblémájára, de a mennyiségük gyorsabban nő, mint a megbízhatóságuk. A HumanSignal szerint ezért ember által ellenőrzött adatokból, értékelésből és válogatásból álló bizalmi rétegre van szükség.

A lényeg röviden
  • A HumanSignal 1 228 VLA-tanulmány elemzésére támaszkodik.
  • A szintetikus adatok nagy volumenben és változatosan állíthatók elő.
  • A szimulációs teljesítmény nem garantálja a valódi robotikai átvitelt.
  • A generátorok átörökíthetik a tanítóadatok hibáit és hiányosságait.
  • Az emberi ellenőrzés a mérgezett adatok kiszűrésében is fontos.

A szintetikus adatok már önmagukban is versenyképesek lehetnek

A HumanSignal augusztus 18-án közzétett elemzése a vállalatnak a látás, nyelv és cselekvés kutatásáról szóló sorozatának ötödik része. A bejegyzés a cég 1 228, arXivon megjelent VLA-tanulmány elemzésére támaszkodik, amely a 2023 februárja és 2026 júniusa közötti időszakot vizsgálta.

A vállalat szerint a robotikában zajló szintetikusan előállított adatokra épülő fellendülés gyorsul, és ígéretes választ adhat az adatgyűjtés szűk keresztmetszetére. Az InternData-A1 tanulmánya a HumanSignal ismertetése szerint olyan szintetikus adathalmazról számol be, amelyből egy VLA-irányítást tanítottak, és ez felvette a versenyt egy erős, valódi robotadatokra épülő rendszerrel. A GigaBrain-0, a GigaWorld-0 és a SynGrasp-1B példái azt mutatják, hogy a generálás a teleoperációval elérhető mennyiségnél jóval nagyobb adathalmazokat tehet lehetővé.

A szintetikus adatok epizódonként olcsón előállíthatók, változatosak, és keletkezésükkor pontos címkékkel rendelkeznek. Emellett nem korlátozzák őket az operátorok beosztása és a hardveres adatgyűjtés nehézségei.

Három ponton sérülhet a megbízhatóság

Az első probléma a szimuláció és a valóság közötti rés. Egy szimulációban jól teljesítő rendszer a fizikai környezetben gyengén szerepelhet. A HumanSignal által idézett összehasonlításban egy irányítási rendszer a LIBERO teszten 97,65 százalékos eredményt ért el, egy valódi manipulációs feladaton viszont lényegében 0 százalékra esett vissza. A vállalat szerint ezt csak valódi, elkülönített és emberek által ellenőrzött értékeléssel lehet feltárni.

A második kockázat, hogy a generátorok átörökítik a tanítóadatok hiányosságait. Ha a bemeneti adatok főként sikeres műveleteket tartalmaznak, a rendszer sok hibátlan felvételt állíthat elő, de nem feltétlenül tanítja meg a modellt például a megcsúszó fogás felismerésére és korrigálására. A valódi gyűjtések során, szakértelemmel felcímkézett hibák ezért továbbra is fontosak.

A harmadik probléma a csendes hiba. Egy generált epizódban lehet fizikailag lehetetlen érintkezés, felületen áthaladó tárgy vagy a képi tartalomhoz nem illő címke, miközben ezt semmi sem jelzi. A legerősebb szintetikus adatpipeline-ok ezért VLM-alapú ellenőrzőket használnak, amelyek kiszűrik a problémás epizódokat. Ezeket az ellenőrzőket viszont ember által hitelesített referenciaadattal kell kalibrálni.

A válogatás biztonsági ellenőrzéssé válik

A HumanSignal szerint a gondozás és az ellenőrzés nem pusztán adatminőségi kérdés. Két, 2025-ös tanulmány VLA-tanítás elleni adatmérgezési támadásokat mutatott be. Az egyik támadás 98 és 99 százalék közötti hátsóajtó-sikert ért el úgy, hogy a tanítóepizódok mindössze 0,31 százalékát módosította.

Egy több millió géppel generált epizódot tartalmazó, kevés emberi felülvizsgálatra épülő folyamatban ilyen kis arányú mérgezett adat könnyen rejtve maradhat. A vállalat ezért a bizalmi réteg feladatai közé sorolja a valódi, ember által ellenőrzött értékelőhalmaz fenntartását, a címkézett hibák és helyreállítási példák biztosítását, a VLM-ellenőrzők hitelesítését, valamint az emberi felülvizsgálatot a válogatási folyamat biztonsági kontrolljaként.

A bejegyzés következtetése szerint a szintetikus adatok használata és az emberi ellenőrzés nem egymást kizáró megközelítések. A nagy volumenű generálás akkor támasztható alá, ha a felhasználók azt is ellenőrzik, hogy az adatok átkerülnek-e a valós környezetbe, lefedik-e a hibákat, és nem tartalmaznak-e rejtett káros módosításokat.

Kapcsolódó hírek

A világ modellezésétől az aktív robotokig lépne a fizikai AI
Kutatás2026. október 2. 00:37

A világ modellezésétől az aktív robotokig lépne a fizikai AI

A fizikai környezetben működő mesterséges intelligenciának az élethű világmodellezés mellett azt is tudnia kell, mikor van szüksége új információra, hogyan tervezzen, és…

A Label Studio egy felületre hozza a LiDAR-annotáció teljes folyamatát
Termékek és eszközök2026. szeptember 18.

A Label Studio egy felületre hozza a LiDAR-annotáció teljes folyamatát

A HumanSignal olyan LiDAR- és többérzékelős annotációs felületet mutatott be, amely a pontfelhők, a kameraképek, az objektumkövetés és a minőségellenőrzés kezelését…

A 95 százalékos LIBERO-eredmény nem feltétlenül jelent működő robotot
Kutatás2026. augusztus 12.

A 95 százalékos LIBERO-eredmény nem feltétlenül jelent működő robotot

A Vision-Language-Action modellek LIBERO-benchmarkon elért 95 százalékos sikerrátája a valós robotikai környezetben könnyen összeomolhat. A HumanSignal elemzése szerint…