Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A videómodellek még látványosan elbuknak a fizika alapjain

2026. szeptember 23.Forrás: HumanSignal (Label Studio)
A videómodellek még látványosan elbuknak a fizika alapjain
Kép: HumanSignal (Label Studio)

A modern videómodellek meggyőző képkockákat készítenek, de ez nem jelenti azt, hogy következetesen értik a háromdimenziós világot. A HumanSignal kísérletei szerint a folyadékok mozgása, a térbeli viszonyok és a mechanikai szerkezetek továbbra is komoly problémát jelentenek.

A lényeg röviden
  • A videómodellek meggyőző képeket készítenek, de a fizikai következetességgel gyakran gondjuk van.
  • A HumanSignal reklámkísérletében a szándékosan hihető kudarc bizonyult a legnehezebb feladatnak.
  • A Seedance 2.5 stabilan tartotta a robot megjelenését a jelenetek között.
  • A Seedance 2.5, a Veo 3.1 és a Kling 3.0 Pro hibázott a víz átöntésének modellezésében.
  • Az Armatron-kísérletben a modellek a kívánt célt követték, de eltorzították a robotkar mechanikáját.

Egy reklám, amelynek a kudarctól kellett volna működnie

A HumanSignal szeptember 23-án közzétett beszámolója egy olyan reklámötletből indult ki, amelyben egy háztartási robot első pillantásra sikeresen teljesíti a feladatát. A kamera elfordulásakor azonban kiderül, hogy a robot valójában éppen csak elvéti a célt. Az egyik jelenetben egy növényt öntöz, de a vízsugár teljesen elkerüli a cserepet. Egy másikban kávékkal teli tálcát visz, és egy üvegajtónak sétál neki.

A körülbelül 20 másodperces reklámok elkészítése közben a cég arra jutott, hogy a kameramozgás, a szándékosan elrontott feladat és a folyadékok viselkedése együtt túl nagy kihívást jelent a jelenlegi videómodelleknek. A cég ezt a problémát „failure choreography”, vagyis a kudarc megtervezéseként kezdte emlegetni.

A robot következetes maradt, a fizika nem

A HumanSignal eredetileg attól tartott, hogy a robot külseje és arányai változnak majd az egyes felvételek között. Ehhez több nézetből álló karakterreferenciát készítettek, a környezet stabilizálásához pedig a szobáról is több képet adtak meg a modellnek. A beszámoló szerint a Seedance 2.5 ugyanazt az arcot, testarányokat és ízületi kialakítást tartotta meg a reklám jeleneteiben.

A nehézséget így nem a szereplő állandósága, hanem maga a poén okozta. A modell hajlamos volt a feladatot a megszokott, sikeres módon teljesíteni. Egy robot, egy kancsó és egy növény láttán a víz általában oda került, ahová annak kerülnie kellene. A szándékos, hihető félresikerülés ezzel szembement.

A cég szerint ez a jelenet egyszerre tesztelte a szokatlan feladatvégrehajtást, a térbeli következetességet és a folyadékdinamikát. A kamera elfordulásakor a teljes jelenetnek koherensnek kellett volna maradnia, miközben a vízsugárnak éppen a megfelelő helyet kellett volna elvétenie.

Három modell, két fizikai próba

A HumanSignal azonos kezdőképet és csak a végrehajtandó műveletet leíró utasítást adott három videómodellnek: a ByteDance Seedance 2.5 modelljének, a Google DeepMind Veo 3.1-nek és a Kuaishou Kling 3.0 Pro modelljének. A következményeket, például a vízszint csökkenését, nem írták le külön, így azokat a modelleknek kellett kikövetkeztetniük.

Az első kísérletben egy teli korsóból kellett a víz körülbelül 60 százalékát egy üres pohárba önteni. Mindhárom modell hibázott, eltérő módokon. A közös probléma a víz mennyiségének átvitele volt, a látható vízszintek nem változtak az elvárható módon. A HumanSignal szerint a Kling 3.0 Pro eredménye különösen jól mutatta a különbséget a látványos megjelenítés és a tényleges megértés között: az öntés hihetőnek látszott, a jelenet végén azonban lényegében két pohárnyi víz jelent meg.

A második tesztben egy Radio Shack Armatron játékrobot-karnak kellett felvennie egy kék labdát, majd egy műanyag pohárba ejtenie. A modellek többnyire a megfelelő cél felé haladtak, közben azonban megváltoztatták a szerkezet mechanikáját. A csukló és a kar geometriája eltorzult, két modell pedig úgy oldotta meg a feladatot, mintha az egész játékrobot közelebb ugrott volna a pohárhoz.

A meggyőző kép nem azonos a világ megértésével

A HumanSignal a videómodellek két eltérő képességét választja szét. A realizmushoz tartozik a textúrák, a fények és a mozgáselmosódás hiteles megjelenítése. A világ megértése viszont tartós objektumokat, állandó mennyiségeket és következetes geometriát feltételez.

A beszámoló szerint egy modell képes lehet meggyőző képpontokat előállítani úgy, hogy közben megkettőzi a vizet, vagy olyan ízületet hajlít meg, amely valójában nem létezik. A HumanSignal által idézett Physics-IQ és VideoPhy-2 kutatások szintén hiányosságokat találtak a fizikai alapelvek és a fizikai józan ész kezelésében. A cég három kísérlete alapján a videómodellek 2026 végén még látványosan dolgoznak a fizika következetes megjelenítésén.

Forrás
HumanSignal (Label Studio): Teaching a video model to fail convincingly

Kapcsolódó hírek

A Label Studio közvetlenül a DICOM-fájlok annotálását teszi lehetővé
Cégek és üzlet2026. szeptember 30.

A Label Studio közvetlenül a DICOM-fájlok annotálását teszi lehetővé

A HumanSignal olyan DICOM-annotációs felületet mutatott be, amely a fájlok PNG-képsorozattá alakítása nélkül jeleníti meg és szerkeszti az orvosi képalkotási adatokat. A…

A Label Studio egy felületre hozza a LiDAR-annotáció teljes folyamatát
Termékek és eszközök2026. szeptember 18.

A Label Studio egy felületre hozza a LiDAR-annotáció teljes folyamatát

A HumanSignal olyan LiDAR- és többérzékelős annotációs felületet mutatott be, amely a pontfelhők, a kameraképek, az objektumkövetés és a minőségellenőrzés kezelését…

A Label Studio és a Docling közvetlenül összekapcsolható
Fejlesztőknek2026. augusztus 25.

A Label Studio és a Docling közvetlenül összekapcsolható

A HumanSignal új Label Studio-integrációval támogatja az IBM Docling dokumentumfeldolgozó eszközét. A megoldás vizuális annotációt, DocLang-exportot és valós idejű…