Új módszer mutatja meg, valóban érti-e a videót egy AI-modell

Az Apple kutatói olyan értékelési módszert mutattak be, amely különválasztja a videós nyelvi modellek tudásalapú, képi és valódi időbeli következtetési képességeit. A VBenchComp célja, hogy kiderüljön, egy modell tényleg érti-e az események sorrendjét a videóban.
- A VBenchComp külön méri a tudásalapú, szemantikai és időbeli kérdéseket.
- Egy modell a videó megtekintése nélkül is válaszolhat bizonyos kérdésekre.
- A képkockák összekeverése megmutathatja, szükség van-e az időbeli sorrendre.
- A kutatás szerint az összpontszámok elrejthetik a videós modellek gyengeségeit.
- A tanulmányt elfogadták a NeurIPS 2025 egyik workshopjára.
Az összpontszám elrejtheti a hiányosságokat
A videók értelmezésére használt nagy nyelvi modelleket gyakran olyan tesztekkel vizsgálják, amelyek többféle képességet kevernek össze. Az Apple kutatói szerint ezek a benchmarkok sokszor nem választják el világosan az általános tudást, az egyes képkockákból kinyerhető információt és az időbeli következtetést.
Ez azért jelent problémát, mert a videó megértésének egyik meghatározó eleme annak felismerése, hogyan változnak az események az időben. Egy magas összpontszám ezért önmagában nem feltétlenül bizonyítja, hogy a modell érti a videó dinamikus tartalmát.
A kutatók két olyan tényezőt azonosítottak, amelyek elfedhetik a modellek gyengeségeit. Az egyik az erős nyelvi előismeret, amely lehetővé teheti, hogy a modell a videó megtekintése nélkül is válaszoljon bizonyos kérdésekre. A másik a képkockák sorrendjének felcserélésével szembeni érzéketlenség.
Négy kategóriába sorolja a kérdéseket
A tanulmányban bemutatott VBenchComp automatizált folyamatként osztályozza a videós tesztek kérdéseit. A rendszer négy csoportot használ, amelyekkel részletesebben vizsgálható, milyen képesség áll egy-egy helyes válasz mögött.
- LLM-Answerable: a kérdés a videó megtekintése nélkül is megválaszolható.
- Semantic: a válasz akkor is megadható, ha a videó képkockáit időbeli sorrendjükből összekeverik.
- Temporal: a helyes válaszhoz szükség van a képkockák eredeti sorrendjének és az események időbeli alakulásának megértésére.
- Others: az előző kategóriákba nem sorolható kérdések.
A felosztás segítségével külön-külön lehet mérni a videós nyelvi modellek eltérő képességeit. Így láthatóvá válhat, ha egy modell általános nyelvi ismereteire vagy a képek egyedi tartalmára támaszkodva teljesít jól, miközben az események sorrendjét kevésbé érti.
A kutatás új benchmarkok tervezését sürgeti
Az Apple kutatóinak elemzése szerint a hagyományos összpontszámok olyan modellgyengeségeket is elrejthetnek, amelyek a részletesebb vizsgálat során megmutatkoznak. A VBenchComp ezért a videós modellek képességeinek finomabb elemzését teszi lehetővé.
A tanulmány ajánlásokat is megfogalmaz a jövőbeli benchmarkok kialakításához. A kutatók szerint olyan tesztekre van szükség, amelyek pontosabban mérik a videók időbeli szerkezetének megértését, és elkülönítik ezt a tudásalapú vagy pusztán képi felismerési feladatoktól.
A Breaking Down Video LLM Benchmarks: Knowledge, Spatial Perception, or True Temporal Understanding? című tanulmányt Bo Feng, Zhengfeng Lai, Shiyu Li, Zizhen Wang, Simon Wang, Ping Huang és Meng Cao jegyzi. A szerzők közül Bo Feng, Zhengfeng Lai és Zizhen Wang egyenlő mértékben járult hozzá a munkához, Zhengfeng Lai pedig a kapcsolattartó szerző. A dolgozatot elfogadták a NeurIPS 2025 Evaluating the Evolving LLM Lifecycle Workshopjára, és 2025 októberében jelent meg.
A módszer a felhasználók és a fejlesztők számára azt jelenti, hogy egy videós AI-rendszer képességeit részletesebb bontásban lehet értékelni. A forrás szerint ez pontosabb képet adhat arról, hogy egy modell valóban az események időbeli összefüggéseit érti-e, vagy más, könnyebben kihasználható jelzésekből következtet.
Apple: Breaking Down Video LLM Benchmarks: Knowledge, Spatial Perception, or True Temporal Understanding?


