Az Apple új tesztje a videós történetek megértését vizsgálja

Az Apple kutatói bemutatták a NarrativeTrack nevű benchmarkot, amely a multimodális nagy nyelvi modellek videós történetmegértését méri. A rendszer azt vizsgálja, hogy a modellek mennyire pontosan követik az entitásokat, azok változásait és a videó időbeli alakulását.
- A NarrativeTrack az MLLM-ek videós történetmegértését méri.
- A CRP az entitások létezését, változásait és bizonytalanságát vizsgálja.
- A modellek gyakran elveszítik az entitások azonosságát változó kontextusban.
- Az általános és a videós modellek eltérő erősségeket és hibákat mutatnak.
- A benchmark az időben megalapozott narratív megértés fejlesztését támogatja.
A videós történetek időbeli követése a cél
A multimodális nagy nyelvi modellek, vagyis az MLLM-ek jelentős fejlődést értek el a kép és nyelv együttes értelmezésében. Az Apple kutatói szerint azonban kevésbé feltárt terület, hogy ezek a rendszerek mennyire értik meg a videókban időben kibontakozó történeteket.
A történet megértéséhez egy modellnek azt is helyesen kell követnie, hogy ki mit csinál, mikor és hol történik az esemény. Ehhez a vizuális és időbeli környezetek változása közben is koherens reprezentációt kell fenntartania az egyes entitásokról. A NarrativeTrack ezt a képességet finom részletességű, entitásközpontú következtetéssel vizsgálja.
Három szinten növeli a történet összetettségét
A kutatók a NarrativeTrackot az MLLM-ek narratív megértését értékelő első benchmarkként mutatják be, amely entitásközpontú következtetésre épül. A korábbi benchmarkokkal szemben, amelyek rövid klipekre vagy általános jelenetszintű jelentésekre korlátozódnak, a módszer a videókat alkotó entitásokra bontja.
Az értékelés alapja a Compositional Reasoning Progression, röviden CRP. Ez egy strukturált keretrendszer, amely három dimenzió mentén fokozatosan növeli a narratív összetettséget: az entitás létezését, az entitás változásait és az entitások közötti bizonytalanságot vizsgálja. A feladatok így a szereplők időbeli fennmaradásának követésétől a környezetük változásának értelmezésén át a finom részletek észleléséig terjednek.
A rendszer mögött teljesen automatizált, entitásközpontú feldolgozási folyamat áll. Ez időben rögzített entitásreprezentációk nagy léptékű kinyerését teszi lehetővé, és erre épül a CRP értékelési rendszere.
Eltérő hibákat vétenek az általános és a videós modellek
A tanulmányban a kutatók korszerű MLLM-eket értékeltek. Eredményeik szerint a modellek nem követik megbízhatóan az entitásokat a vizuális átmenetek és az időbeli változások során. Gyakran egy entitás azonosságát is tévesen állapítják meg, amikor megváltozik a kontextus.
Az általános célú, nyílt forráskódú MLLM-ek erős vizuális megalapozást mutatnak, vagyis jól kapcsolják a következtetéseiket a látott tartalomhoz, ugyanakkor gyengébb időbeli koherenciát produkálnak. A videókra specializált MLLM-ek jobban kezelik az időbeli környezetet, viszont hajlamosak tévesen kitalálni az entitások kontextusát.
Az Apple kutatói szerint az eredmények alapvető kompromisszumot tárnak fel a vizuális megalapozás és az időbeli következtetés között. A tanulmány következtetése alapján a narratív megértés e két képesség integrációjából alakul ki. A NarrativeTrack ennek méréséhez és az MLLM-ek időben megalapozott történetértésének fejlesztéséhez kínál rendszerezett keretet.
A publikáció 2026 januárjában jelent meg, és az ECCV konferenciához kapcsolódik. Szerzői Hyeonjeong Ha, Jinjin Ge, Bo Feng, Kaixin Ma és Gargi Chakraborty. Hyeonjeong Ha a University of Illinois Urbana-Champaign kötődésével szerepel, a munkát pedig az Apple-nél töltött időszakában végezte.


