Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple új tesztje a videós történetek megértését vizsgálja

2026. július 9.Forrás: Apple
Az Apple új tesztje a videós történetek megértését vizsgálja
Kép: Apple

Az Apple kutatói bemutatták a NarrativeTrack nevű benchmarkot, amely a multimodális nagy nyelvi modellek videós történetmegértését méri. A rendszer azt vizsgálja, hogy a modellek mennyire pontosan követik az entitásokat, azok változásait és a videó időbeli alakulását.

A lényeg röviden
  • A NarrativeTrack az MLLM-ek videós történetmegértését méri.
  • A CRP az entitások létezését, változásait és bizonytalanságát vizsgálja.
  • A modellek gyakran elveszítik az entitások azonosságát változó kontextusban.
  • Az általános és a videós modellek eltérő erősségeket és hibákat mutatnak.
  • A benchmark az időben megalapozott narratív megértés fejlesztését támogatja.

A videós történetek időbeli követése a cél

A multimodális nagy nyelvi modellek, vagyis az MLLM-ek jelentős fejlődést értek el a kép és nyelv együttes értelmezésében. Az Apple kutatói szerint azonban kevésbé feltárt terület, hogy ezek a rendszerek mennyire értik meg a videókban időben kibontakozó történeteket.

A történet megértéséhez egy modellnek azt is helyesen kell követnie, hogy ki mit csinál, mikor és hol történik az esemény. Ehhez a vizuális és időbeli környezetek változása közben is koherens reprezentációt kell fenntartania az egyes entitásokról. A NarrativeTrack ezt a képességet finom részletességű, entitásközpontú következtetéssel vizsgálja.

Három szinten növeli a történet összetettségét

A kutatók a NarrativeTrackot az MLLM-ek narratív megértését értékelő első benchmarkként mutatják be, amely entitásközpontú következtetésre épül. A korábbi benchmarkokkal szemben, amelyek rövid klipekre vagy általános jelenetszintű jelentésekre korlátozódnak, a módszer a videókat alkotó entitásokra bontja.

Az értékelés alapja a Compositional Reasoning Progression, röviden CRP. Ez egy strukturált keretrendszer, amely három dimenzió mentén fokozatosan növeli a narratív összetettséget: az entitás létezését, az entitás változásait és az entitások közötti bizonytalanságot vizsgálja. A feladatok így a szereplők időbeli fennmaradásának követésétől a környezetük változásának értelmezésén át a finom részletek észleléséig terjednek.

A rendszer mögött teljesen automatizált, entitásközpontú feldolgozási folyamat áll. Ez időben rögzített entitásreprezentációk nagy léptékű kinyerését teszi lehetővé, és erre épül a CRP értékelési rendszere.

Eltérő hibákat vétenek az általános és a videós modellek

A tanulmányban a kutatók korszerű MLLM-eket értékeltek. Eredményeik szerint a modellek nem követik megbízhatóan az entitásokat a vizuális átmenetek és az időbeli változások során. Gyakran egy entitás azonosságát is tévesen állapítják meg, amikor megváltozik a kontextus.

Az általános célú, nyílt forráskódú MLLM-ek erős vizuális megalapozást mutatnak, vagyis jól kapcsolják a következtetéseiket a látott tartalomhoz, ugyanakkor gyengébb időbeli koherenciát produkálnak. A videókra specializált MLLM-ek jobban kezelik az időbeli környezetet, viszont hajlamosak tévesen kitalálni az entitások kontextusát.

Az Apple kutatói szerint az eredmények alapvető kompromisszumot tárnak fel a vizuális megalapozás és az időbeli következtetés között. A tanulmány következtetése alapján a narratív megértés e két képesség integrációjából alakul ki. A NarrativeTrack ennek méréséhez és az MLLM-ek időben megalapozott történetértésének fejlesztéséhez kínál rendszerezett keretet.

A publikáció 2026 januárjában jelent meg, és az ECCV konferenciához kapcsolódik. Szerzői Hyeonjeong Ha, Jinjin Ge, Bo Feng, Kaixin Ma és Gargi Chakraborty. Hyeonjeong Ha a University of Illinois Urbana-Champaign kötődésével szerepel, a munkát pedig az Apple-nél töltött időszakában végezte.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség…

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kutatás2026. október 1.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és…