Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Új módszer mutatja meg, valóban érti-e a videót egy AI-modell

2026. július 9.Forrás: Apple
Új módszer mutatja meg, valóban érti-e a videót egy AI-modell
Kép: Apple

Az Apple kutatói olyan értékelési módszert mutattak be, amely különválasztja a videós nyelvi modellek tudásalapú, képi és valódi időbeli következtetési képességeit. A VBenchComp célja, hogy kiderüljön, egy modell tényleg érti-e az események sorrendjét a videóban.

A lényeg röviden
  • A VBenchComp külön méri a tudásalapú, szemantikai és időbeli kérdéseket.
  • Egy modell a videó megtekintése nélkül is válaszolhat bizonyos kérdésekre.
  • A képkockák összekeverése megmutathatja, szükség van-e az időbeli sorrendre.
  • A kutatás szerint az összpontszámok elrejthetik a videós modellek gyengeségeit.
  • A tanulmányt elfogadták a NeurIPS 2025 egyik workshopjára.

Az összpontszám elrejtheti a hiányosságokat

A videók értelmezésére használt nagy nyelvi modelleket gyakran olyan tesztekkel vizsgálják, amelyek többféle képességet kevernek össze. Az Apple kutatói szerint ezek a benchmarkok sokszor nem választják el világosan az általános tudást, az egyes képkockákból kinyerhető információt és az időbeli következtetést.

Ez azért jelent problémát, mert a videó megértésének egyik meghatározó eleme annak felismerése, hogyan változnak az események az időben. Egy magas összpontszám ezért önmagában nem feltétlenül bizonyítja, hogy a modell érti a videó dinamikus tartalmát.

A kutatók két olyan tényezőt azonosítottak, amelyek elfedhetik a modellek gyengeségeit. Az egyik az erős nyelvi előismeret, amely lehetővé teheti, hogy a modell a videó megtekintése nélkül is válaszoljon bizonyos kérdésekre. A másik a képkockák sorrendjének felcserélésével szembeni érzéketlenség.

Négy kategóriába sorolja a kérdéseket

A tanulmányban bemutatott VBenchComp automatizált folyamatként osztályozza a videós tesztek kérdéseit. A rendszer négy csoportot használ, amelyekkel részletesebben vizsgálható, milyen képesség áll egy-egy helyes válasz mögött.

  • LLM-Answerable: a kérdés a videó megtekintése nélkül is megválaszolható.
  • Semantic: a válasz akkor is megadható, ha a videó képkockáit időbeli sorrendjükből összekeverik.
  • Temporal: a helyes válaszhoz szükség van a képkockák eredeti sorrendjének és az események időbeli alakulásának megértésére.
  • Others: az előző kategóriákba nem sorolható kérdések.

A felosztás segítségével külön-külön lehet mérni a videós nyelvi modellek eltérő képességeit. Így láthatóvá válhat, ha egy modell általános nyelvi ismereteire vagy a képek egyedi tartalmára támaszkodva teljesít jól, miközben az események sorrendjét kevésbé érti.

A kutatás új benchmarkok tervezését sürgeti

Az Apple kutatóinak elemzése szerint a hagyományos összpontszámok olyan modellgyengeségeket is elrejthetnek, amelyek a részletesebb vizsgálat során megmutatkoznak. A VBenchComp ezért a videós modellek képességeinek finomabb elemzését teszi lehetővé.

A tanulmány ajánlásokat is megfogalmaz a jövőbeli benchmarkok kialakításához. A kutatók szerint olyan tesztekre van szükség, amelyek pontosabban mérik a videók időbeli szerkezetének megértését, és elkülönítik ezt a tudásalapú vagy pusztán képi felismerési feladatoktól.

A Breaking Down Video LLM Benchmarks: Knowledge, Spatial Perception, or True Temporal Understanding? című tanulmányt Bo Feng, Zhengfeng Lai, Shiyu Li, Zizhen Wang, Simon Wang, Ping Huang és Meng Cao jegyzi. A szerzők közül Bo Feng, Zhengfeng Lai és Zizhen Wang egyenlő mértékben járult hozzá a munkához, Zhengfeng Lai pedig a kapcsolattartó szerző. A dolgozatot elfogadták a NeurIPS 2025 Evaluating the Evolving LLM Lifecycle Workshopjára, és 2025 októberében jelent meg.

A módszer a felhasználók és a fejlesztők számára azt jelenti, hogy egy videós AI-rendszer képességeit részletesebb bontásban lehet értékelni. A forrás szerint ez pontosabb képet adhat arról, hogy egy modell valóban az események időbeli összefüggéseit érti-e, vagy más, könnyebben kihasználható jelzésekből következtet.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség…

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket
Kutatás2026. október 1.

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket

Saját, rövid tanulságok megfogalmazásával javítaná az AI-ügynökök tanulását az Apple új kutatása. Az RLTL;DR nevű módszer olyan feladatokra céloz, ahol a modell…