Az Apple új benchmarkkal méri a hosszú videók összefoglalását

Az Apple bemutatta az LVSum nevű benchmarkot, amely azt vizsgálja, mennyire pontosan foglalják össze a multimodális nagy nyelvi modellek a hosszú videókat. A rendszer külön figyeli, hogy az összefoglalók tartalmilag és időben is kapcsolódjanak a videó megfelelő részeihez.
- Az LVSum 72, 13 területet lefedő videót tartalmaz.
- A videók átlagos hossza 16 perc, és legfeljebb 10 emberi összefoglaló tartozik hozzájuk.
- Az átiratok jobban javították az összefoglalók minőségét, mint a vizuális képkockák önmagukban.
- Jelentős különbség maradt a modellgenerált és az emberi összefoglalók között.
- A modellek gyengén teljesítettek az időbeli megalapozásban, az utasításkövetésben és a multimodális koherenciában.
72 videó, 13 terület és emberi annotációk
Az LVSum egy emberi annotációkkal létrehozott tesztkészlet a hosszú videók összefoglalásának értékelésére. A benchmark 72, 13 különböző területet lefedő videót tartalmaz. A videók átlagos hossza 16 perc, és mindegyikhez legfeljebb 10, emberek által készített összefoglaló tartozik.
Az összefoglalók időbeli hivatkozásokat is tartalmaznak. Ez lehetővé teszi annak vizsgálatát, hogy egy modell nemcsak a videó főbb tartalmait adja-e vissza, hanem a történéseket a megfelelő időpontokhoz is kapcsolja.
Az Apple kutatói szerint a hosszú videók összefoglalása különösen nehéz feladat a multimodális nagy nyelvi modellek számára. A modelleknek hosszabb időtartamon keresztül kell megőrizniük az időbeli pontosságot, miközben olyan összefoglalót készítenek, amely tartalmilag és időben is megalapozott.
Proprietary és nyílt forrású modelleket is vizsgáltak
A kutatásban vezető, zárt és nyílt forrású multimodális nagy nyelvi modelleket értékeltek. A szerzők új, nagy nyelvi modelleken alapuló mérőszámokat vezettek be a tartalmi relevancia és a modalitások közötti összhang vizsgálatára. Ezeket standard automatikus mérőszámokkal együtt alkalmazták.
A vizsgálat egyik fő megállapítása, hogy az átiratok lényegesen többet javítanak az összefoglalók minőségén, mint önmagukban a vizuális képkockák. Ez az Apple eredményei szerint azt mutatja, hogy a beszédből vagy más hangalapú tartalomból származó szöveges információ fontos szerepet játszik a hosszú videók feldolgozásában.
A kutatás második megállapítása szerint továbbra is jelentős különbség van a modellek által készített és az emberek által írt összefoglalók között. A benchmark így nemcsak a modellek közötti összehasonlítást teszi lehetővé, hanem azt is megmutatja, milyen távol vannak az emberi minőségtől.
Az időbeli kapcsolatok kezelése továbbra is gyenge pont
Az Apple kísérletei alapján a jelenlegi multimodális nagy nyelvi modellek rendszeres hiányosságokat mutatnak az időbeli megalapozásban, az utasítások követésében és a különböző modalitások közötti koherenciában. Az időbeli megalapozás azt jelenti, hogy a modell a leírt eseményt a videó megfelelő időszakához tudja kötni.
Az LVSum ezért olyan értékelési feladatot kínál, amelyben a videó tartalmi összefoglalása mellett az események sorrendje és időbeli elhelyezkedése is számít. A benchmarkot Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng és Ganesh Nagarajan jegyzi, Patel és Ozyildirim egyenlő mértékben járultak hozzá a munkához.
Az Apple kutatási oldala a tanulmány mellett a forráskód GitHub-elérését is felsorolja. A cég a tanulmányt 2026 júliusában publikálta. A kutatás eredménye a felhasználók számára azt jelenti, hogy a hosszú videók automatikus összefoglalásánál továbbra is fontos kérdés marad az események pontos sorrendje és időzítése, nem csak a videó általános témájának felismerése.


