Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple új benchmarkkal méri a hosszú videók összefoglalását

2026. július 9.Forrás: Apple
Az Apple új benchmarkkal méri a hosszú videók összefoglalását
Kép: Apple

Az Apple bemutatta az LVSum nevű benchmarkot, amely azt vizsgálja, mennyire pontosan foglalják össze a multimodális nagy nyelvi modellek a hosszú videókat. A rendszer külön figyeli, hogy az összefoglalók tartalmilag és időben is kapcsolódjanak a videó megfelelő részeihez.

A lényeg röviden
  • Az LVSum 72, 13 területet lefedő videót tartalmaz.
  • A videók átlagos hossza 16 perc, és legfeljebb 10 emberi összefoglaló tartozik hozzájuk.
  • Az átiratok jobban javították az összefoglalók minőségét, mint a vizuális képkockák önmagukban.
  • Jelentős különbség maradt a modellgenerált és az emberi összefoglalók között.
  • A modellek gyengén teljesítettek az időbeli megalapozásban, az utasításkövetésben és a multimodális koherenciában.

72 videó, 13 terület és emberi annotációk

Az LVSum egy emberi annotációkkal létrehozott tesztkészlet a hosszú videók összefoglalásának értékelésére. A benchmark 72, 13 különböző területet lefedő videót tartalmaz. A videók átlagos hossza 16 perc, és mindegyikhez legfeljebb 10, emberek által készített összefoglaló tartozik.

Az összefoglalók időbeli hivatkozásokat is tartalmaznak. Ez lehetővé teszi annak vizsgálatát, hogy egy modell nemcsak a videó főbb tartalmait adja-e vissza, hanem a történéseket a megfelelő időpontokhoz is kapcsolja.

Az Apple kutatói szerint a hosszú videók összefoglalása különösen nehéz feladat a multimodális nagy nyelvi modellek számára. A modelleknek hosszabb időtartamon keresztül kell megőrizniük az időbeli pontosságot, miközben olyan összefoglalót készítenek, amely tartalmilag és időben is megalapozott.

Proprietary és nyílt forrású modelleket is vizsgáltak

A kutatásban vezető, zárt és nyílt forrású multimodális nagy nyelvi modelleket értékeltek. A szerzők új, nagy nyelvi modelleken alapuló mérőszámokat vezettek be a tartalmi relevancia és a modalitások közötti összhang vizsgálatára. Ezeket standard automatikus mérőszámokkal együtt alkalmazták.

A vizsgálat egyik fő megállapítása, hogy az átiratok lényegesen többet javítanak az összefoglalók minőségén, mint önmagukban a vizuális képkockák. Ez az Apple eredményei szerint azt mutatja, hogy a beszédből vagy más hangalapú tartalomból származó szöveges információ fontos szerepet játszik a hosszú videók feldolgozásában.

A kutatás második megállapítása szerint továbbra is jelentős különbség van a modellek által készített és az emberek által írt összefoglalók között. A benchmark így nemcsak a modellek közötti összehasonlítást teszi lehetővé, hanem azt is megmutatja, milyen távol vannak az emberi minőségtől.

Az időbeli kapcsolatok kezelése továbbra is gyenge pont

Az Apple kísérletei alapján a jelenlegi multimodális nagy nyelvi modellek rendszeres hiányosságokat mutatnak az időbeli megalapozásban, az utasítások követésében és a különböző modalitások közötti koherenciában. Az időbeli megalapozás azt jelenti, hogy a modell a leírt eseményt a videó megfelelő időszakához tudja kötni.

Az LVSum ezért olyan értékelési feladatot kínál, amelyben a videó tartalmi összefoglalása mellett az események sorrendje és időbeli elhelyezkedése is számít. A benchmarkot Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng és Ganesh Nagarajan jegyzi, Patel és Ozyildirim egyenlő mértékben járultak hozzá a munkához.

Az Apple kutatási oldala a tanulmány mellett a forráskód GitHub-elérését is felsorolja. A cég a tanulmányt 2026 júliusában publikálta. A kutatás eredménye a felhasználók számára azt jelenti, hogy a hosszú videók automatikus összefoglalásánál továbbra is fontos kérdés marad az események pontos sorrendje és időzítése, nem csak a videó általános témájának felismerése.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség…

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kutatás2026. október 1.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és…