Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple új módszert mutatott be szövegből hanggal kiegészített videókhoz

2026. szeptember 11.Forrás: Apple
Az Apple új módszert mutatott be szövegből hanggal kiegészített videókhoz
Kép: Apple

Az Apple kutatói olyan módszert mutattak be, amely a szövegből videót és az ahhoz szinkronizált hangot generáló rendszerek szöveges vezérlését javítja. A Cross-Referential Rewriter külön kezeli a videóhoz és a hanghoz tartozó leírásokat, hogy csökkentse a modalitások közötti interferenciát.

A lényeg röviden
  • Az Apple kutatói a szövegből hanggal kiegészített videók generálását vizsgálták.
  • A Cross-Referential Rewriter külön feliratot készít a videóhoz és a hanghoz.
  • A Semantic Checker szemantikai horgonyokat azonosít a folyamatban.
  • A módszer célja a modalitások közötti interferencia és a tanítási, használati szövegek közötti rés csökkentése.
  • A tanulmány az ECCV-n jelent meg 2026 júliusában.

Két modalitást kell összehangolni

Az Apple Machine Learning oldalán ismertetett tanulmány a Text-to-Sounding-Video, röviden T2SV generálással foglalkozik. Ezek a rendszerek szöveges utasítás alapján olyan videót hoznak létre, amelyhez szinkronizált hang is tartozik. A cél az, hogy a videó és a hang egyaránt illeszkedjen a szöveges feltételekhez.

A kutatók szerint a közös hang- és videóképzés terén elért fejlődés ellenére két fontos probléma maradt. Az egyik a szöveges vezérlés. Ha ugyanazt a feliratot használják a videó és a hang feltételéül, az interferenciát okozhat a két modalitás között. Emellett különbség van a tanítás során használt részletes feliratok és a felhasználók által a használatkor megadott rövid felszólítások között.

Külön felirat készül a videóhoz és a hanghoz

Az első problémára a szerzők a Cross-Referential Rewriter, vagyis CRR nevű feliratkészítési keretrendszert javasolják. Ez egy két ügynökből álló folyamat. A Semantic Checker, vagyis szemantikai ellenőrző az úgynevezett megalapozott szemantikai horgonyokat, Semantic Anchors tárja fel.

Ezután a Cross-Modal Rewriter, azaz a keresztmodalitású átíró különálló feliratpárt készít. Az egyik leírás a videóhoz, ezt TV jelöléssel használják, a másik a hanghoz, ezt TA jelöli. A tanulmány leírása szerint a két felirat szétválasztása megszünteti a modalitások közötti interferenciát, és áthidalja a tanításkor használt részletes feliratok, valamint a következtetéskor megadott tömör felhasználói utasítások közötti különbséget.

Az ECCV-n publikált tanulmány háttere

A Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction című dolgozat a számítógépes látás területén készült, és az ECCV konferencián jelent meg 2026 júliusában. Az Apple kutatási oldala 2026. szeptember 11-én közölte az anyagot.

A szerzők Kaisi Guan, Xihua Wang, Zhengfeng Lai, Xin Cheng, Peng Zhang, Xiaojiang Liu, Ruihua Song és Meng Cao. A forrás szerint Kaisi Guan és Xihua Wang a Renmin University of China intézményéhez tartozik, és egyenlő arányban járultak hozzá a munkához. A tanulmányban szereplő megjegyzés szerint a munka egy része az Apple-nél készült.

Mit jelenthet ez a felhasználóknak?

A bemutatott megközelítés a T2SV rendszerek egyik bemeneti problémáját célozza: azt, hogyan alakítsák át a szöveges feltételeket a videó és a hang számára egyaránt használható formává. A TV és TA feliratok külön kezelése a forrás szerint a két modalitás saját igényeihez igazítja a leírásokat.

A kutatók ugyanakkor két kihívást neveztek meg, és a forrásrészlet csak az elsőhöz kapcsolódó CRR keretrendszert ismerteti. Az optimális, keresztmodalitású jellemzőfúziós és interakciós mechanizmus kérdését a tanulmány további problémaként említi, de az Apple összefoglalója itt nem közöl hozzá részletes módszert vagy eredményszámokat.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket
Kutatás2026. október 2.

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket

Az Apple kutatói szerint a beszédmodellek előzetes tanításakor bevezetett nyelvi megkülönböztetés csökkentheti a többnyelvű és egynyelvű modellek közötti…

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség…