A Google többügynökös rendszert fejleszt koherens videókhoz

A Google Research többügynökös keretrendszert fejlesztett hosszú, több jelenetből álló videók önálló létrehozására. A rendszer a szereplők, helyszínek és tárgyak folytonosságát követi, miközben a Gemini és a Veo modelljeire épül.
- A Google Research többügynökös keretrendszert fejleszt hosszú videókhoz.
- Az AI video co-director kreatív stratégiát, narratív módot és vizuális stílust hangol össze.
- A CANVAS tartós vizuális memóriával követi a szereplőket, helyszíneket és tárgyakat.
- Az A²RD szegmensenként generál videót, és multimodális memóriát használ.
- A keretrendszer a Gemini és a Veo biztonsági mechanizmusaira épül.
A hosszú videók egyik fő gondja a vizuális drift
A videógeneráló diffúziós modellek rövid, nagy részletességű klipeket képesek létrehozni, a hosszabb történetek elkészítése azonban továbbra is nehéz feladat. A Google Research szerint a jelenlegi, egymásra épülő mesterségesintelligencia-pipeline-okban a szereplők ruházata, a díszletek vagy a tárgyak fokozatosan megváltozhatnak a jelenetek között.
Az ilyen szemantikai és vizuális eltérés mellett az egyik lépés hibája a későbbi videószintézisbe is átterjedhet. A kutatók ezt kaszkádszerű hibaterjedésként írják le. A hosszú folyamatokban az is nehezíti a javítást, hogy a végső hiba alapján sokszor nem állapítható meg, melyik korábbi utasítás okozta a problémát. A Google Research további gondként említi, hogy a történet idővel elveszítheti a tartalmi irányát, és nem halad érdemben előre.
AI video co-director: közös kreatív irány több ügynökkel
A Google kutatói egy AI video co-director nevű, hierarchikus többügynökös keretrendszert mutattak be. A megoldás a videókészítést globális optimalizálási problémaként kezeli, és egy többkarú bandita algoritmussal választ a kreatív lehetőségek közül.
A rendszer három szempontot hangol össze: a kreatív stratégiát, a narratív módot és az esztétikai archetípust. Az Orchestrator Agent ezek alapján alakítja ki az irányt, a Pre-Production Agent pedig jelenetről jelenetre összeállítja a történetet és a vizuális eszközöket. Ezután a Production Agent dolgozik a konkrét médián. A Keyframe Agent rögzíti a szereplők és a jelenetek alapvető megjelenését, a Video Agent mozgást ad hozzá, az Audio Agent pedig hangalámondást és zenét készít.
A kész videót egy multimodális nyelvi modell értékeli, az eredmény pedig visszakerül az optimalizálási folyamatba. Így a rendszer több generálási körön keresztül finomíthatja a kiválasztott kreatív konfigurációt. A keretrendszer a Google szerint a Gemini és a Veo fölött működő vezérlési réteg, architektúrája azonban modellfüggetlen.
A CANVAS vizuális memóriával tartja egyben a történetet
A Continuity-Aware Narratives via Visual Agentic Storyboarding, röviden CANVAS, a szereplők, helyszínek és tárgyak állapotát strukturált formában követi a történet előrehaladtával. A Gemini fölött működő rendszer tartós vizuális memóriát használ, amelyből szükség esetén korábbi vizuális horgonyokat tölt vissza, vagy újakat hoz létre.
A Google Research egy múzeumi rablást bemutató, több jelenetből álló sorozaton szemléltette a módszert. A példában a tolvajnak, a kiállítóteremnek és a drágakőnek több jeleneten át azonos vizuális jellemzőket kell megőriznie. A kutatók szerint a Gemini-3.1-Pro önálló használatakor megváltozott a tárgy és eltolódott a háttér, az AutoStudio esetében pedig a szereplő sapkája tűnt el, és a környezet is inkonzisztenssé vált. A CANVAS vizuális memóriája ezzel szemben a Google beszámolója szerint megőrizte a karakterek, a térbeli elrendezés és a tárgyak folytonosságát.
Percekig tartó videókhoz A²RD készül
A kutatási program része az A²RD nevű, ügynökalapú, autoregresszív videógeneráló architektúra is. Ez a történetet szegmensenként állítja elő, és multimodális videomemóriával követi az egyes részek környezetét és dinamikáját.
Minden szegmensnél egy visszakeresésből, szintézisből, finomításból és frissítésből álló ciklus működik. A rendszer a generálás során adaptívan vált az extrapoláció és az interpoláció között. Előbbi a történet természetes továbbvitelét szolgálja, utóbbi a már létrehozott szereplőkhöz és környezetekhez rögzíti az új szakaszt. A Google Research szerint a bemutatott keretrendszerek többperces videók készítését teszik lehetővé, miközben mérséklik a vizuális eltérést és a pipeline-ok hibaterjedését.
A kutatást 2026. szeptember 24-én publikálták. A Co-Director a COLM 2026, a CANVAS pedig az EMNLP 2026 konferencia programjában jelenik meg. A rendszer a Gemini és a Veo natív biztonsági mechanizmusait, köztük a SynthID-vízjelezést is örökli.
Google Research: Automating coherent long-form video generation


