Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Google többügynökös rendszert fejleszt koherens videókhoz

2026. szeptember 24. 21:40Forrás: Google Research
A Google többügynökös rendszert fejleszt koherens videókhoz
Kép: Google Research

A Google Research többügynökös keretrendszert fejlesztett hosszú, több jelenetből álló videók önálló létrehozására. A rendszer a szereplők, helyszínek és tárgyak folytonosságát követi, miközben a Gemini és a Veo modelljeire épül.

A lényeg röviden
  • A Google Research többügynökös keretrendszert fejleszt hosszú videókhoz.
  • Az AI video co-director kreatív stratégiát, narratív módot és vizuális stílust hangol össze.
  • A CANVAS tartós vizuális memóriával követi a szereplőket, helyszíneket és tárgyakat.
  • Az A²RD szegmensenként generál videót, és multimodális memóriát használ.
  • A keretrendszer a Gemini és a Veo biztonsági mechanizmusaira épül.

A hosszú videók egyik fő gondja a vizuális drift

A videógeneráló diffúziós modellek rövid, nagy részletességű klipeket képesek létrehozni, a hosszabb történetek elkészítése azonban továbbra is nehéz feladat. A Google Research szerint a jelenlegi, egymásra épülő mesterségesintelligencia-pipeline-okban a szereplők ruházata, a díszletek vagy a tárgyak fokozatosan megváltozhatnak a jelenetek között.

Az ilyen szemantikai és vizuális eltérés mellett az egyik lépés hibája a későbbi videószintézisbe is átterjedhet. A kutatók ezt kaszkádszerű hibaterjedésként írják le. A hosszú folyamatokban az is nehezíti a javítást, hogy a végső hiba alapján sokszor nem állapítható meg, melyik korábbi utasítás okozta a problémát. A Google Research további gondként említi, hogy a történet idővel elveszítheti a tartalmi irányát, és nem halad érdemben előre.

AI video co-director: közös kreatív irány több ügynökkel

A Google kutatói egy AI video co-director nevű, hierarchikus többügynökös keretrendszert mutattak be. A megoldás a videókészítést globális optimalizálási problémaként kezeli, és egy többkarú bandita algoritmussal választ a kreatív lehetőségek közül.

A rendszer három szempontot hangol össze: a kreatív stratégiát, a narratív módot és az esztétikai archetípust. Az Orchestrator Agent ezek alapján alakítja ki az irányt, a Pre-Production Agent pedig jelenetről jelenetre összeállítja a történetet és a vizuális eszközöket. Ezután a Production Agent dolgozik a konkrét médián. A Keyframe Agent rögzíti a szereplők és a jelenetek alapvető megjelenését, a Video Agent mozgást ad hozzá, az Audio Agent pedig hangalámondást és zenét készít.

A kész videót egy multimodális nyelvi modell értékeli, az eredmény pedig visszakerül az optimalizálási folyamatba. Így a rendszer több generálási körön keresztül finomíthatja a kiválasztott kreatív konfigurációt. A keretrendszer a Google szerint a Gemini és a Veo fölött működő vezérlési réteg, architektúrája azonban modellfüggetlen.

A CANVAS vizuális memóriával tartja egyben a történetet

A Continuity-Aware Narratives via Visual Agentic Storyboarding, röviden CANVAS, a szereplők, helyszínek és tárgyak állapotát strukturált formában követi a történet előrehaladtával. A Gemini fölött működő rendszer tartós vizuális memóriát használ, amelyből szükség esetén korábbi vizuális horgonyokat tölt vissza, vagy újakat hoz létre.

A Google Research egy múzeumi rablást bemutató, több jelenetből álló sorozaton szemléltette a módszert. A példában a tolvajnak, a kiállítóteremnek és a drágakőnek több jeleneten át azonos vizuális jellemzőket kell megőriznie. A kutatók szerint a Gemini-3.1-Pro önálló használatakor megváltozott a tárgy és eltolódott a háttér, az AutoStudio esetében pedig a szereplő sapkája tűnt el, és a környezet is inkonzisztenssé vált. A CANVAS vizuális memóriája ezzel szemben a Google beszámolója szerint megőrizte a karakterek, a térbeli elrendezés és a tárgyak folytonosságát.

Percekig tartó videókhoz A²RD készül

A kutatási program része az A²RD nevű, ügynökalapú, autoregresszív videógeneráló architektúra is. Ez a történetet szegmensenként állítja elő, és multimodális videomemóriával követi az egyes részek környezetét és dinamikáját.

Minden szegmensnél egy visszakeresésből, szintézisből, finomításból és frissítésből álló ciklus működik. A rendszer a generálás során adaptívan vált az extrapoláció és az interpoláció között. Előbbi a történet természetes továbbvitelét szolgálja, utóbbi a már létrehozott szereplőkhöz és környezetekhez rögzíti az új szakaszt. A Google Research szerint a bemutatott keretrendszerek többperces videók készítését teszik lehetővé, miközben mérséklik a vizuális eltérést és a pipeline-ok hibaterjedését.

A kutatást 2026. szeptember 24-én publikálták. A Co-Director a COLM 2026, a CANVAS pedig az EMNLP 2026 konferencia programjában jelenik meg. A rendszer a Gemini és a Veo natív biztonsági mechanizmusait, köztük a SynthID-vízjelezést is örökli.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A Google új módszere pontosabban irányítaná az AI-képgenerálást
Kutatás2026. szeptember 29. 20:38

A Google új módszere pontosabban irányítaná az AI-képgenerálást

A Diffusion Controller nevű Google Research keretrendszer azt célozza, hogy a szövegből képet készítő modellek jobban kövessék a felhasználói utasításokat, miközben…

A Google szerint a mobilitási adatok jobb helyismeretet adhatnak az AI-modelleknek
Kutatás2026. augusztus 21. 12:54

A Google szerint a mobilitási adatok jobb helyismeretet adhatnak az AI-modelleknek

A Google Research 2026. augusztus 21-én mutatta be a Mobility-Embedded POIs, röviden ME-POIs nevű keretrendszert. A megközelítés nyelvi modellek helyreprezentációit…

Videós orvosi konzultációkban tesztelte AMIE rendszerét a Google Research
Kutatás2026. augusztus 11. 19:04

Videós orvosi konzultációkban tesztelte AMIE rendszerét a Google Research

A Google Research 2026. augusztus 11-én bemutatta az AMIE kutatási orvosi AI-rendszer videós változatát. A cég szerint az AMIE (Video) valós idejű, szimulált klinikai…