Megjelent a Gemini Omni 1.1 Flash, több kontrollt kapnak a videós fejlesztők

A Google DeepMind 2026. augusztus 27-én bemutatta a Gemini Omni 1.1 Flash modellt, amely fejlesztőknek szánt, éles használatra kész frissítés a generatív videóhoz. Az újdonság a Gemini API-n keresztül, a Google AI Studio felületén érhető el a közlemény szerint.
- A Google DeepMind 2026. augusztus 27-én jelentette be a Gemini Omni 1.1 Flash modellt.
- A videók 10 másodperces lépésekben, legfeljebb 40 másodperces teljes hosszig hosszabbíthatók.
- A modell akár 10 másodpercnyi korábbi kontextust is elemez a jelenet folytatásához.
- A 360p előnézetek a Google szerint akár 60 százalékkal gyorsabbak és harmadannyiba kerülnek, mint a 720p kimenetek.
- Az Omni 1.1 1080p és 4K felbontású végső videók készítését is támogatja.
Éles használatra szánt frissítés generatív videóhoz
A Google DeepMind szerint a Gemini Omni 1.1 Flash célja, hogy a fejlesztők nagyobb kontrollt kapjanak a generatív videós projektek felett. A bejelentés olyan alkalmazási területeket említ, mint a generatív videós munkafolyamatok, kreatív eszközök és médiaszerkesztő szoftverek építése.
A cég úgy fogalmaz, hogy a Gemini Omni korábban valós világbeli következtetési képességeket hozott a generatív alkotásba, a mostani frissítések pedig professzionális használatra teszik alkalmassá az Omni 1.1-et. A modell a Google AI Studio mellett a Gemini Enterprise Agent Platformon keresztül is használható a forrásban szereplő összefoglaló szerint.
A frissítés központi eleme, hogy a fejlesztők részletesebben irányíthatják a videók folytatását, az átmeneteket, az előnézeti munkát és a végső felbontást. A Google DeepMind ezt stúdióminőségű videógyártási képességként írja le.
Hosszabb jelenetek és kulcskockák közötti mozgás
Az egyik fő újdonság a jelenethosszabbítás. A Gemini Omni 1.1 Flash egy meglévő videót onnan tud továbbgenerálni, ahol az véget ért. A modell a Google DeepMind szerint már akár 10 másodpercnyi korábbi kontextust is elemez, miközben a korábbi modellek csak az utolsó másodpercre támaszkodtak.
A vállalat állítása szerint ez jobb vizuális következetességet és a történethez való pontosabb igazodást eredményez. A videók 10 másodperces lépésekben hosszabbíthatók, legfeljebb 40 másodperces teljes kumulatív hosszig.
A másik fontos vezérlési lehetőség az első és az utolsó képkocka megadása. Ilyenkor az Omni 1.1 a két kulcskocka közötti folyamatos videót generálja le. A DeepMind példái szerint ez összetett kamerakörözésekhez, zoomátmenetekhez vagy zökkenőmentesen ismétlődő klipekhez használható.
Gyorsabb vázlat 360p-ben, végső anyag 4K-ban
A fejlesztési folyamat gyorsítására a modell 360p felbontású, könnyebb előnézeti videókat is tud generálni. A Google DeepMind szerint ezek akár 60 százalékkal gyorsabban készülhetnek el, mint az Omni 1.1 standard 720p felbontású videói, és azok költségének harmadába kerülnek.
A forrás pontosítása szerint az akár 60 százalékos gyorsulás a 360p és a 720p felbontás rendszerátviteli teljesítményének összehasonlításán alapul. A cég ezt gyors prototípusokhoz, storyboard iterációhoz és fejlesztői platformokon végzett gyors rendereléshez ajánlja.
A végső anyagoknál az Omni 1.1 1080p vagy 4K felbontású kimenetet is tud készíteni. A Google DeepMind ezt professzionális gyártásra kész, csiszolt eredményként jellemzi.
Videós referencia is bekerülhet a bemenetbe
A Gemini Omni 1.1 Flash multimodális bemenetében videós referencia is használható. A fejlesztők legfeljebb három másodpercnyi videót adhatnak meg referenciaként a jelenet megalkotásához.
A Google DeepMind szerint ez segíthet a vizuális kontextus és a karakterkövetkezetesség megtartásában. A közlemény példája több táncvideó és karakterkép kombinálásáról szól, ahol a szereplők a referenciavideók mozdulatait hajtják végre egy közös térben, egyetlen folyamatos felvételben, vágás nélkül.
Mit jelent ez a fejlesztőknek és a kreatív eszközök piacának
A bejelentés alapján a Gemini Omni 1.1 Flash elsősorban azoknak lehet fontos, akik videógenerálást építenek be saját termékekbe. A jelenethosszabbítás, az első és utolsó képkockával vezérelt átmenet, a 360p vázlatkészítés és a 4K kimenet együtt teljesebb fejlesztői munkafolyamatot fed le.
A Google DeepMind példái olyan eszközöket vázolnak, amelyekben a felhasználó első és utolsó képkockát adhat meg, majd előbeállításokkal vagy szöveges utasítással generálhat átmenetet. Egy másik példa kameramozgásokat mutat be szobákon keresztül, ahol az alkalmazás a forrás szerint nem ad hozzá nem létező bútorokat vagy részleteket.
A változás lényege a fejlesztők számára az, hogy a kísérletezés és a véglegesítés külön szakaszokra bontható: alacsonyabb felbontásban gyorsabban lehet próbálkozni, a végső anyag pedig nagy felbontásban készülhet el. A Google DeepMind ezt a generatív videó gyorsabb iterációjaként és valós telepítésre alkalmasabb formájaként mutatja be.
Google DeepMind: Gemini Omni 1.1 Flash lets you build with more control


