Kevesebb tokennel elemez videókat a Gemini új agentic funkciója

A Google DeepMind 2026. szeptember 1-jén bemutatta az agentic video understanding nevű új Gemini képességet. A funkció a Gemini 3.7 Flash, 3.6 Flash és 3.5 Flash-Lite modellekben indul, videófeltöltésekkel és YouTube-videókkal használható a Gemini API-n keresztül.
- A Google DeepMind bemutatta az agentic video understanding funkciót Gemini modellekhez.
- A támogatott modellek: Gemini 3.7 Flash, 3.6 Flash és 3.5 Flash-Lite.
- A Google szerint a tokenfogyasztás akár 88 százalékkal, a költség akár 66 százalékkal csökkenhet.
- A pontosság a vállalat mérései alapján akár 7 százalékkal javulhat.
- A funkció már elérhető a Gemini API-ban, később a Gemini appban és az Ask YouTube funkcióban is megjelenik.
Célzottan keresi meg a fontos videórészleteket
A Google DeepMind szerint az új agentic video understanding a videóelemzés pontosságát javítja, miközben jelentősen csökkenti a tokenhasználatot és a költségeket. A funkció a Gemini natív videós eszközeire épít, és a vállalat leírása alapján a modell így dinamikusan tud videórészleteket keresni, pásztázni és ellenőrizni a képkockák, a hang és az átiratok alapján.
A Google a megoldást a jelenlegi, statikus feldolgozással állítja szembe, ahol a modell fix képkocka per másodperc aránnyal dolgozza fel a videót. Az alapértelmezett érték 1 FPS, amely API-n keresztül módosítható. Az új megközelítésnél a Gemini aktívabb szerepet kap abban, hogy mit nézzen meg, milyen sebességgel és melyik modalitáson keresztül, például képkockák, hang vagy átirat alapján.
A DeepMind szerint ezt a fejlesztők korábban manuálisan is megoldhatták, az agentic video understanding viszont egy ügynöki cikluson keresztül végzi el a feladatot. A modell belső eszközt hív meg a releváns videórész betöltéséhez, ami a vállalat állítása szerint jelentősen csökkenti a fejlesztési ráfordítást.
Akár 88 százalékkal kevesebb token
A Google DeepMind saját mérései szerint a Gemini modellek agentic video understanding használatával szabványos videóelemzési benchmarkokon akár 66 százalékkal alacsonyabb elemzési költséget és akár 88 százalékkal kisebb tokenfogyasztást érnek el, miközben a pontosság akár 7 százalékkal javul.
A vállalat szerint az előnyök különösen a hosszú videóknál látványosak, például 10 perces útmutatóknál, 90 perces előadásoknál és többórás felvételeknél. A statikus feldolgozás ilyen esetekben a DeepMind szerint választás elé állítja a fejlesztőket: magas tokenköltséget vállalnak, vagy olyan technikákat használnak, amelyek fontos részleteket hagyhatnak ki.
A Google azt állítja, hogy a támogatott modellek mind profitálnak a funkcióból, de a Gemini 3.7 Flash agentic feldolgozással adja a legjobb általános minőséget, valamint a legjobb minőség és költséghatékonyság kombinációját a tesztelt videóértési modellek között.
Milyen feladatokra szánja a Google
A DeepMind több tipikus felhasználási esetet említ. Az egyik a másodpercnél rövidebb pillanatok visszakeresése, ahol a rendszer olyan gyors állapotváltozásokat vagy vágáshatárokat találhat meg, amelyek 1 FPS mellett könnyen kimaradnak. A vállalat ezt például pontosabb automatizált videószerkesztéshez kapcsolja.
A másik fontos terület a hosszú videókban végzett célzott keresés. A Google szerint a Gemini így többórás anyagokban is válaszolhat összetett kérdésekre anélkül, hogy milliónyi tokent használna fel. A rendszer emellett rendellenességfelismerésnél magasabb FPS-sel újramintázhat érdekes idősávokat, hogy gyors mozgásokat és finom vizuális hibákat vizsgáljon.
A funkciót ismétlődő fizikai mozdulatok és különálló objektumok időbeli számlálására is szánják. A Google példái között szerepel a gyors mozgások pontosabb elemzése dinamikus FPS használatával, illetve a hosszú videók tokenhatékony elemzése LongVideoBench benchmarkon.
Elérhetőség és várható hatás a felhasználóknak
Az agentic video understanding a bejelentés szerint már elérhető a Gemini API-n keresztül a Google AI Studio és a Gemini Enterprise Agent Platform felületén. A funkció a Gemini 3.7 Flash, 3.6 Flash és 3.5 Flash-Lite modellekkel indul. A használatához az API-konfigurációban a feldolgozást agentic értékre kell állítani.
A Google közlése szerint a funkció a szabványos Gemini API tokenárazást használja, és nincs külön funkciódíja. Ez a fejlesztőknek azt jelentheti, hogy a videós feladatoknál ugyanazon API-környezetben próbálhatják ki a dinamikus feldolgozást, különösen akkor, ha hosszabb felvételek elemzése miatt a tokenhasználat eddig korlátot jelentett.
A DeepMind azt is közölte, hogy az agentic video understanding hatékonysági és minőségi javításait több milliárd felhasználóhoz viszi el Google-termékeken keresztül. A funkció hamarosan minden felhasználónál megjelenik a Gemini appban Flash és Flash-Lite modelleken, a következő hónapokban pedig a YouTube videóoldalán található Ask YouTube funkciót is támogatja majd, ahol a Gemini a vizuális tartalomra alapozva adhat jobb minőségű válaszokat.
Google DeepMind: Introducing agentic video understanding with Gemini


