Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Kevesebb tokennel elemez videókat a Gemini új agentic funkciója

2026. szeptember 1.Forrás: Google DeepMind
Kevesebb tokennel elemez videókat a Gemini új agentic funkciója
Kép: Google DeepMind

A Google DeepMind 2026. szeptember 1-jén bemutatta az agentic video understanding nevű új Gemini képességet. A funkció a Gemini 3.7 Flash, 3.6 Flash és 3.5 Flash-Lite modellekben indul, videófeltöltésekkel és YouTube-videókkal használható a Gemini API-n keresztül.

A lényeg röviden
  • A Google DeepMind bemutatta az agentic video understanding funkciót Gemini modellekhez.
  • A támogatott modellek: Gemini 3.7 Flash, 3.6 Flash és 3.5 Flash-Lite.
  • A Google szerint a tokenfogyasztás akár 88 százalékkal, a költség akár 66 százalékkal csökkenhet.
  • A pontosság a vállalat mérései alapján akár 7 százalékkal javulhat.
  • A funkció már elérhető a Gemini API-ban, később a Gemini appban és az Ask YouTube funkcióban is megjelenik.

Célzottan keresi meg a fontos videórészleteket

A Google DeepMind szerint az új agentic video understanding a videóelemzés pontosságát javítja, miközben jelentősen csökkenti a tokenhasználatot és a költségeket. A funkció a Gemini natív videós eszközeire épít, és a vállalat leírása alapján a modell így dinamikusan tud videórészleteket keresni, pásztázni és ellenőrizni a képkockák, a hang és az átiratok alapján.

A Google a megoldást a jelenlegi, statikus feldolgozással állítja szembe, ahol a modell fix képkocka per másodperc aránnyal dolgozza fel a videót. Az alapértelmezett érték 1 FPS, amely API-n keresztül módosítható. Az új megközelítésnél a Gemini aktívabb szerepet kap abban, hogy mit nézzen meg, milyen sebességgel és melyik modalitáson keresztül, például képkockák, hang vagy átirat alapján.

A DeepMind szerint ezt a fejlesztők korábban manuálisan is megoldhatták, az agentic video understanding viszont egy ügynöki cikluson keresztül végzi el a feladatot. A modell belső eszközt hív meg a releváns videórész betöltéséhez, ami a vállalat állítása szerint jelentősen csökkenti a fejlesztési ráfordítást.

Akár 88 százalékkal kevesebb token

A Google DeepMind saját mérései szerint a Gemini modellek agentic video understanding használatával szabványos videóelemzési benchmarkokon akár 66 százalékkal alacsonyabb elemzési költséget és akár 88 százalékkal kisebb tokenfogyasztást érnek el, miközben a pontosság akár 7 százalékkal javul.

A vállalat szerint az előnyök különösen a hosszú videóknál látványosak, például 10 perces útmutatóknál, 90 perces előadásoknál és többórás felvételeknél. A statikus feldolgozás ilyen esetekben a DeepMind szerint választás elé állítja a fejlesztőket: magas tokenköltséget vállalnak, vagy olyan technikákat használnak, amelyek fontos részleteket hagyhatnak ki.

A Google azt állítja, hogy a támogatott modellek mind profitálnak a funkcióból, de a Gemini 3.7 Flash agentic feldolgozással adja a legjobb általános minőséget, valamint a legjobb minőség és költséghatékonyság kombinációját a tesztelt videóértési modellek között.

Milyen feladatokra szánja a Google

A DeepMind több tipikus felhasználási esetet említ. Az egyik a másodpercnél rövidebb pillanatok visszakeresése, ahol a rendszer olyan gyors állapotváltozásokat vagy vágáshatárokat találhat meg, amelyek 1 FPS mellett könnyen kimaradnak. A vállalat ezt például pontosabb automatizált videószerkesztéshez kapcsolja.

A másik fontos terület a hosszú videókban végzett célzott keresés. A Google szerint a Gemini így többórás anyagokban is válaszolhat összetett kérdésekre anélkül, hogy milliónyi tokent használna fel. A rendszer emellett rendellenességfelismerésnél magasabb FPS-sel újramintázhat érdekes idősávokat, hogy gyors mozgásokat és finom vizuális hibákat vizsgáljon.

A funkciót ismétlődő fizikai mozdulatok és különálló objektumok időbeli számlálására is szánják. A Google példái között szerepel a gyors mozgások pontosabb elemzése dinamikus FPS használatával, illetve a hosszú videók tokenhatékony elemzése LongVideoBench benchmarkon.

Elérhetőség és várható hatás a felhasználóknak

Az agentic video understanding a bejelentés szerint már elérhető a Gemini API-n keresztül a Google AI Studio és a Gemini Enterprise Agent Platform felületén. A funkció a Gemini 3.7 Flash, 3.6 Flash és 3.5 Flash-Lite modellekkel indul. A használatához az API-konfigurációban a feldolgozást agentic értékre kell állítani.

A Google közlése szerint a funkció a szabványos Gemini API tokenárazást használja, és nincs külön funkciódíja. Ez a fejlesztőknek azt jelentheti, hogy a videós feladatoknál ugyanazon API-környezetben próbálhatják ki a dinamikus feldolgozást, különösen akkor, ha hosszabb felvételek elemzése miatt a tokenhasználat eddig korlátot jelentett.

A DeepMind azt is közölte, hogy az agentic video understanding hatékonysági és minőségi javításait több milliárd felhasználóhoz viszi el Google-termékeken keresztül. A funkció hamarosan minden felhasználónál megjelenik a Gemini appban Flash és Flash-Lite modelleken, a következő hónapokban pedig a YouTube videóoldalán található Ask YouTube funkciót is támogatja majd, ahol a Gemini a vizuális tartalomra alapozva adhat jobb minőségű válaszokat.

Kapcsolódó hírek

Új Gemini hangmodellek érkeztek egyedi beszédhangokhoz
Modellek2026. szeptember 23.

Új Gemini hangmodellek érkeztek egyedi beszédhangokhoz

Két új szövegfelolvasó modellel bővül a Gemini család: a Gemini 3.8 Flash TTS a kreatív hangtervezésre, a Gemini 3.8 Flash-Lite TTS pedig nagy volumenű használatra…

Google DeepMind AI-val idézett fel egy sosem rögzített 70 éves emléket
Termékek és eszközök2026. szeptember 9.

Google DeepMind AI-val idézett fel egy sosem rögzített 70 éves emléket

A Google 2026. szeptember 9-én mutatta be, hogyan készült a Love, Rendered című rövid dokumentumfilm, amelyben AI segítségével alkották újra Burt és Ethelle Shatz egyik…

Megjelent a Gemini Omni 1.1 Flash, több kontrollt kapnak a videós fejlesztők
Termékek és eszközök2026. augusztus 27.

Megjelent a Gemini Omni 1.1 Flash, több kontrollt kapnak a videós fejlesztők

A Google DeepMind 2026. augusztus 27-én bemutatta a Gemini Omni 1.1 Flash modellt, amely fejlesztőknek szánt, éles használatra kész frissítés a generatív videóhoz. Az…