Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Élő avatárt kapott a Gemini 3.8 Live

2026. szeptember 24.Forrás: Google DeepMind
Élő avatárt kapott a Gemini 3.8 Live
Kép: Google DeepMind

A Google DeepMind bemutatta a Gemini 3.8 Live with Live Avatar rendszert, amely valós idő közeli videógenerálással egészíti ki a hangalapú párbeszédet. A vállalat szerint a funkció kifejező avatárokat, pontos ajakszinkront és többnyelvű beszélgetést kínál vállalati felhasználásra.

A lényeg röviden
  • A Gemini 3.8 Live with Live Avatar valós idő közeli videóval egészíti ki az élő párbeszédet.
  • A rendszer vizuális és hangbemeneteket dolgoz fel, kifejező hanggal és videóval válaszol.
  • Az avatár 97 nyelv között válthat, az ajakszinkron és az arckifejezések alkalmazkodásával.
  • A vállalatok előre beállított vagy engedélyezési listán keresztül egyedi avatárokat használhatnak.
  • Az AI által generált hang- és videókimenetet SynthID vízjel látja el.

Videóval egészül ki a Gemini élő párbeszéde

A Google DeepMind szeptember 24-én jelentette be a Gemini 3.8 Live with Live Avatar rendszert. A megoldás a Gemini élő párbeszédképességeit alacsony késleltetésű, valós idő közeli videóstreameléssel kapcsolja össze. A cél egy természetesebb és intuitívabb beszélgetési élmény létrehozása vállalatok és ügyfeleik számára.

A Live Avatar egyszerre dolgozza fel a vizuális és hangbemeneteket, majd kifejező hanggal és videóval válaszol. A Google DeepMind leírása szerint a rendszer figyel, lát és beszél, miközben dinamikus vizuális személyiséget jelenít meg. Az avatárok természetes arckifejezéseket, pontos ajakszinkront és folyamatos beszédváltást kínálnak.

A vállalat szerint a technológia olyan feladatokban is használható, mint az ügyfélszolgálat vagy az interaktív bemutatók. A Gemini 3.8 Live with Live Avatar szeptember 24-től elérhető a Gemini Enterprise szolgáltatásban.

A háttérben tovább dolgozhatnak az eszközök

A Live Avatar egyik kiemelt képessége az aszinkron eszközhívás. A rendszer a háttérben eszközhívásokat indíthat és adatokat kérhet le úgy, hogy közben folytatja az aktív párbeszédet. Így összetettebb feladatokat is kezelhet a beszélgetés megszakítása nélkül.

A Google DeepMind egy szállodai bejelentkezést említ példaként. Ilyen helyzetben az avatar a szükséges eszközöket a háttérben használhatja, miközben a felhasználóval folyamatosan kommunikál. Ez a működés a vállalat szerint gördülékenyebb beszélgetési folyamatot tesz lehetővé.

A rendszer a beszédet és a videót is többnyelvű környezetre tervezték. Natív, beszédről beszédre működő szinkronizációt kínál, és a Google szerint 97 nyelv között képes váltani. A váltáskor az ajakszinkron és az arckifejezések is alkalmazkodnak, miközben a videó minősége nem romlik és nem jelenik meg vizuális elcsúszás.

Előre beállított és testreszabható avatárok

A vállalatok különböző megjelenésű, hangú és kifejező jelenlétű avatárok közül választhatnak. A Google DeepMind egy változatos, előre beállított avatárkönyvtárat is kínál, emellett lehetőség van saját Live Avatar kialakítására.

A fejlesztők egy jó minőségű referenciaképből animált és reagáló avatárt generálhatnak. A rendszer a leírás szerint megőrzi a referencia hasonlóságát, a márka stílusát vagy a karakter identitását. Az egyedi avatárok létrehozása jelenleg csak vállalati engedélyezési listán keresztül érhető el.

A Live Avatar használatához a Gemini Enterprise szolgáltatás áll rendelkezésre, a fejlesztők pedig az API dokumentációjában találhatják meg az induláshoz szükséges információkat. A funkció így elsősorban olyan szervezeteknek szól, amelyek saját digitális ügyfélszolgálati vagy interaktív bemutatási élményeikbe építenék be a vizuális beszélgetést.

Vízjel jelzi az AI által létrehozott tartalmat

A Google DeepMind szerint a Live Avatar fejlesztésénél a biztonság és az átláthatóság is szempont volt. A Google AI-termékei által generált kimeneteket SynthID vízjellel látják el. A láthatatlan jel közvetlenül a hang- és videókimenetbe épül be.

A vállalat állítása szerint ez segíthet felismerhetővé tenni az AI által generált tartalmakat, így mérsékelhető a félretájékoztatás és a téves hozzárendelés kockázata. A Google DeepMind a részletesebb biztonsági megközelítéshez a modellkártyáját ajánlja.

Kapcsolódó hírek

Elérhetővé vált a Gemini 3.8 Live Live Avatar funkcióval
Cégek és üzlet2026. szeptember 24.

Elérhetővé vált a Gemini 3.8 Live Live Avatar funkcióval

A Google Cloud általánosan elérhetővé tette a Gemini 3.8 Live Live Avatar funkcióval kiegészített változatát a Gemini Enterprise vállalati ügyfelei számára. A rendszer…

Új Gemini hangmodellek érkeztek egyedi beszédhangokhoz
Modellek2026. szeptember 23.

Új Gemini hangmodellek érkeztek egyedi beszédhangokhoz

Két új szövegfelolvasó modellel bővül a Gemini család: a Gemini 3.8 Flash TTS a kreatív hangtervezésre, a Gemini 3.8 Flash-Lite TTS pedig nagy volumenű használatra…

A Google bemutatta a Gemini 3.8 Live hangalapú AI-modelleket
Modellek2026. szeptember 15.

A Google bemutatta a Gemini 3.8 Live hangalapú AI-modelleket

A Google bemutatta a Gemini 3.8 Live és a Gemini 3.8 Live Extended Thinking modelleket, amelyek természetesebb hangalapú párbeszédet, valós idejű vizuális értelmezést és…