Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Google bemutatta a Gemini 3.8 Live hangalapú AI-modelleket

2026. szeptember 15. 19:05Forrás: Google DeepMind
A Google bemutatta a Gemini 3.8 Live hangalapú AI-modelleket
Kép: Google DeepMind

A Google bemutatta a Gemini 3.8 Live és a Gemini 3.8 Live Extended Thinking modelleket, amelyek természetesebb hangalapú párbeszédet, valós idejű vizuális értelmezést és háttérben futó feladatvégrehajtást kínálnak. Az új modellek a Gemini API-ban, a Google Workspace-ben, a Searchben és a Gemini alkalmazásban jelennek meg.

A lényeg röviden
  • A Google bemutatta a Gemini 3.8 Live és a Gemini 3.8 Live Extended Thinking modelleket.
  • A modellek valós időben értelmeznek vizuális bemeneteket, és 97 támogatott nyelv között válthatnak.
  • Az eszközök és API-hívások a beszélgetés megszakítása nélkül, háttérben futhatnak.
  • Az új modellek a Gemini API-ban, a Google AI Studio-ban és több Google-termékben jelennek meg.
  • A generált hangot SynthID-vízjellel látják el.

Két modell eltérő feladatokra

A Google DeepMind szeptember 15-i bejelentése szerint a Gemini 3.8 Live és a Gemini 3.8 Live Extended Thinking a vállalat eddigi legfejlettebb élő párbeszédre készült modelljei. A Google szerint az új rendszerek intelligenciában és párhuzamos következtetésben is fejlődtek, így intuitívabbá válhat a velük folytatott együttműködés.

A Gemini 3.8 Live elsősorban a gyors, folyamatos párbeszédre, a méretezhetőségre és a költséghatékonyságra készült. A modell valós időben dolgozza fel a vizuális bemeneteket, és ezek alapján adhat kontextusosabb válaszokat. A beszélgetés közben automatikusan felismeri és váltja a támogatott nyelveket, összesen 97 nyelven.

A Gemini 3.8 Live Extended Thinking a nagyobb összetettségű feladatokra összpontosít. Többlépéses következtetést végez, miközben a beszélgetés folytatódhat. A modell a Google leírása szerint rövid szóbeli jelzésekkel, például a „Hadd ellenőrizzem...” mondattal reagálhat, majd menet közben beszámolhat a háttérben végzett feladat előrehaladásáról.

Háttérben futó eszközhasználat és vizuális értelmezés

A két modell képes eszközöket és API-hívásokat futtatni a háttérben, miközben a felhasználóval tovább beszélget. A rendszer nyugtázhatja a kérést, majd a feladat befejezéséig fenntarthatja a párbeszédet. A Google példái között szerepel az alkalmazotti betanítás valós idejű támogatása, a sakkjátszma vizuális kontextus alapján történő követése, valamint a többlépéses foglalások és aszinkron függvényhívások koordinálása.

A Gemini 3.8 Live Extended Thinking a bemutatott példák szerint nyers vázlatokból és valós idő közeli hangos visszajelzésekből funkcionális React-komponenseket készíthet. A modell beszédalapú együttműködéssel üzleti terveket és személyre szabott marketingeszközöket is összeállíthat.

A Google Workspace-ben a felhasználók a Docs Live, Gmail Live és Keep Live funkciókkal próbálhatják ki az Extended Thinking modellt. A Search Live a Gemini 3.8 Live segítségével lépésről lépésre adhat valós idejű hibaelhárítási segítséget. A Gemini alkalmazásban a felhasználók napi összefoglalót kérhetnek, a beérkező levelek rendezésében kaphatnak támogatást, vagy teendőket adhatnak át a rendszernek.

A Google teljesítmény- és biztonsági állításai

A Google szerint a Gemini 3.8 Live Extended Thinking az Artificial Analysis Speech to Speech Quality Index rangsorában 82,6-os eredménnyel az első helyen áll. A vállalat közlése alapján a modell a τ-Voice ügynöki feladatvégrehajtási tesztjén 68,6 százalékot, a Sierra τ-Voice-banking benchmarkján pedig 35,1 százalékot ért el. A Big Bench Audio teszten 97,7 százalékos eredményt közölt a Google.

A Gemini 3.8 Live a Speech Agent Arena mezőnyében a második helyet szerezte meg a vállalat szerint. A ServiceNow EVA-Bench tesztjén, amely hangalapú ügynökök összetett munkafolyamatait értékeli, a Google szerint a két modell az pontosság és a párbeszéd minősége közötti egyensúlyban a Pareto-frontot javította. A forrás jelzi, hogy ezt a tesztet a Live API-n, a Gemini Enterprise Agent Platformon futtatták.

A Google közlése szerint az AI-termékei által generált hangot SynthID-vízjellel látják el. A láthatatlan jel közvetlenül a hangkimenetbe épül, hogy az AI által létrehozott tartalom felismerhető maradjon. A vállalat a biztonsági részletekhez a model card dokumentumot ajánlja.

Elérhetőség fejlesztőknek és felhasználóknak

A Gemini 3.8 Live bevezetése a bejelentés szerint azonnal megkezdődött a Gemini API-ban és a Google AI Studio fejlesztői felületen. Vállalati ügyfelek számára a modell privát előzetesben érhető el a Gemini Enterprise-ban, a Gemini Enterprise for Customer Experience változatba pedig később érkezik. A felhasználók a Search Live-ban találkozhatnak vele.

A Gemini 3.8 Live Extended Thinking ugyancsak elindult a Gemini API-ban és a Google AI Studio-ban. Vállalati oldalon privát előzetesben jelenik meg a Gemini Enterprise-ban, később pedig a Gemini Enterprise for Customer Experience és a Google Workspace üzleti ügyfelei számára is elérhető lesz. A Gemini Live-ban mindenki használhatja, a Workspace Docs funkcióiban pedig a Google AI Pro és Ultra előfizetői, míg a Gmailben és a Keepben minden Google AI-előfizető számára kínálják.

A fejlesztői ökoszisztémát többek között az Agora, a Fishjam, a LangChain, a LiveKit, a Pipecat, a Vercel és a Vision Agents támogatja a Gemini Live API használatával. A Google a Salesforce, a Genspark és a Lumeris vállalatokkal is együttműködik az új modellek kapcsán. A bejelentés szeptember 17-én frissült.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Élő avatárt kapott a Gemini 3.8 Live
Termékek és eszközök2026. szeptember 24. 18:20

Élő avatárt kapott a Gemini 3.8 Live

A Google DeepMind bemutatta a Gemini 3.8 Live with Live Avatar rendszert, amely valós idő közeli videógenerálással egészíti ki a hangalapú párbeszédet. A vállalat…

Új Gemini hangmodellek érkeztek egyedi beszédhangokhoz
Modellek2026. szeptember 23. 17:25

Új Gemini hangmodellek érkeztek egyedi beszédhangokhoz

Két új szövegfelolvasó modellel bővül a Gemini család: a Gemini 3.8 Flash TTS a kreatív hangtervezésre, a Gemini 3.8 Flash-Lite TTS pedig nagy volumenű használatra…

A Vercel AI Gatewayre érkezett a Gemini 3.8 Live
Termékek és eszközök2026. szeptember 15.

A Vercel AI Gatewayre érkezett a Gemini 3.8 Live

A Vercel AI Gatewayen elérhetővé vált a Google Gemini 3.8 Live és a Gemini 3.8 Live Extended Thinking. A modellek valós idejű beszélt interakciókat kínálnak…