A Google bemutatta a Gemini 3.8 Live hangalapú AI-modelleket

A Google bemutatta a Gemini 3.8 Live és a Gemini 3.8 Live Extended Thinking modelleket, amelyek természetesebb hangalapú párbeszédet, valós idejű vizuális értelmezést és háttérben futó feladatvégrehajtást kínálnak. Az új modellek a Gemini API-ban, a Google Workspace-ben, a Searchben és a Gemini alkalmazásban jelennek meg.
- A Google bemutatta a Gemini 3.8 Live és a Gemini 3.8 Live Extended Thinking modelleket.
- A modellek valós időben értelmeznek vizuális bemeneteket, és 97 támogatott nyelv között válthatnak.
- Az eszközök és API-hívások a beszélgetés megszakítása nélkül, háttérben futhatnak.
- Az új modellek a Gemini API-ban, a Google AI Studio-ban és több Google-termékben jelennek meg.
- A generált hangot SynthID-vízjellel látják el.
Két modell eltérő feladatokra
A Google DeepMind szeptember 15-i bejelentése szerint a Gemini 3.8 Live és a Gemini 3.8 Live Extended Thinking a vállalat eddigi legfejlettebb élő párbeszédre készült modelljei. A Google szerint az új rendszerek intelligenciában és párhuzamos következtetésben is fejlődtek, így intuitívabbá válhat a velük folytatott együttműködés.
A Gemini 3.8 Live elsősorban a gyors, folyamatos párbeszédre, a méretezhetőségre és a költséghatékonyságra készült. A modell valós időben dolgozza fel a vizuális bemeneteket, és ezek alapján adhat kontextusosabb válaszokat. A beszélgetés közben automatikusan felismeri és váltja a támogatott nyelveket, összesen 97 nyelven.
A Gemini 3.8 Live Extended Thinking a nagyobb összetettségű feladatokra összpontosít. Többlépéses következtetést végez, miközben a beszélgetés folytatódhat. A modell a Google leírása szerint rövid szóbeli jelzésekkel, például a „Hadd ellenőrizzem...” mondattal reagálhat, majd menet közben beszámolhat a háttérben végzett feladat előrehaladásáról.
Háttérben futó eszközhasználat és vizuális értelmezés
A két modell képes eszközöket és API-hívásokat futtatni a háttérben, miközben a felhasználóval tovább beszélget. A rendszer nyugtázhatja a kérést, majd a feladat befejezéséig fenntarthatja a párbeszédet. A Google példái között szerepel az alkalmazotti betanítás valós idejű támogatása, a sakkjátszma vizuális kontextus alapján történő követése, valamint a többlépéses foglalások és aszinkron függvényhívások koordinálása.
A Gemini 3.8 Live Extended Thinking a bemutatott példák szerint nyers vázlatokból és valós idő közeli hangos visszajelzésekből funkcionális React-komponenseket készíthet. A modell beszédalapú együttműködéssel üzleti terveket és személyre szabott marketingeszközöket is összeállíthat.
A Google Workspace-ben a felhasználók a Docs Live, Gmail Live és Keep Live funkciókkal próbálhatják ki az Extended Thinking modellt. A Search Live a Gemini 3.8 Live segítségével lépésről lépésre adhat valós idejű hibaelhárítási segítséget. A Gemini alkalmazásban a felhasználók napi összefoglalót kérhetnek, a beérkező levelek rendezésében kaphatnak támogatást, vagy teendőket adhatnak át a rendszernek.
A Google teljesítmény- és biztonsági állításai
A Google szerint a Gemini 3.8 Live Extended Thinking az Artificial Analysis Speech to Speech Quality Index rangsorában 82,6-os eredménnyel az első helyen áll. A vállalat közlése alapján a modell a τ-Voice ügynöki feladatvégrehajtási tesztjén 68,6 százalékot, a Sierra τ-Voice-banking benchmarkján pedig 35,1 százalékot ért el. A Big Bench Audio teszten 97,7 százalékos eredményt közölt a Google.
A Gemini 3.8 Live a Speech Agent Arena mezőnyében a második helyet szerezte meg a vállalat szerint. A ServiceNow EVA-Bench tesztjén, amely hangalapú ügynökök összetett munkafolyamatait értékeli, a Google szerint a két modell az pontosság és a párbeszéd minősége közötti egyensúlyban a Pareto-frontot javította. A forrás jelzi, hogy ezt a tesztet a Live API-n, a Gemini Enterprise Agent Platformon futtatták.
A Google közlése szerint az AI-termékei által generált hangot SynthID-vízjellel látják el. A láthatatlan jel közvetlenül a hangkimenetbe épül, hogy az AI által létrehozott tartalom felismerhető maradjon. A vállalat a biztonsági részletekhez a model card dokumentumot ajánlja.
Elérhetőség fejlesztőknek és felhasználóknak
A Gemini 3.8 Live bevezetése a bejelentés szerint azonnal megkezdődött a Gemini API-ban és a Google AI Studio fejlesztői felületen. Vállalati ügyfelek számára a modell privát előzetesben érhető el a Gemini Enterprise-ban, a Gemini Enterprise for Customer Experience változatba pedig később érkezik. A felhasználók a Search Live-ban találkozhatnak vele.
A Gemini 3.8 Live Extended Thinking ugyancsak elindult a Gemini API-ban és a Google AI Studio-ban. Vállalati oldalon privát előzetesben jelenik meg a Gemini Enterprise-ban, később pedig a Gemini Enterprise for Customer Experience és a Google Workspace üzleti ügyfelei számára is elérhető lesz. A Gemini Live-ban mindenki használhatja, a Workspace Docs funkcióiban pedig a Google AI Pro és Ultra előfizetői, míg a Gmailben és a Keepben minden Google AI-előfizető számára kínálják.
A fejlesztői ökoszisztémát többek között az Agora, a Fishjam, a LangChain, a LiveKit, a Pipecat, a Vercel és a Vision Agents támogatja a Gemini Live API használatával. A Google a Salesforce, a Genspark és a Lumeris vállalatokkal is együttműködik az új modellek kapcsán. A bejelentés szeptember 17-én frissült.
Google DeepMind: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking

