A Google DeepMind bemutatta a Gemini 3.5 Transcribe beszédfelismerő modellt

A Google DeepMind 2026. augusztus 26-án bemutatta a Gemini 3.5 Transcribe modellt, amelyet pontos, intelligens, valós idejű beszédátírásra terveztek. A modell a Gemini API-ban, a Google AI Studio-ban és a Gemini Enterprise Agent Platformon is elérhető nyilvános előzetesként.
- A Google DeepMind 2026. augusztus 26-án mutatta be a Gemini 3.5 Transcribe modellt.
- A modell két API-n használható: valós idejű streameléshez és előre rögzített hanganyagok feldolgozásához.
- Az Artificial Analysis mérése szerint az átlagos WER 4,0% streamelt és 2,6% nem streamelt használatnál.
- A rendszer több mint 85 nyelvet támogat, és előre rögzített hangnál legfeljebb három beszélőt azonosít.
- A modell nyilvános előzetesként elérhető fejlesztőknek és vállalatoknak, valamint megjelenik több Google-termékben.
Új modell beszédből szöveggé alakításhoz
A Google DeepMind közlése szerint a Gemini 3.5 Transcribe a cég eddigi legpontosabb beszédből szöveggé alakító modellje, amelyet intelligens hangalapú interakciókhoz készítettek. A modell célja, hogy a nyers hangból pontos, formázott szöveget állítson elő, miközben kezeli a háttérzajt, a szakszókincset és a beszéd közbeni javításokat.
A fejlesztést a Google már több saját termékben is használja. A forrás a Gemini alkalmazást, az Androidot, a Rambler funkciót, valamint a Gemini macOS alkalmazást említi. A vállalat most a fejlesztőknek is megnyitja a hozzáférést a Gemini API-n keresztül, a Google AI Studio-ban és a Gemini Enterprise Agent Platformon.
A modell két API-n keresztül használható. A Live API a gemini-3.5-transcribe-live modellel folyamatos, kétirányú streamelést kínál másodperc alatti késleltetéssel interaktív hangos alkalmazásokhoz. Az Interactions API a gemini-3.5-transcribe modellel előre rögzített hanganyagokat, megbeszéléseket és hívásnaplókat tud átírni, beszélőazonosítással és szószintű időbélyegekkel.
Mit tud a Gemini 3.5 Transcribe
A Google DeepMind szerint a modell a természetes beszédstílus rögzítésére készült, hogy jobban értse a felhasználói szándékot és felismerje az egyedi szókincset. A rendszer kezeli az önjavításokat, például amikor a beszélő menet közben módosít egy időpontot, eltávolítja a töltelékszavakat, és automatikusan formázza a szöveget.
A modell funkcióhívásokkal más Gemini modellekre is továbbíthat összetettebb feladatokat, például képgenerálást vagy fájlelemzést. Ez a képesség a forrás szerint jelenleg a Gemini macOS alkalmazásban érhető el.
A pontosságról a Google DeepMind az Artificial Analysis mérésére hivatkozik. Eszerint a Gemini 3.5 Transcribe átlagos szóhibaaránya, vagyis WER értéke streamelt használatnál 4,0%, nem streamelt használatnál 2,6%. A vállalat szerint a modell zajos, valós környezetben is erős teljesítményt mutat, és képes alfanumerikus elemek, például irányítószámok és rendelésazonosítók pontos rögzítésére.
A rendszer egyedi szókincshez is igazítható, így szakzsargont és különleges írásmódokat is felismerhet. A Google DeepMind több mint 85 nyelv automatikus felismerését és átírását említi, regionális akcentusokkal és különböző dialektusokkal együtt. Előre rögzített hangnál a modell legfeljebb három beszélőhöz tudja rendelni a megszólalásokat időbélyegekkel, a háromnál több beszélő támogatása kísérleti.
Gyorsabb és pontosabb a korábbi modellnél a Google szerint
A Google DeepMind a Gemini 3.5 Transcribe-ot a korábbi Chirp 3 átírómodellhez viszonyítja. A vállalat szerint az új modell új képességeket, jobb szóhibaarányt és jelentősen alacsonyabb késleltetést hoz. Az Artificial Analysis mérése alapján a végleges átírásig eltelt idő például 70%-kal javult.
A FLEURS benchmarkon, a legfontosabb nyelvek és területi változatok egy csoportján mérve a modell a Google DeepMind szerint javulást mutat a Chirp 3-hoz képest. A forrás 5,50%-os WER értéket közöl streamelt módban, és 5,04%-os WER értéket nem streamelt használatban.
A Google DeepMind azt is kiemeli, hogy a Gemini 3.5 Transcribe kezeli az élő nyelvváltásokat és a folyamatos streamelt átírást. A modell emellett a beszédben előforduló megakadások tisztítására is képes a vállalat által intelligens átírásnak nevezett funkcióval.
Google-termékekben és fejlesztői platformokon is megjelenik
A Gemini 3.5 Transcribe a Google több felületén is szerepet kap. Androidon, a Gboard Rambler funkcióján keresztül a beszélt gondolatokat formázott szöveggé alakítja, miközben kiszűri a töltelékszavakat. A felhasználók hanggal szerkeszthetnek, javíthatnak elírásokat és módosíthatják az írás stílusát.
A Google Antigravity esetében a modell a felhasználó engedélyével képernyőkörnyezetet és csevegési előzményeket is felhasználhat, hogy pontosabban írja át a fájlneveket, az agent gondolatait és az aktív dokumentumokat. A Google AI Studio Build módjában a forrás szerint a fejlesztők hanggal is készíthetnek alkalmazásokat.
A Gemini macOS alkalmazásban a modell a természetes beszédet tiszta, formázott szöveggé alakítja, és hangutasításokat is támogat. A Google DeepMind szerint más Gemini modellek bevonásával helyi fájlok összegzésére, szövegek alkalmazások közötti átdolgozására és képgenerálásra is használható a kurzor helyén, hanggal vezérelve. A Chrome-ba később érkezik az a lehetőség, hogy a felhasználók bármely webes mezőben diktálhassanak.
A Google DeepMind fejlesztői partnereket is megnevezett. A Gemini Live API-ra építve az Agora, a Fishjam, a LangChain, a LiveKit, a Pipecat, a Vercel és a Vision Agents olyan hangvezérelt felületek építését és telepítését támogatja, amelyeknél a valós idejű médiastreamelési infrastruktúrát ezek a platformok kezelik. A forrás szerint a vivo, az Intellitek Health és a Lingopal is pozitív visszajelzést adott a késleltetésről, a pontosságról és a nyelvi támogatásról.
Mit jelent ez a felhasználóknak és a fejlesztőknek
A bejelentés legfontosabb következménye, hogy a Google a beszédátírást több szinten is beépíti a Gemini ökoszisztémába. A fejlesztők nyilvános előzetesként férhetnek hozzá a Gemini API-ban, a Google AI Studio-n és a Google Antigravityn keresztül. A vállalati felhasználóknak a modell a Gemini Enterprise Agent Platformon érhető el nyilvános előzetesként, és később a Gemini Enterprise for Customer Experience szolgáltatásba is érkezik.
A végfelhasználók oldalán a forrás a Gemini macOS alkalmazást említi angol nyelven, a Rambler funkciót Androidon kiválasztott országokban és nyelveken, valamint a Chrome későbbi támogatását. A Google DeepMind leírása alapján a modell olyan helyzetekben lehet hasznos, ahol a diktálásnak nemcsak pontosnak kell lennie, hanem a beszéd természetes javításait, a szaknyelvet, a többnyelvűséget és a formázást is kezelnie kell.
Google DeepMind: Intelligent transcription with Gemini 3.5 Transcribe


