Új Gemini hangmodellek érkeztek egyedi beszédhangokhoz

Két új szövegfelolvasó modellel bővül a Gemini család: a Gemini 3.8 Flash TTS a kreatív hangtervezésre, a Gemini 3.8 Flash-Lite TTS pedig nagy volumenű használatra készült. A Google DeepMind szerint a modellek természetes nyelvű utasításokból képesek egyedi beszédhangokat létrehozni, párbeszédeket soronként vezérelni, és beépített biztonsági eszközöket is kapnak.
- A Google DeepMind bemutatta a Gemini 3.8 Flash TTS és Gemini 3.8 Flash-Lite TTS modelleket.
- A Flash TTS egyedi karakterhangokhoz és részletes előadás-irányításhoz, a Flash-Lite nagy volumenű használathoz készült.
- A rendszer több mint 100 nyelvet és dialektust, valamint 2 000+ gyártásra kész hangot támogat.
- A hangmásolás 30 másodperces mintából működik, hozzájárulás-ellenőrzéssel, SynthID vízjelezéssel és C2PA adatokkal.
- A Gemini 3.8 Flash TTS a Gemini API-ban és a Google AI Studio-ban indul, a Gemini Enterprise-ban később érkezik.
Hangtervező stúdiót ígér a Gemini 3.8 TTS
A Google DeepMind 2026. szeptember 23-án mutatta be a Gemini 3.8 Flash TTS és a Gemini 3.8 Flash-Lite TTS modelleket. A vállalat megfogalmazása szerint ezek az eddigi legkifejezőbb hanggeneráló modelljei, amelyek a statikus hangelőbeállítások helyett dinamikus kreatív stúdióként használhatók.
A Gemini 3.8 Flash TTS-t mélyebb kreatív irányításra és karaktertervezésre szánják. A modell természetes nyelvű utasítások alapján képes teljesen új hangokat létrehozni, például játékokhoz, immerzív hangoskönyvekhez, podcastokhoz és interaktív médiához. A felhasználó soronként adhat instrukciókat az előadásmódra, beleértve a színészi jelzéseket, a tempót, a dialektusváltásokat és a beszélgetés közbeni visszajelzéseket.
A Gemini 3.8 Flash-Lite TTS ezzel szemben nagy volumenű, költséghatékony skálázásra készült. A Google szerint nagy mennyiségű szinkronhoz, hangos tartalomgyártáshoz és kifejező hangügynökökhöz optimalizálták, finomhangolható tónussal, tempóval és érzelmi árnyalatokkal.
Egyedi hangok, hangmásolás és soronként rendezhető párbeszéd
A Google a korábbi 30 eredeti hangról „végtelen könyvtárra” való váltásként írja le az új megközelítést. A Gemini 3.8 Flash TTS több mint 100 nyelven és dialektusban enged hangokat létrehozni szerep, akcentus és hangkarakterisztika megadásával. A vállalat példái között szerepel egy drámai, tüzet okádó sárkány, valamint egy sajátos regionális ritmusú narrátor is.
A modellhez több mint 2 000, gyártásra kész hangból álló könyvtár is tartozik, széles nyelvi lefedettséggel. A forrás példaként említi a mexikói spanyolt, a quebeci franciát és a skót angolt. A hangmásolási funkció 30 másodperces hangmintából tud konzisztens hangprofilt létrehozni, ha a felhasználó a saját hangját vagy olyan hangot ad meg, amelynek használatára joga van.
A Google szerint a hangmásolást beépített hozzájárulás-ellenőrzés, SynthID vízjelezés és C2PA hitelesítő adatok támogatják. A létrehozott egyedi hangok menthetők és kezelhetők, hogy hosszabb projektekben is következetes maradjon az előadás. A vállalat egy később érkező voice remixing funkciót is jelez, amellyel a könyvtárból választott hangok hangszíne, hangmagassága, tempója és akcentusa finomítható lesz.
Mindkét új TTS modell soronkénti előadás-irányítást kínál. A felhasználó írhat saját színpadi instrukciókat, vagy természetes forgatókönyvi jelzésekkel hagyhatja, hogy a Gemini alakítsa a megszólalást. A hosszú formátumú generálásnál a Google célja a magas hangminőség, a természetes tempó és a karakterhangszín megtartása órákon át, minimális beszélőeltolódással. A rendszer natív kétbeszélős jelenetrendezést is támogat egyetlen szkriptből, valamint nem verbális jelzéseket, például <laughs>, <sigh> és <gasp> elemeket, illetve aktív figyelmet jelző közbevetéseket, például |mhm| vagy |yeah| formában.
Benchmarkok, biztonság és induló felületek
A Google DeepMind szerint a Gemini 3.8 Flash TTS a Hume AI Voice Design Benchmark összesített rangsorában az első helyet érte el 71,4-es pontszámmal, és az akcentusmodellezésben is vezet 60,8-as értékkel. A vállalat azt is állítja, hogy a Gemini 3.8 Flash TTS és a Gemini 3.8 Flash-Lite TTS a Hume AI Overall Quality Index első és második helyét szerezték meg. A forrás szerint a modell jelentős javulást mutat több felhasználási esetben, például hosszú formátumú tartalomnál és kétbeszélős forgatókönyv-vezérlésnél a Gemini 3.1 Flash TTS-hez képest.
A Voice Arena vak emberi preferenciatesztjein a Google állítása szerint a Gemini 3.8 Flash és Flash-Lite TTS vezető pozíciókat szerzett több fontos globális nyelvben, köztük japánban, brazil portugálban, vietnámi nyelven, modern sztenderd arabban, mexikói spanyolban és hindiben. A modellek több mint 100 nyelvet támogatnak.
A biztonsági megközelítés központi eleme a hozzájárulás és az átláthatóság. Hangmásolásnál a rendszer a hang tulajdonosától származó szóbeli hozzájárulási felvételt kér, amelynek egyeznie kell a referencia-beszélővel. A Google szerint minden Gemini Audio modellel generált hangklip SynthID vízjelet kap. Ez a nem észlelhető vízjel közvetlenül a hangkimenetbe kerül, hogy az AI-generált beszéd később felismerhető maradjon.
A Gemini 3.8 Flash TTS bevezetése a közlés szerint a bejelentés napján indult. Fejlesztők a Gemini API-ban és a Google AI Studio-ban érhetik el, vállalatok számára hamarosan API-n keresztül érkezik a Gemini Enterprise-ban, mindenki számára pedig a Gemini Notebookban jelenik meg. A modellek emellett a Google AI Studio audio playground felületén is kipróbálhatók, ahol új hangidentitások hozhatók létre vagy saját hang replikálható, majd kétbeszélős forgatókönyv-szerkesztőben irányítható a megszólalás.
Mit jelenthet ez a felhasználóknak és a piacnak?
Az új modellek a Google szerint alkotóknak, fejlesztőknek és vállalatoknak adnak eszközt többnyelvű, kifejező hangélmények készítésére. A lehetséges felhasználások között a forrás hangoskönyveket, podcastokat, játékokat, interaktív médiát, nagy volumenű szinkront, médiatartalmak lokalizálását és beszélgető hangügynököket említ.
A Gemini API használatával olyan fejlesztői platformok, mint az Agora, a LiveKit, a Pipecat és a Vercel, a Google szerint nagy teljesítményű beszédgenerálási élményeket tehetnek elérhetővé. A vállalat partnereket is felsorol, köztük a Figma, HeyGen, Linguana, Wondercraft, 99.co és Ollang neveit, amelyek az új TTS modelleket globális szinkronizálás, regionális akcentusokkal történő lokalizálás és skálázható beszélgető hangügynökök támogatására integrálják.
Google DeepMind: Gemini 3.8 text-to-speech says hello

