Két új Gemini 3.8 beszédmodell érkezett a Vercel AI Gateway-re

A Vercel AI Gateway-n elérhetővé vált a Google két új beszédszintetizáló modellje, a Gemini 3.8 Flash-Lite TTS és a Gemini 3.8 Flash TTS. A modellek több mint 100 nyelven képesek szövegből beszédet létrehozni, és hosszabb narrációkat, két beszélős párbeszédeket, valamint részletes előadásvezérlést is támogatnak.
- Elérhetővé vált a Gemini 3.8 Flash-Lite TTS és a Gemini 3.8 Flash TTS a Vercel AI Gateway-n.
- Mindkét modell több mint 100 nyelven generál beszédet szövegből.
- A modellek hosszú narrációkat és két beszélős párbeszédeket is támogatnak.
- A Flash-Lite TTS nagy volumenű generálásra, a Flash TTS kifejező hangokra és egyedi karakterekre készült.
- A modellek az AI SDK 7-es vagy újabb verziójával használhatók.
Két eltérő feladatra szánt modell
A Vercel szeptember 23-i közleménye szerint a két Gemini 3.8 modell eltérő használati célokra készült. A google/gemini-3.8-flash-lite-tts modellt nagy mennyiségű beszéd generálására optimalizálták. A fejlesztők a hangszínt, a beszédtempót és az egyes sorok előadását is szabályozhatják.
A google/gemini-3.8-flash-tts ezzel szemben kifejezőbb hanggenerálásra és egyedi karakterek megalkotására szolgál. Ennél a modellnél a felhasználók színészi utasításokat, tempót, akcentusokat és társalgási reakciókat is megadhatnak.
Több mint 100 nyelv és két beszélő támogatása
A Vercel leírása alapján mindkét modell több mint 100 nyelven generál beszédet szövegből. A rendszerek hosszabb formátumú narrációk létrehozására és két beszélős párbeszédek kezelésére is használhatók.
Ez azt jelenti, hogy a fejlesztők egyetlen integráción belül különböző beszédhelyzeteket állíthatnak be. A Flash-Lite TTS a nagy volumenű előállítást és a soronkénti vezérlést célozza, míg a Flash TTS-nél a kifejező előadás, az egyedi karakterhang és a beszélgetési reakciók kapnak hangsúlyt.
Használat az AI SDK-n keresztül
A beszédgeneráláshoz a fejlesztőknek a megfelelő modellazonosítót kell átadniuk az AI SDK 7-es vagy újabb verziójának. A Vercel példakódja a generateSpeech függvényt, a gateway.speechModel metódust és a google/gemini-3.8-flash-lite-tts azonosítót használja.
A bemenetben megadható a felolvasandó szöveg, a hang neve, valamint az előadásra vonatkozó utasítás. A közlemény példája a Kore hangot, a „meleg, nyugodt és lassú beszédet” előíró utasítást, valamint a WAV kimeneti formátumot használja. Az eredményből a kód egy speech.wav nevű fájlt ír ki.
A két modellt a Vercel modelljátszóterében is ki lehet próbálni. A vállalat külön szövegfelolvasási útmutatót kínál a beállításhoz, a két beszélős párbeszédekhez és további példákhoz. A bejelentés alapján a fejlesztők így közvetlenül az AI Gateway-n keresztül érhetik el a Gemini 3.8 TTS modelleket, és a feladathoz illő modellt választhatják.


