Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Gemini 3.8 Flash TTS és Flash-Lite: 29 nyelv és az ár választja el őket

2026. szeptember 25. 12:50Forrás: Picsart
Gemini 3.8 Flash TTS és Flash-Lite: 29 nyelv és az ár választja el őket
Kép: Picsart

A Gemini 3.8 Flash TTS és a Flash-Lite TTS ugyanazokat a hangkezelési és vezérlési lehetőségeket kínálja, a legfontosabb eltérés a nyelvi lefedettség és az ár. A Flash 130 nyelvet támogat, míg a Flash-Lite 101-et, utóbbi pedig körülbelül harmadával olcsóbban generál hangot.

A lényeg röviden
  • A Flash TTS 130, a Flash-Lite TTS 101 nyelvet támogat.
  • A Flash-Lite körülbelül harmadával olcsóbban generál hangot.
  • Mindkét modell támogat egyéni hangokat, hangreplikációt és kétbeszélős jeleneteket.
  • Egy futtatás nagyjából 11 percnyi beszédet készít.
  • A Flash TTS összetett párbeszédekhez, akcentusokhoz és nehéz kiejtéshez készült.

A két modell közös képességei

A Google szeptember 23-án adta ki a két új szövegből beszédet előállító modellt. A Picsart szeptember 25-i összehasonlítása szerint a nevük alapján nagyobb különbségre lehetne számítani, mint amekkora a gyakorlatban van. Ugyanúgy működik a szöveg felolvasásának irányítása, ugyanazokat a hangokat és ugyanakkora hosszúságú felvételeket készítik, így egy meglévő forgatókönyv változtatás nélkül átvihető egyik modellről a másikra.

Mindkét rendszerben megadható a teljes sor hangulata, például sürgető suttogás vagy meleg, lelkes előadás. A készítő külön helyre illeszthet nevetést, sóhajtást, levegővételt vagy szünetet is, miközben az utasításokat a rendszer nem olvassa fel. Mindkét modell 30 előre elkészített hangot, több száz további hangot tartalmazó bővített könyvtárat, szöveges leírással létrehozható egyéni hangokat és rövid mintából, beleegyezési ellenőrzéssel készített hangreplikációt kínál.

A két modell egyetlen forgatókönyvből két beszélő párbeszédét is képes létrehozni, természetes váltásokkal. A fájlformátumok és a tömeges feldolgozás lehetőségei szintén megegyeznek.

A legfontosabb eltérések: nyelvek, ár és hangminőség

A Flash TTS 130 nyelvet kezel, a Flash-Lite TTS 101-et. A csak a Flash által támogatott 29 nyelv között szerepel többek között a finn, a litván, a luxemburgi, a thai, a svéd, a szlovén, a szuahéli és a szomáli. Ezért többnyelvű lokalizáció előtt érdemes ellenőrizni a célpiacokat, még akkor is, ha a Flash-Lite tömeges munkára készült.

A Flash-Lite hanggenerálása körülbelül harmadával olcsóbb a Flash TTS-nél. A forrás szerint mindkét modell díjai 2027 elején emelkednek, a két ár közötti különbség azonban ezután is megmarad.

A Google a Flash TTS-t hangoskönyvekhez, stúdióminőségű narrációhoz, összetett, több szereplős jelenetekhez, erős karakterjátékhoz, nehéz kiejtéshez és regionális akcentusokhoz ajánlja. A Flash-Lite inkább nagy mennyiségű feldolgozásra, hangasszisztensekhez, felolvasási funkciókhoz és mindennapi, egyhangú felvételekhez készült. Mindkettő kezeli a beszélő mondatába rétegzett hallgatói reakciókat, de a ténylegesen egyidejű vagy egymásba vágó beszéd a Flash TTS-en működik a legjobban.

A hosszú felvételeknél 11 perces darabokkal kell számolni

Egy futtatásban mindkét modell nagyjából 11 percnyi beszédet készít. Egy hangoskönyv vagy egész estés narráció ezért több részletből áll össze, nem egyetlen felvételből. A Picsart szerint a lényeg az, hogy a részek között megmarad a hang, a hangszín, a hangerő és a térérzet következetessége. A hosszabb munkákat így érdemes 11 perces szakaszokra bontani.

A választás a felhasználási céltól függ. A Flash-Lite lehet az olcsóbb opció nagy volumenű, széles körben támogatott nyelven végzett munkáknál, miközben az egyéni hangok és a hangreplikáció is elérhető marad. A Flash TTS akkor indokoltabb, ha a projekt valamelyik kizárólagosan támogatott nyelvet, összetett párbeszédet, regionális akcentust, nehéz kiejtést vagy erősebb színészi előadást igényel.

A váltás egyszerű, mivel a szkript, a hang és a vezérlési utasítások mindkét modellen használhatók. A forrás azt javasolja, hogy bizonytalan helyzetben ugyanabból a szövegből készüljön egy-egy 30 másodperces minta, majd ezek alapján történjen a döntés.

Kapcsolódó hírek

A Google szeptemberi AI újdonságai: Gemini 4 Argon és WeatherNext 3
Modellek2026. október 2. 17:00

A Google szeptemberi AI újdonságai: Gemini 4 Argon és WeatherNext 3

A Google szeptemberben bemutatta a Gemini 4 Argon modellt, új hangalapú AI-eszközöket és a Gemini alkalmazáshoz kapcsolható szolgáltatásokat. A vállalat tudományos…

Új Gemini hangmodellek érkeztek egyedi beszédhangokhoz
Modellek2026. szeptember 23. 17:25

Új Gemini hangmodellek érkeztek egyedi beszédhangokhoz

Két új szövegfelolvasó modellel bővül a Gemini család: a Gemini 3.8 Flash TTS a kreatív hangtervezésre, a Gemini 3.8 Flash-Lite TTS pedig nagy volumenű használatra…

Két új Gemini 3.8 beszédmodell érkezett a Vercel AI Gateway-re
Termékek és eszközök2026. szeptember 23.

Két új Gemini 3.8 beszédmodell érkezett a Vercel AI Gateway-re

A Vercel AI Gateway-n elérhetővé vált a Google két új beszédszintetizáló modellje, a Gemini 3.8 Flash-Lite TTS és a Gemini 3.8 Flash TTS. A modellek több mint 100…