Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Cartesia ugyanazt a hangot akár 25 nyelven is megszólaltatja

2026. szeptember 23.Forrás: Cartesia
A Cartesia ugyanazt a hangot akár 25 nyelven is megszólaltatja
Kép: Cartesia

A Cartesia Multilingual Voices szolgáltatása több mint 50 könyvtári hangot szólaltat meg akár 25 nyelven, miközben megőrzi a hang karakterét. A vállalat szerint a felhasználók saját hangklónjaikat is többnyelvűvé tehetik.

A lényeg röviden
  • Több mint 50 könyvtári hang támogat akár 25 nyelvet.
  • A saját hangklónokhoz akár 9 új akcentus és nyelv adható.
  • A nyelveket és akcentusokat anyanyelvi beszélők értékelik.
  • A hangok használati helyzetek szerinti értékelést is kapnak.
  • A fejlesztők ugyanazzal a hangazonosítóval választhatnak nyelvet.

Egy hang több nyelven

A Cartesia 2026. szeptember 23-i bejelentése szerint a Multilingual Voices célja, hogy egy márka ugyanazzal a hangidentitással jelenhessen meg különböző nyelveken. A hang karakterét több tulajdonság együttese adja, például a hangmagasság, a melegség, a hangszín, valamint a beszéd tempója és a hangsúlyozás.

A vállalat szerint ezeket az elemeket egyetlen nyelven is nehéz következetesen megőrizni, több nyelven pedig még összetettebb feladat. A Cartesia példaként azt írja, hogy korábban egy öt nyelven működő márkahanghoz öt külön szinkronszínészre és külön felvételekre lehetett szükség. Az eredmény így angolul egy emberhez, japánul pedig akár egy másik személyhez is kötődhetett.

A szolgáltatás több mint 50 könyvtári hangot kínál, amelyek akár 25 nyelven natívan szólalhatnak meg. Emellett a saját hangklónok többnyelvűvé tétele is elérhető. A Cartesia közlése szerint így ugyanaz a hang használható a márka különböző piacain.

A natív kiejtést külön ellenőrzik

A Cartesia minden nyelvet és akcentust anyanyelvi beszélők bevonásával értékel. A vizsgálat része, hogy az akcentus megmarad-e, illetve a dátumok, számok és pénznemek a helyi szokásoknak megfelelően hangzanak-e el.

A bemutatott példák között szerepel az amerikai és mexikói angol, a brazil portugál, a kanadai francia, a német, az olasz, a héber, a hindi, a tamil, a telugu és a mandarin kínai. A vállalat ügyfélszolgálati, értékesítési és egészségügyi példákon is bemutatja a technológiát. Ugyanaz a hang ügyfélszolgálati válaszokat, értékesítési szöveget vagy egy orvosi időpont visszaigazolását is megszólaltathatja különböző nyelveken.

A Cartesia nem kizárólag a hangminőséget pontozza. A hangokat valós felhasználási helyzetekben is értékeli, mert szerintük egy nyugodt, lágy hang jól illik egy meditációs alkalmazáshoz, de kevésbé megfelelő lehet egy csalásriasztásnál. A cél a megfelelő hang kiválasztása az adott feladathoz, különösen olyan esetekben, ahol fontos a bizalom és a helyi nyelvi illeszkedés.

Könyvtári hangok és saját hangklónok

A fejlesztők a szöveghez egy locale értéket adhatnak meg, majd ugyanazt a hangazonosítót használhatják minden támogatott nyelvnél. A Cartesia példái között szerepel az angol, a spanyol, a francia, a japán és a hindi. A szolgáltatás a dashboard Voice Library részében is kipróbálható: a felhasználó kiválaszt egy többnyelvű hangot, a More actions menüben megnyitja a Try in playground lehetőséget, majd nyelvet választ és lejátsza a beírt szöveget.

Saját hanghoz a Cartesia szerint akár tíz másodpercnyi hanganyagból is létrehozható Instant Voice Clone. Ezután a dashboardon legfeljebb 9 új akcentus és nyelv adható hozzá, vagy használható az Add Voice Accents API, ugyanazzal a voice_id azonosítóval.

A vállalat három ügyfélpéldát is közöl. A Guideless többnyelvű útmutatókat készít ugyanazzal a hanggal, a Forevermore pedig rövid hangfelvételből rekonstruált hanggal teszi lehetővé, hogy a családtagok saját nyelvükön halljanak üzeneteket. Egy meg nem nevezett lakhatási szolgáltató a Cartesia szerint havi több mint 5 millió hívást kezel, félmillió megfizethető lakóegységhez kapcsolódóan, több nyelven és éjjel-nappal.

CartesiaMultilingual VoicesForevermoreGuidelesshang és beszédvállalati AI

Kapcsolódó hírek

Pika Speech: öt másodpercnyi hangból készít beszédet a modell
Modellek2026. augusztus 18.

Pika Speech: öt másodpercnyi hangból készít beszédet a modell

A Pika bemutatta a Pika Speech nevű szövegfelolvasó modelljét, amely néhány másodpercnyi referenciahangból képes hangot klónozni, és egy kérésben akár öt percnyi…

Érzelmesebb hangot ad a hangalapú ügynököknek a LiveKit új módja
Termékek és eszközök2026. augusztus 12.

Érzelmesebb hangot ad a hangalapú ügynököknek a LiveKit új módja

A LiveKit expressive mode funkciója a beszélgetés érzelmi kontextusához igazítja a hangalapú ügynökök előadásmódját. A vállalat szerint az új lehetőség egyetlen…

Két új funkcióval bővült a Cartesia Ink-2 beszédfelismerő modellje
Termékek és eszközök2026. augusztus 11.

Két új funkcióval bővült a Cartesia Ink-2 beszédfelismerő modellje

A Cartesia két új funkcióval egészítette ki Ink-2 beszédfelismerő modelljét: a kulcsszavas befolyásolással pontosabban írhatók át a nevek és szakterminusok, az állítható…