Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Érzelmesebb beszédszintézist ígér az ElevenLabs új Eleven v4 modellje

2026. szeptember 28.Forrás: ElevenLabs
Érzelmesebb beszédszintézist ígér az ElevenLabs új Eleven v4 modellje
Kép: ElevenLabs

Az ElevenLabs új szövegfelolvasó modellje, az Eleven v4 a cég szerint pontosabban kezeli a hangnemet, az érzelmet, a tempót és a beszédhelyzetet. A modell mellé érkezett az Eleven v4 Turbo is, amelyet alacsony késleltetésű felhasználásra, például beszélgető ügynökökhöz szánnak.

A lényeg röviden
  • Az ElevenLabs bemutatta az Eleven v4 és Eleven v4 Turbo text-to-speech modelleket.
  • A vállalat szerint az Eleven v4 pontosabban kezeli a hangnemet, az érzelmet, a tempót és a kontextust.
  • Az Eleven v4 Turbo medián ideje az első hallható beszédig körülbelül 150 ms.
  • Mindkét modell több mint 90 nyelvet támogat.
  • Az Instant Voice Clones már 10 másodpercnyi hanganyagból is képes hangot rögzíteni a bejelentés szerint.

Érzelmesebb felolvasás és pontosabb instrukciókövetés

Az ElevenLabs 2026. szeptember 28-án jelentette be az Eleven v4 nevű text-to-speech modelljét és annak alacsony késleltetésű változatát, az Eleven v4 Turbót. A vállalat szerint az Eleven v4 az eddigi legérzelmesebb szövegfelolvasó modelljük, amelyet arra terveztek, hogy értelmezze a hangnemet, a tempót, az érzelmet, a karaktert és a szövegkörnyezetet.

A cég azt állítja, hogy a modell dramatikus, gyengéd, sürgető, komikus vagy társalgási megszólalást is képes létrehozni, miközben megőrzi a beszélő hangazonosságát. Az ElevenLabs szerint a több beszélős jelenetekben természetesebbek lettek a dinamikák is, mert a szereplők a beszélgetés kontextusára reagálnak, nem különálló sorokként hatnak.

A bejelentés szerint az Eleven v4 az Artificial Analysis 2026. szeptemberi Provider Voice Arena Leaderboard listáján az első helyen szerepelt. Az ElevenLabs emellett vak, közvetlen összehasonlító tesztekre hivatkozik, amelyekben a hallgatók nagyjából 75 százaléka részesítette előnyben az Eleven v4-et versenytárs modellekkel szemben. A forrás szerint a tesztben a Cartesia Sonic 3.6, az Inworld TTS-2, a Google Gemini 3.8 Flash-Lite TTS és a Google Gemini 3.8 Flash TTS szerepelt ellenfélként.

Turbo változat beszélgető ügynökökhöz

Az Eleven v4 teljesen új architektúrára épül, az Eleven v4 Turbo pedig ugyanezt a technológiát viszi alacsony késleltetésű felhasználásokba. A vállalat szerint az Eleven v4 Turbo medián következtetési késleltetése körülbelül 100 ms, a medián idő az első hallható beszédig pedig körülbelül 150 ms.

Az ElevenLabs úgy pozicionálja a Turbo modellt, mint megoldást olyan hangalapú ügynökökhöz, ahol egyszerre fontos a gyors válasz és a kifejező beszéd. Példaként egészségügyi felhasználást említ, ahol az ügynöknek megnyugtatóan kell kommunikálnia és pontosan kell kiejtenie orvosi kifejezéseket, valamint játékos környezetet, ahol gyors, szlenggel dolgozó ügynökökre lehet szükség.

Az Eleven v4 Turbo az ElevenLabs beszélgető ügynökökhöz készült platformjához, az ElevenAgentshez is kapcsolódik. A vállalat szerint kutatói és mérnökei az Eleven v4 Turbót és az ElevenAgents rendszert együtt optimalizálták, hogy kifejezőbb, megbízhatóbb és alacsony késleltetésű ügynököket lehessen készíteni.

Természetes nyelvi vezérlés, IPA és több beszélő

Az Eleven v4 finomabb vezérlést ad a felhasználóknak a kimenet fölött. A bejelentés szerint természetes nyelven is leírható, hogyan hangozzon egy sor, és külön instrukciók adhatók bizonyos kifejezések kiejtésére, az érzelemre vagy akár hangeffektekre.

A modell beágyazott címkéket is követ, például a forrásban szereplő [laughs], [said angrily in French accent], [light rain] vagy [phone buzzing] utasításokat. Az ElevenLabs szerint az Eleven v4 ezeket a hangcímkéket és rendezői utasításokat pontosabban követi, mint a korábbi modellek. A fejlesztői dokumentáció ismerteti a teljes címkeszintaxist és az API-n keresztüli használatot.

A vállalat jelentős javulást ígér az International Phonetic Alphabet, vagyis IPA fonémák támogatásában is, így az egyedi kiejtések megbízhatóbban működhetnek. A modell a beszélők azonosítására szolgáló új módszerrel őrzi meg az egyes hangok sajátosságait, ami az ElevenLabs szerint ügynökbeszélgetésekben, hangoskönyvekben és hirdetésekben is következetesebb megszólalást ad.

Több mint 90 nyelv és erősebb hangklónozás

Az Eleven v4 és az Eleven v4 Turbo több mint 90 nyelvet támogat. Az ElevenLabs szerint egy egyetlen nyelven rögzített hang más nyelveken is folyékonyan megszólalhat, miközben anyanyelvi beszélőre jellemző akcentust vesz fel, és megtartja az eredeti hang identitását. A cég állítása szerint az akcentuskövetés erősebb lett, ezért a hang a generálás során kevésbé tér vissza a forrásakcentushoz.

A lokalizáció és a szinkron szempontjából ez azt jelenti, hogy a kiválasztott márkahang, legyen az a forrás példája szerint egy együttműködő híresség hangja vagy egy vállalati stílushoz illő tónus, az Eleven v4 által támogatott nyelveken is használható.

A hangklónozásnál az ElevenLabs hitelesebb, erősebb és következetesebb eredményt ígér az Eleven v4 és az Eleven v4 Turbo esetében. A bejelentés szerint az Instant Voice Clones már 10 másodpercnyi hanganyagból is nagy hűségű hangot tud rögzíteni. Az Eleven v4 támogatja a Professional Voice Clones, röviden PVC használatát is a legnagyobb hűséget igénylő klónozási feladatokhoz.

Mit jelent ez a felhasználóknak és a piacnak

Az ElevenLabs az Eleven v4-et olyan tartalmakhoz szánja, ahol a megszólalás módja ugyanannyira fontos, mint maga a szöveg. A vállalat hangoskönyveket, karakterelőadásokat, voiceovert, szinkront, valamint beszélgető ügynökök lokalizálását említi fő felhasználási területként.

A modell hosszabb tartalmak készítését is érintheti. A bejelentés szerint megbízhatóbb lett a request stitching, vagyis a generálások összefűzése hosszabb formátumú anyagokhoz, ami javítja az ElevenLabs Studio és az ElevenLabs Reader App használati élményét.

Az Eleven v4 és az Eleven v4 Turbo már elérhető az ElevenAgents, az ElevenCreative és az ElevenAPI felületeken. A vállalat közlése szerint ingyenes fiókkal is el lehet kezdeni a generálást az új modellekkel.

Kapcsolódó hírek

22 milliárd dollárra értékelték az ElevenLabsot
Cégek és üzlet2026. szeptember 30.

22 milliárd dollárra értékelték az ElevenLabsot

Az ElevenLabs 300 millió dolláros, dolgozói részvényeladási programot zárt le, amely 22 milliárd dollárra értékeli a hangalapú mesterséges intelligenciával foglalkozó…

22 milliárd dollárra értékelték az ElevenLabst
Cégek és üzlet2026. szeptember 30.

22 milliárd dollárra értékelték az ElevenLabst

Az ElevenLabs 300 millió dolláros dolgozói tenderajánlatot zárt le, amely 22 milliárd dollárra értékelte a vállalatot. Ez kétszerese a februári Series D finanszírozási…

A Speechmatics szerint 20 másodperc alatt átír egyórányi hangot a Melia
Modellek2026. augusztus 26.

A Speechmatics szerint 20 másodperc alatt átír egyórányi hangot a Melia

A Speechmatics Melia beszédfelismerő modellje a cég szerint egyórányi hangfelvételt kevesebb mint 20 másodperc alatt ír át. Az Artificial Analysis független rangsorán…