Az Inworld új hangmodellje a beszéd természetes ritmusát utánozza

Az Inworld bemutatta a Realtime TTS-2 hangmodellt, amely a beszéd természetesnek ható részleteire épít, például a töltelékszavakra, a szünetekre és az önkorrekciókra. A vállalat szerint ugyanaz a modell eltérő ritmussal képes melegséget, fáradtságot, bizonytalanságot vagy energiát kifejezni.
- Az Inworld 2026. augusztus 31-én mutatta be a Realtime TTS-2-t.
- A modell a töltelékszavakat és a szüneteket a beszéd ritmusához igazítja.
- Az önkorrekció a vállalat szerint melegségként is érzékelhető.
- A sóhaj, a töltelékszó és a befejezetlen gondolat fáradtságot fejezhet ki.
- Ugyanaz a töltelékszó tétovázást vagy energiát is közvetíthet.
A természetes beszédben a hibák is jelentést hordoznak
Az Inworld 2026. augusztus 31-én közzétett bemutatója szerint a Realtime TTS-2 célja, hogy a beszédet ne pusztán helyesen kimondott szavak sorozataként kezelje. A modell olyan jelenségeket is megszólaltat, amelyek a hétköznapi beszélgetésekben gyakran előfordulnak.
A bemutatott példa szerint az önkorrekció, amikor a beszélő menet közben módosítja a mondanivalóját, melegséget sugározhat, ezért nem feltétlenül hibának hat. Az Inworld megfogalmazása alapján a beszédben megjelenő bizonytalanság vagy megtorpanás a közlés része lehet.
A szünetek helye és hossza is számít
A vállalat különbséget tesz a mondatközi és a kifejezésen belüli szünetek között. A bemutató szerint az igazán természetes felidézési szünetek inkább főnévi szerkezetek közepén jelennek meg, nem pedig a mondatok határán.
Ez a megközelítés azt jelenti, hogy a szünet nem véletlenszerű megszakításként jelenik meg. A modell a példában egy olyan beszédritmust mutat, amelyben a megakadás a gondolat felidézésének részeként hangzik el.
Az Inworld további példája egy sóhajt, egy töltelékszót és egy elnyújtott, befejezetlen gondolatot kapcsol össze. A vállalat szerint ez a kombináció inkább fáradtságot közvetít, és nem a rendszer hibás működésének benyomását kelti.
Ugyanaz a töltelékszó többféle hatást kelthet
A Realtime TTS-2 bemutatója arra is kitér, hogy a töltelékszavak szerepe a ritmustól függ. Ugyanaz a kifejezés egyik helyzetben tétovázásként, másik helyzetben energiaként érzékelhető.
Az Inworld példái között szerepel az „um” és az „uh” használata, valamint az elnyújtott gondolat és a beszéd menet közbeni módosítása. A vállalat szerint ezek eltérő ritmussal mást jeleznek a hallgatónak.
Az Inworld a Realtime TTS-2-t új hangmodellként mutatja be, amelynek egyik fontos jellemzője, hogy a hangzásban a szavak mellett a beszéd finom időzítését is figyelembe veszi. A bemutató alapján a modell ugyanazon alapokon eltérő ritmusokat képes létrehozni.
Mit jelent ez a felhasználóknak?
A forrás alapján a Realtime TTS-2 a gépi beszéd természetességét a társalgási jelek pontosabb használatával kívánja javítani. A szünetek, sóhajok, töltelékszavak és önkorrekciók a beszélő állapotát vagy a mondat hangulatát érzékeltethetik.
Az Inworld bemutatója a hangmodell működését példamondatokon keresztül szemlélteti. A közlemény ebben a részletben nem közöl árat, megjelenési dátumot vagy teljesítménymérést.


