Érzelmesebb hangot ad a hangalapú ügynököknek a LiveKit új módja

A LiveKit expressive mode funkciója a beszélgetés érzelmi kontextusához igazítja a hangalapú ügynökök előadásmódját. A vállalat szerint az új lehetőség egyetlen beállítással aktiválható, és több beszédszintézis-szolgáltatóval is működik.
- A LiveKit bemutatta az expressive mode funkciót a LiveKit Agents rendszerben.
- A beállítás a beszélgetés alapján módosítja a hangnemet, tempót és kifejezőelemeket.
- Jelenleg négy LiveKit Inference TTS-modell támogatása szerepel a közleményben.
- Az érzelmi állapot az lk.expression attribútumon keresztül a kezelőfelületre is eljuthat.
- A funkció egyetlen beállítással aktiválható az AgentSession konfigurációjában.
A hangnemet is a helyzethez igazítja
A LiveKit 2026. augusztus 12-én mutatta be az expressive mode-ot a LiveKit Agents keretrendszerben. A cég szerint a hangalapú ügynökök ma már gyorsan és pontosan képesek megfogalmazni a választ, gyakran azonban minden mondatot hasonló, lelkes hangon adnak elő.
Ez problémát okozhat érzelmileg nehéz helyzetekben. A LiveKit példája szerint egy törölt járat és egy éjszakára két gyerekkel való várakozás esetén az ügynöknek más hangnemben kellene beszélnie, mint amikor ülőhely-választást próbál értékesíteni. A vállalat egy 2025-ös, a Journal of Business Research folyóiratban megjelent tanulmányra hivatkozik, amely ezt a hiányosságot „feeling skills gap” néven írta le. A LiveKit szerint az érzelmileg terhelt ügyintézési helyzetekben ez alacsonyabb elégedettséghez és kisebb újravásárlási hajlandósághoz vezethet.
A rendszer a beszédszintetizátorok nyelvére fordít
Az expressive mode közvetítő réteg a nyelvi modell és a beszédszintetizáló között. Aktiválásakor a keretrendszer szolgáltatóspecifikus utasításokat ad a nyelvi modellnek, amely ezek alapján kifejező jelöléseket helyez a válaszba. Ezek a jelölések érzelmeket, előadásmódokat, nem verbális hangokat és szüneteket írhatnak le.
A különböző szolgáltatók eltérő jelölési nyelvet használnak. A LiveKit egységesíti a nyelvi modell által előállított jeleket, kijavítja az olyan gyakori hibákat, mint az önmagát le nem záró címke, majd a jelöléseket az aktív szolgáltató által értelmezhető formára alakítja. A felhasználói átiratból ezek a jelek eltűnnek, így a kezelőfelületen tiszta szöveg jelenik meg.
A LiveKit szerint a mondatonkénti továbbítás ronthatja a kifejezőerőt, mivel a beszédszintetizátor minden mondatot kevés előzménnyel kap meg. Az expressive mode ezért nagyobb szövegrészeket küld szintézisre, ami segíthet stabilizálni az érzelmi tónust és a hangmagasságot.
Egy beállítással bekapcsolható
A funkció az AgentSession beállításai között az expressive = True értékkel aktiválható. A LiveKit szerint ehhez a legtöbb ügynöknél nincs szükség további konfigurációra, mert az ügynök a beszélgetés alapján választja ki az előadásmódot. Az expressive mode bármely nyelvi modellel használható.
A beszédszintetizátor oldalán olyan LiveKit Inference-modellre van szükség, amely támogatja a jelölési nyelvet. Jelenleg a LiveKit a Fish Audio fishaudio/s2.1-pro, az Inworld inworld/inworld-tts-2, a Cartesia cartesia/sonic-3 és a SpaceXAI xai/tts-1 modelljét hangolta ehhez. Más szolgáltatónál a beszédszintézis a szokásos módon működik, a beállítás hatás nélkül marad.
A fejlesztők korlátozhatják is az ügynök kifejezőkészletét. Az ExpressiveOptions például lassabb tempót állíthat be, vagy letilthatja a nevetést, miközben a többi lehetőség megmarad.
Az érzelmi állapot a kezelőfelületre is eljuthat
A LiveKit az ügynök érzelmi állapotát a felhasználói felületek számára is elérhetővé teszi. A megtisztított átirati szegmenshez az lk.expression attribútum kapcsolódik, amely JSON-objektumként tartalmazza az előadásmód jelzését. A szolgáltatók által küldött értékek nem egységesek: egyesek zárt szókészletet használnak, mások szabadon megfogalmazott angol leírást adnak.
Az Agents UI useAgentExpression hookja ezért normalizált hangulatot ad át a fejlesztőknek, például boldog, izgatott, együtt érző, szomorú vagy nyugodt állapotot. Ezekhez színek rendelhetők, így a hangulat megjelenhet egy vizualizálóban vagy hangulatjelzőben is.
A LiveKit közlése szerint a fejlesztés első kiadásánál tart. A vállalat a munkamenet közbeni előadásmód-váltást, további beszédszintetizátorok támogatását és gazdagabb frontendjelzéseket tervez.
LiveKit: Making voice agents sound human with expressive mode


