A Bland TTS v3 külön modellel tanulja meg a nevetést és sóhajtást

A Bland AI olyan képzési módszert fejlesztett a Bland TTS v3-hoz, amelyben egy második modell hallgatja meg a generált beszédet, majd visszajelzést ad a kért nem verbális hangokról. A vállalat szerint az NVAlign javította annak esélyét, hogy a nevetések és sóhajtások a megadott helyen jelenjenek meg.
- A Bland NVAlign egy második modellt használ a generált beszéd ellenőrzésére.
- Az angol éles rendszerben a kért hangok pontossága 39,8 százalékról 54,0 százalékra nőtt.
- A természetességi értékelés 3,89-ről 3,95-re javult az ötfokú skálán.
- A módszer a szövegben megadott nevetések és sóhajtások megbízhatóbb elhelyezését célozza.
- A kiejtés és a mondatba illeszkedés továbbra is fejlesztendő terület.
A címke önmagában kevés
A beszédmodellnek egy olyan utasítást is követnie kell, mint a [laughs] vagy a [sighs], miközben helyesen ejti ki a mondat szavait, megőrzi a beszélő hangját, és természetesen tér vissza a beszédhez. A Bland példája szerint egy mondat közepén elhelyezett nevetés akkor hangzik jól, ha a megfelelő pillanatban jelenik meg, és nem válik a mondattól elszakadó hanghatássá.
A csapat korábban olyan felvételekkel és átiratokkal tanította a modelleket, amelyek megjelölték a nem verbális hangokat. Ez segített a szöveges címkék és a hozzájuk tartozó hangok összekapcsolásában, de a ritkább hangokból kevés jó minőségű, címkézett példa áll rendelkezésre. A nevetés ráadásul beszélőnként jelentősen eltérhet. A betanított modellek sok ilyen hangot elő tudtak állítani, de időnként kihagyták vagy összekeverték őket.
Egy második modell figyeli a kimenetet
Az NVAlign során a Bland kutatói egy külön beszédfelismerő modellt tanítottak meg a címkék és a nem verbális hangok felismerésére. Ezt a modellt rögzítették, majd arra használták, hogy értékelje a beszédmodell kimenetét. A beszédmodell megkapja a címkével ellátott szöveget, elkészíti a hanganyagot, a felismerőmodell pedig azt pontozza, milyen magabiztosan érzékeli a kért hangot. Ez a visszajelzés módosítja, hogyan tervezi meg és állítja elő a beszédmodell a hanganyagot.
A teljes hanggenerálási folyamaton átvezetett visszajelzés nagy memória- és számítási igénnyel járna. A kutatócsoport ezért egy olyan rövidítést dolgozott ki, amely két kiválasztott lépést használ a betanítási frissítés kiszámításához. A fejlesztőknek ezt a folyamatot nem kell kezelniük, mert az a modell tanítása közben zajlik.
A Bland szerint külön védelemre is szükség volt, mert a modell javíthatta a címkekövetési pontszámát úgy, hogy közben romlott a hanganyag. Például túl hangosan adhata elő a kért hangot, megváltoztathatta a beszélő hangját, vagy torzíthatta a környező mondatot. A csapat ezért büntette a beszélőazonosságot és a hangminőséget rontó változásokat, a túl nagy csúcsokat, a túl halk hangot, valamint a modell korábbi viselkedésétől való túl nagy eltérést.
Javult a találati arány, de maradtak kompromisszumok
A módszert két nyilvános beszédmodellen és egy angol nyelvű éles rendszeren tesztelték. A külön hallgatási vizsgálatban 100 szöveget használtak, és három hallgató értékelte, hogy a kért hang a megfelelő helyen jelent-e meg. Egy eredményt csak akkor számítottak helyesnek, ha mindhárman egyetértettek, és nem tudták, melyik rendszer készítette a felvételt.
Az angol nyelvű éles rendszerben a pontosság 39,8 százalékról 54,0 százalékra nőtt. A természetesség értékelése 3,89-ről 3,95-re javult az ötfokú skálán. Közben az angol szavak hibaaránya mindkét értékelési adathalmazon emelkedett, egy automatikus mérőszám pedig alacsonyabbra értékelte a hangadás észlelhető hatását.
A fejlesztők számára ez megbízhatóbb irányítást jelenthet a szövegben megadott utasításokon keresztül. A hangalapú ügynökök a Bland szerint így a szavakon túl nevetést, sóhajtást, tempóváltást, hangsúlyozást és érzelmi változásokat is továbbvihetnek egy beszélgetésen belül, a környező hangélmény újjáépítése nélkül.
A rendszer határai
Az NVAlign jelenlegi munkája a különálló, címkével kért hangokra összpontosít. A Bland közlése nem állítja, hogy a modell önállóan tudja, mikor helyénvaló a nevetés, vagy hogy minden folyamatos érzelmi és beszédstílusbeli változást kezelni képes. A fejlesztőnek továbbra is meg kell adnia, hol jelenjen meg a hang.
A ritka hangok tanítása szintén nehezebb, mert kevesebb jó példa áll rendelkezésre. A vállalat szerint a beszédmodellnek és a felismerőmodellnek egyaránt nagyobb változatosságra van szüksége a fejlődéshez. A kért hang helyes megjelenése mellett ezért továbbra is ellenőrizni kell a kiejtést és azt, hogyan illeszkedik az adott hang a mondatba.
Bland AI: How our research team developed Bland TTS v3


