Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Bland TTS v3 külön modellel tanulja meg a nevetést és sóhajtást

2026. október 8. 20:38Forrás: Bland AI
A Bland TTS v3 külön modellel tanulja meg a nevetést és sóhajtást
Kép: Bland AI

A Bland AI olyan képzési módszert fejlesztett a Bland TTS v3-hoz, amelyben egy második modell hallgatja meg a generált beszédet, majd visszajelzést ad a kért nem verbális hangokról. A vállalat szerint az NVAlign javította annak esélyét, hogy a nevetések és sóhajtások a megadott helyen jelenjenek meg.

A lényeg röviden
  • A Bland NVAlign egy második modellt használ a generált beszéd ellenőrzésére.
  • Az angol éles rendszerben a kért hangok pontossága 39,8 százalékról 54,0 százalékra nőtt.
  • A természetességi értékelés 3,89-ről 3,95-re javult az ötfokú skálán.
  • A módszer a szövegben megadott nevetések és sóhajtások megbízhatóbb elhelyezését célozza.
  • A kiejtés és a mondatba illeszkedés továbbra is fejlesztendő terület.

A címke önmagában kevés

A beszédmodellnek egy olyan utasítást is követnie kell, mint a [laughs] vagy a [sighs], miközben helyesen ejti ki a mondat szavait, megőrzi a beszélő hangját, és természetesen tér vissza a beszédhez. A Bland példája szerint egy mondat közepén elhelyezett nevetés akkor hangzik jól, ha a megfelelő pillanatban jelenik meg, és nem válik a mondattól elszakadó hanghatássá.

A csapat korábban olyan felvételekkel és átiratokkal tanította a modelleket, amelyek megjelölték a nem verbális hangokat. Ez segített a szöveges címkék és a hozzájuk tartozó hangok összekapcsolásában, de a ritkább hangokból kevés jó minőségű, címkézett példa áll rendelkezésre. A nevetés ráadásul beszélőnként jelentősen eltérhet. A betanított modellek sok ilyen hangot elő tudtak állítani, de időnként kihagyták vagy összekeverték őket.

Egy második modell figyeli a kimenetet

Az NVAlign során a Bland kutatói egy külön beszédfelismerő modellt tanítottak meg a címkék és a nem verbális hangok felismerésére. Ezt a modellt rögzítették, majd arra használták, hogy értékelje a beszédmodell kimenetét. A beszédmodell megkapja a címkével ellátott szöveget, elkészíti a hanganyagot, a felismerőmodell pedig azt pontozza, milyen magabiztosan érzékeli a kért hangot. Ez a visszajelzés módosítja, hogyan tervezi meg és állítja elő a beszédmodell a hanganyagot.

A teljes hanggenerálási folyamaton átvezetett visszajelzés nagy memória- és számítási igénnyel járna. A kutatócsoport ezért egy olyan rövidítést dolgozott ki, amely két kiválasztott lépést használ a betanítási frissítés kiszámításához. A fejlesztőknek ezt a folyamatot nem kell kezelniük, mert az a modell tanítása közben zajlik.

A Bland szerint külön védelemre is szükség volt, mert a modell javíthatta a címkekövetési pontszámát úgy, hogy közben romlott a hanganyag. Például túl hangosan adhata elő a kért hangot, megváltoztathatta a beszélő hangját, vagy torzíthatta a környező mondatot. A csapat ezért büntette a beszélőazonosságot és a hangminőséget rontó változásokat, a túl nagy csúcsokat, a túl halk hangot, valamint a modell korábbi viselkedésétől való túl nagy eltérést.

Javult a találati arány, de maradtak kompromisszumok

A módszert két nyilvános beszédmodellen és egy angol nyelvű éles rendszeren tesztelték. A külön hallgatási vizsgálatban 100 szöveget használtak, és három hallgató értékelte, hogy a kért hang a megfelelő helyen jelent-e meg. Egy eredményt csak akkor számítottak helyesnek, ha mindhárman egyetértettek, és nem tudták, melyik rendszer készítette a felvételt.

Az angol nyelvű éles rendszerben a pontosság 39,8 százalékról 54,0 százalékra nőtt. A természetesség értékelése 3,89-ről 3,95-re javult az ötfokú skálán. Közben az angol szavak hibaaránya mindkét értékelési adathalmazon emelkedett, egy automatikus mérőszám pedig alacsonyabbra értékelte a hangadás észlelhető hatását.

A fejlesztők számára ez megbízhatóbb irányítást jelenthet a szövegben megadott utasításokon keresztül. A hangalapú ügynökök a Bland szerint így a szavakon túl nevetést, sóhajtást, tempóváltást, hangsúlyozást és érzelmi változásokat is továbbvihetnek egy beszélgetésen belül, a környező hangélmény újjáépítése nélkül.

A rendszer határai

Az NVAlign jelenlegi munkája a különálló, címkével kért hangokra összpontosít. A Bland közlése nem állítja, hogy a modell önállóan tudja, mikor helyénvaló a nevetés, vagy hogy minden folyamatos érzelmi és beszédstílusbeli változást kezelni képes. A fejlesztőnek továbbra is meg kell adnia, hol jelenjen meg a hang.

A ritka hangok tanítása szintén nehezebb, mert kevesebb jó példa áll rendelkezésre. A vállalat szerint a beszédmodellnek és a felismerőmodellnek egyaránt nagyobb változatosságra van szüksége a fejlődéshez. A kért hang helyes megjelenése mellett ezért továbbra is ellenőrizni kell a kiejtést és azt, hogyan illeszkedik az adott hang a mondatba.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A beszédre optimalizált szöveg generálását kutatja a NAVER LABS Europe
Kutatás2026. október 4. 13:41

A beszédre optimalizált szöveg generálását kutatja a NAVER LABS Europe

A NAVER LABS Europe olyan nagy nyelvi modellek fejlesztését vizsgálja, amelyek közvetlenül beszédszintézishez alkalmas szöveget állítanak elő. A kutatók szerint a…

A Google szeptemberi AI újdonságai: Gemini 4 Argon és WeatherNext 3Fontos hír
Modellek2026. október 2. 17:00

A Google szeptemberi AI újdonságai: Gemini 4 Argon és WeatherNext 3

A Google szeptemberben bemutatta a Gemini 4 Argon modellt, új hangalapú AI-eszközöket és a Gemini alkalmazáshoz kapcsolható szolgáltatásokat. A vállalat tudományos…

A Bland hivatalos technológiai és értékesítési Twilio-partner lett
Cégek és üzlet2026. szeptember 30. 18:08

A Bland hivatalos technológiai és értékesítési Twilio-partner lett

A Bland hivatalos technológiai és piacra viteli partnerként csatlakozott a Twilióhoz. A vállalati ügyfelek számára a két szolgáltatás közös csomagként érhető el, a…