A beszédre optimalizált szöveg generálását kutatja a NAVER LABS Europe

A NAVER LABS Europe olyan nagy nyelvi modellek fejlesztését vizsgálja, amelyek közvetlenül beszédszintézishez alkalmas szöveget állítanak elő. A kutatók szerint a jelenlegi modellek többnyire írott szövegre optimalizáltak, ezért válaszaik a hangos felolvasás során nehézkesen működhetnek.
- A NAVER LABS Europe TTS-barát szövegek közvetlen generálását vizsgálja.
- A CORA és a Recipe párosított preferencia-adatokat tartalmaz.
- Az értékelés heurisztikát, TTS és ASR folyamatot, valamint MUSHRA hallgatási tesztet használt.
- A NAVER szerint a FaST adta a legjobb egyensúlyt a beszédbarát működés és a hasznosság között.
- A kutatók erős korrelációt találtak a különböző értékelési módszerek között.
A felolvasásra alkalmas szöveg külön problémát jelent
A NAVER LABS Europe kutatása abból indul ki, hogy a nagy nyelvi modellek elsősorban írott szöveg előállítására készülnek. Ezek a rendszerek gyakran nyelvtanilag helyes és hasznos válaszokat adnak, a szövegük azonban nem feltétlenül illeszkedik jól a szövegből beszédet előállító rendszerekhez, vagyis a TTS technológiához.
A kutatók ezt igazítási problémaként kezelik. Céljuk, hogy a modell már a generálás során beszédre optimalizált szöveget készítsen, így ne egy utólagos átírómodul alakítsa át a választ a felolvasáshoz. A megközelítés közvetlenül a nyelvi modell működését hangolja a természetesebb beszédbeli megszólalás igényeihez.
Két adathalmazzal és többféle méréssel vizsgálták a modelleket
A tanulmány szerzői két, eltérő célterületet lefedő preferencia-adathalmazt mutatnak be. A CORA és a Recipe olyan párosított válaszokat tartalmaz, amelyek között TTS-barát és TTS-szempontból kedvezőtlen szövegek szerepelnek. Ezek segítségével a modellek megtanulhatják, milyen megoldások alkalmasabbak a hangos megszólaltatásra.
A teljesítményt több módszerrel értékelték. A vizsgálat része volt egy mintázatokra épülő heurisztikus mérőszám, egy TTS-ből automatikus beszédfelismerésbe, vagyis ASR-be vezető értékelési folyamat, valamint egy MUSHRA típusú hallgatási teszt emberi bírálókkal. A kutatók így a szövegek szerkezeti jellemzőit, a beszéd és a visszafelismertetés eredményét, illetve a hallgatói benyomásokat is összevetették.
A FaST a hasznosság és a beszédbarát működés egyensúlyát kereste
A kísérletekben a Feature-aware Sampling and Tuning, röviden FaST keretrendszert több igazítási alappal hasonlították össze. A FaST értelmezhető jellemzőket használ fekete dobozként működő jutalmazómodell helyett.
A NAVER LABS Europe beszámolója szerint a FaST különböző beállítások mellett a legjobb általános egyensúlyt érte el a TTS-kompatibilis szöveggenerálás és a válaszok hasznossága között. A kutatók emellett erős korrelációt találtak a különböző mérőszámok eredményei között. Megállapításuk szerint ez arra utal, hogy a TTS-barát működés hatékony heurisztikával is megbízhatóan értékelhető.
A tanulmányt Thibaut Thonet, Jos Rozen és Laurent Besacier jegyzi. A publikációt 2026. október 24-én tették közzé, és az EMNLP konferenciához kapcsolódik, amelyet Budapesten rendeznek meg október 24. és 29. között.
A kutatás jelentősége a hangalapú rendszerekben
A megközelítés olyan rendszerek számára lehet releváns, amelyek a nyelvi modellek válaszait közvetlenül beszédként adják tovább. A forrás szerint a kutatás a hangos felolvasásra alkalmasabb kimenetek előállítását célozza, miközben megőrzi a válaszok hasznosságát.
A NAVER LABS Europe kutatási területei között az ember és robot közötti interakció, a természetes nyelv feldolgozása és a beszéd is szerepel. A vállalat szerint ezek az AI-komponensek a következő generációs robotok számára segíthetnek az emberekkel, más robotokkal és rendszerekkel való interakcióban. A most bemutatott munka ebbe az irányba illeszkedik, de a forrás nem ismertet konkrét termékbevezetést vagy felhasználói elérhetőséget.
NAVER LABS Europe: Ready to speak: aligning LLMs for TTS-friendly text generation


