Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A beszédre optimalizált szöveg generálását kutatja a NAVER LABS Europe

2026. október 4. 13:41Forrás: NAVER LABS Europe
A beszédre optimalizált szöveg generálását kutatja a NAVER LABS Europe
Kép: NAVER LABS Europe

A NAVER LABS Europe olyan nagy nyelvi modellek fejlesztését vizsgálja, amelyek közvetlenül beszédszintézishez alkalmas szöveget állítanak elő. A kutatók szerint a jelenlegi modellek többnyire írott szövegre optimalizáltak, ezért válaszaik a hangos felolvasás során nehézkesen működhetnek.

A lényeg röviden
  • A NAVER LABS Europe TTS-barát szövegek közvetlen generálását vizsgálja.
  • A CORA és a Recipe párosított preferencia-adatokat tartalmaz.
  • Az értékelés heurisztikát, TTS és ASR folyamatot, valamint MUSHRA hallgatási tesztet használt.
  • A NAVER szerint a FaST adta a legjobb egyensúlyt a beszédbarát működés és a hasznosság között.
  • A kutatók erős korrelációt találtak a különböző értékelési módszerek között.

A felolvasásra alkalmas szöveg külön problémát jelent

A NAVER LABS Europe kutatása abból indul ki, hogy a nagy nyelvi modellek elsősorban írott szöveg előállítására készülnek. Ezek a rendszerek gyakran nyelvtanilag helyes és hasznos válaszokat adnak, a szövegük azonban nem feltétlenül illeszkedik jól a szövegből beszédet előállító rendszerekhez, vagyis a TTS technológiához.

A kutatók ezt igazítási problémaként kezelik. Céljuk, hogy a modell már a generálás során beszédre optimalizált szöveget készítsen, így ne egy utólagos átírómodul alakítsa át a választ a felolvasáshoz. A megközelítés közvetlenül a nyelvi modell működését hangolja a természetesebb beszédbeli megszólalás igényeihez.

Két adathalmazzal és többféle méréssel vizsgálták a modelleket

A tanulmány szerzői két, eltérő célterületet lefedő preferencia-adathalmazt mutatnak be. A CORA és a Recipe olyan párosított válaszokat tartalmaz, amelyek között TTS-barát és TTS-szempontból kedvezőtlen szövegek szerepelnek. Ezek segítségével a modellek megtanulhatják, milyen megoldások alkalmasabbak a hangos megszólaltatásra.

A teljesítményt több módszerrel értékelték. A vizsgálat része volt egy mintázatokra épülő heurisztikus mérőszám, egy TTS-ből automatikus beszédfelismerésbe, vagyis ASR-be vezető értékelési folyamat, valamint egy MUSHRA típusú hallgatási teszt emberi bírálókkal. A kutatók így a szövegek szerkezeti jellemzőit, a beszéd és a visszafelismertetés eredményét, illetve a hallgatói benyomásokat is összevetették.

A FaST a hasznosság és a beszédbarát működés egyensúlyát kereste

A kísérletekben a Feature-aware Sampling and Tuning, röviden FaST keretrendszert több igazítási alappal hasonlították össze. A FaST értelmezhető jellemzőket használ fekete dobozként működő jutalmazómodell helyett.

A NAVER LABS Europe beszámolója szerint a FaST különböző beállítások mellett a legjobb általános egyensúlyt érte el a TTS-kompatibilis szöveggenerálás és a válaszok hasznossága között. A kutatók emellett erős korrelációt találtak a különböző mérőszámok eredményei között. Megállapításuk szerint ez arra utal, hogy a TTS-barát működés hatékony heurisztikával is megbízhatóan értékelhető.

A tanulmányt Thibaut Thonet, Jos Rozen és Laurent Besacier jegyzi. A publikációt 2026. október 24-én tették közzé, és az EMNLP konferenciához kapcsolódik, amelyet Budapesten rendeznek meg október 24. és 29. között.

A kutatás jelentősége a hangalapú rendszerekben

A megközelítés olyan rendszerek számára lehet releváns, amelyek a nyelvi modellek válaszait közvetlenül beszédként adják tovább. A forrás szerint a kutatás a hangos felolvasásra alkalmasabb kimenetek előállítását célozza, miközben megőrzi a válaszok hasznosságát.

A NAVER LABS Europe kutatási területei között az ember és robot közötti interakció, a természetes nyelv feldolgozása és a beszéd is szerepel. A vállalat szerint ezek az AI-komponensek a következő generációs robotok számára segíthetnek az emberekkel, más robotokkal és rendszerekkel való interakcióban. A most bemutatott munka ebbe az irányba illeszkedik, de a forrás nem ismertet konkrét termékbevezetést vagy felhasználói elérhetőséget.

Kapcsolódó hírek

A tapasztalatokból tanuló LLM-ügynökök módszerét mutatta be a NAVER
Kutatás2026. október 4. 13:41

A tapasztalatokból tanuló LLM-ügynökök módszerét mutatta be a NAVER

A NAVER LABS Europe kutatói olyan nagy nyelvi modellekre épülő ügynökök betanítási módszerét mutatták be, amely a korábbi tapasztalatok visszakeresését és a felügyelt…

SPLADE-Code: ritka keresőmodelleket fejlesztettek kódhoz
Kutatás2026. október 4. 13:41

SPLADE-Code: ritka keresőmodelleket fejlesztettek kódhoz

A NAVER LABS Europe bemutatta a SPLADE-Code modellsorozatot, amelyet kifejezetten forráskódok keresésére fejlesztettek. A kutatók szerint a rendszer 1 millió…

A látható minták még nem bizonyítják, hogyan gondolkodik egy AI
Kutatás2026. október 4. 13:41

A látható minták még nem bizonyítják, hogyan gondolkodik egy AI

A NAVER LABS Europe kutatása szerint a látens gondolkodási modellekben megfigyelhető minták önmagukban nem bizonyítják, hogy a modellek valóban az ezekhez társított…