Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A mesterséges intelligencia jobban olvas, mint hallgat, állítja egy USC-kutatás

2026. augusztus 10. 19:22Forrás: USC Viterbi (AI)
A mesterséges intelligencia jobban olvas, mint hallgat, állítja egy USC-kutatás
Kép: USC Viterbi (AI)

A hangalapú mesterséges intelligencia jól átírja, amit mondunk, de gyakran félreérti, hogyan mondjuk. A USC kutatói szerint az audio nagy nyelvi modellek a szöveget előnyben részesítik a hang nem verbális jeleivel szemben.

A lényeg röviden
  • Az audio nagy nyelvi modellek gyakran a kimondott szavakat részesítik előnyben a hang akusztikai jeleivel szemben.
  • A USC kutatói a VoxParadox mércével tíz paralingvisztikai feladatban tesztelték a modelleket.
  • Az Audio Flamingo 3 és a Qwen2-Audio is nehezen értelmezte a hang nem verbális információit.
  • A PCLM és a DPO alkalmazásával a pontosság 17 százalékról 65 százalékra emelkedett.

A modellek a szavakra összpontosítanak

A USC kutatóinak új tanulmánya azt vizsgálta, hogy a hangot is feldolgozó mesterséges intelligencia mennyire képes értelmezni a beszédhez kapcsolódó társas és érzelmi jeleket. Az audio nagy nyelvi modellek olyan multimodális rendszerek, amelyek a szöveges bemenetek mellett beszédet és környezeti hangokat is kezelnek. Ezek teszik lehetővé, hogy a felhasználók közvetlenül beszéljenek az olyan AI-eszközökhöz, mint a ChatGPT és a Gemini, illetve feltöltött hangfelvételeket elemezzenek.

A kutatás szerint a modellek erősek a beszéd leiratozásában, vagyis a kimondott szavak szöveggé alakításában. A hangszín, a hangerő, a hanglejtés, a hangmagasság és az érzelmi állapot értelmezése azonban gyakran nehézséget okoz. Mohammad Soleymani, a USC Viterbi School of Engineering kutatója szerint a modellek a szöveget elsődleges információként kezelik, a hang akusztikai jeleit pedig másodlagosként.

Ennek következménye, hogy a rendszer szó szerint követheti a beszéd tartalmát akkor is, ha a hang másra utal. Ha valaki boldognak hallatszik, de azt mondja, hogy „szomorú vagyok”, a modell tévesen arra juthat, hogy a beszélő szomorú. A kutatók szerint ez félreértésekhez vezethet a beszélő szándékáról, érzelmi állapotáról és társas helyzetéről. Érzékeny területeken, például egészségügyi felméréseknél vagy ember és AI közötti interakciókban, a valódi érzelmek félreértelmezése hibás vagy akár káros válaszokat is eredményezhet.

Ellentmondó hangfelvételekkel tesztelték a rendszereket

Soleymani csapata a jelenség vizsgálatához létrehozta a VoxParadox nevű mércét. Ez tíz, a beszéd nem verbális jellemzőihez kapcsolódó feladatban értékeli a modelleket. A feladatok között szerepel a beszélő életkorának vagy nemének becslése, a beszélők számának meghatározása, továbbá az érzelmek, a hanglejtés, a hangmagasság és a hangerő felismerése.

A kutatók olyan hangfelvételeket adtak a rendszereknek, amelyekben a kimondott szavak szándékosan ellentmondtak a hang akusztikai tartalmának. Ezután azt kérték a modellektől, hogy döntsék el, igaz vagy hamis-e az elhangzott állítás. A hibás válasz arra utalt, hogy a modell a szöveget részesítette előnyben, a helyes válasz pedig arra, hogy a nem verbális hanginformációt is felhasználta.

A vizsgálatban az NVIDIA Audio Flamingo 3 és az Alibaba Qwen2-Audio modellje szerepelt. A USC közlése szerint mindkettő nehezen értelmezte a paralingvisztikai, vagyis a beszéd módjához kapcsolódó információkat.

A kutatók a modellek belső rétegeit is megvizsgálták. Azt találták, hogy a hangmagassághoz és hangszínhez hasonló akusztikai részletek fokozatosan eltűnnek, miközben a hangadatok a nyelvi feldolgozó komponensek felé haladnak. Ezt a jelenséget reprezentációs romlásnak nevezték. A helyes akusztikai információ gyakran továbbra is jelen volt a modell belső reprezentációiban, a döntéshozatal során azonban a rendszer a nyelvi jelek erős torzítása miatt figyelmen kívül hagyta.

A kutatók két módszerrel javították a hallást

A csapat a probléma kezelésére a Prompt-Conditioned Layer Mixer, röviden PCLM nevű modult és a Direct Preference Optimization, vagyis DPO nevű utólagos tanítási módszert alkalmazta. A PCLM egyszerre több feldolgozási rétegből gyűjt információt, ahelyett, hogy csak a kódoló utolsó rétegére támaszkodna.

A korábbi rétegek jobban rögzítik az olyan akusztikai jellemzőket, mint a hangmagasság, a hangerő és a beszélő tulajdonságai. A mélyebb rétegek inkább a szavak és a nyelv értelmezésére alkalmasak. A PCLM a felhasználó kérdését is figyelembe veszi, és ennek alapján választja ki, milyen arányban használja a különböző rétegek információit. Egy olyan kérdésnél, hogy „Dühös ez a beszélő?”, nagyobb súlyt adhat az érzelmi hangjeleknek.

A DPO során a modell válaszpárokat kap, és megtanulja előnyben részesíteni azt a választ, amely jobban megfelel a hangfelvétel akusztikai bizonyítékainak. A két módszer együttes alkalmazása után a kutatók szerint a paralingvisztikai információk értelmezésének pontossága 17 százalékról 65 százalékra nőtt.

A tanulmányt, amely a kutatók szerint elsőként azonosítja ezt a problémát és javasol megoldásokat rá, elfogadták a 2026-os International Conference on Machine Learning konferenciára. A projektet Mohammad Soleymani vezette, a csapatban pedig Ashutosh Chaubey és Jiacheng Pang is részt vett. Az eredmény a hangalapú AI-eszközök fejlesztőinek azt mutatja, hogy a beszéd tartalmának felismerése mellett a hang módjának feldolgozása is külön figyelmet igényel.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség…

Az AssemblyAI szerint félrevezető lehet a beszédfelismerés WER-mérőszáma
Kutatás2026. szeptember 30.

Az AssemblyAI szerint félrevezető lehet a beszédfelismerés WER-mérőszáma

A hagyományos szóhibaarány, vagyis a WER egyes esetekben rosszabbnak mutathatja az újabb beszédfelismerő modelleket, állítja az AssemblyAI. A vállalat szerint a probléma…