A mesterséges intelligencia jobban olvas, mint hallgat, állítja egy USC-kutatás

A hangalapú mesterséges intelligencia jól átírja, amit mondunk, de gyakran félreérti, hogyan mondjuk. A USC kutatói szerint az audio nagy nyelvi modellek a szöveget előnyben részesítik a hang nem verbális jeleivel szemben.
- Az audio nagy nyelvi modellek gyakran a kimondott szavakat részesítik előnyben a hang akusztikai jeleivel szemben.
- A USC kutatói a VoxParadox mércével tíz paralingvisztikai feladatban tesztelték a modelleket.
- Az Audio Flamingo 3 és a Qwen2-Audio is nehezen értelmezte a hang nem verbális információit.
- A PCLM és a DPO alkalmazásával a pontosság 17 százalékról 65 százalékra emelkedett.
A modellek a szavakra összpontosítanak
A USC kutatóinak új tanulmánya azt vizsgálta, hogy a hangot is feldolgozó mesterséges intelligencia mennyire képes értelmezni a beszédhez kapcsolódó társas és érzelmi jeleket. Az audio nagy nyelvi modellek olyan multimodális rendszerek, amelyek a szöveges bemenetek mellett beszédet és környezeti hangokat is kezelnek. Ezek teszik lehetővé, hogy a felhasználók közvetlenül beszéljenek az olyan AI-eszközökhöz, mint a ChatGPT és a Gemini, illetve feltöltött hangfelvételeket elemezzenek.
A kutatás szerint a modellek erősek a beszéd leiratozásában, vagyis a kimondott szavak szöveggé alakításában. A hangszín, a hangerő, a hanglejtés, a hangmagasság és az érzelmi állapot értelmezése azonban gyakran nehézséget okoz. Mohammad Soleymani, a USC Viterbi School of Engineering kutatója szerint a modellek a szöveget elsődleges információként kezelik, a hang akusztikai jeleit pedig másodlagosként.
Ennek következménye, hogy a rendszer szó szerint követheti a beszéd tartalmát akkor is, ha a hang másra utal. Ha valaki boldognak hallatszik, de azt mondja, hogy „szomorú vagyok”, a modell tévesen arra juthat, hogy a beszélő szomorú. A kutatók szerint ez félreértésekhez vezethet a beszélő szándékáról, érzelmi állapotáról és társas helyzetéről. Érzékeny területeken, például egészségügyi felméréseknél vagy ember és AI közötti interakciókban, a valódi érzelmek félreértelmezése hibás vagy akár káros válaszokat is eredményezhet.
Ellentmondó hangfelvételekkel tesztelték a rendszereket
Soleymani csapata a jelenség vizsgálatához létrehozta a VoxParadox nevű mércét. Ez tíz, a beszéd nem verbális jellemzőihez kapcsolódó feladatban értékeli a modelleket. A feladatok között szerepel a beszélő életkorának vagy nemének becslése, a beszélők számának meghatározása, továbbá az érzelmek, a hanglejtés, a hangmagasság és a hangerő felismerése.
A kutatók olyan hangfelvételeket adtak a rendszereknek, amelyekben a kimondott szavak szándékosan ellentmondtak a hang akusztikai tartalmának. Ezután azt kérték a modellektől, hogy döntsék el, igaz vagy hamis-e az elhangzott állítás. A hibás válasz arra utalt, hogy a modell a szöveget részesítette előnyben, a helyes válasz pedig arra, hogy a nem verbális hanginformációt is felhasználta.
A vizsgálatban az NVIDIA Audio Flamingo 3 és az Alibaba Qwen2-Audio modellje szerepelt. A USC közlése szerint mindkettő nehezen értelmezte a paralingvisztikai, vagyis a beszéd módjához kapcsolódó információkat.
A kutatók a modellek belső rétegeit is megvizsgálták. Azt találták, hogy a hangmagassághoz és hangszínhez hasonló akusztikai részletek fokozatosan eltűnnek, miközben a hangadatok a nyelvi feldolgozó komponensek felé haladnak. Ezt a jelenséget reprezentációs romlásnak nevezték. A helyes akusztikai információ gyakran továbbra is jelen volt a modell belső reprezentációiban, a döntéshozatal során azonban a rendszer a nyelvi jelek erős torzítása miatt figyelmen kívül hagyta.
A kutatók két módszerrel javították a hallást
A csapat a probléma kezelésére a Prompt-Conditioned Layer Mixer, röviden PCLM nevű modult és a Direct Preference Optimization, vagyis DPO nevű utólagos tanítási módszert alkalmazta. A PCLM egyszerre több feldolgozási rétegből gyűjt információt, ahelyett, hogy csak a kódoló utolsó rétegére támaszkodna.
A korábbi rétegek jobban rögzítik az olyan akusztikai jellemzőket, mint a hangmagasság, a hangerő és a beszélő tulajdonságai. A mélyebb rétegek inkább a szavak és a nyelv értelmezésére alkalmasak. A PCLM a felhasználó kérdését is figyelembe veszi, és ennek alapján választja ki, milyen arányban használja a különböző rétegek információit. Egy olyan kérdésnél, hogy „Dühös ez a beszélő?”, nagyobb súlyt adhat az érzelmi hangjeleknek.
A DPO során a modell válaszpárokat kap, és megtanulja előnyben részesíteni azt a választ, amely jobban megfelel a hangfelvétel akusztikai bizonyítékainak. A két módszer együttes alkalmazása után a kutatók szerint a paralingvisztikai információk értelmezésének pontossága 17 százalékról 65 százalékra nőtt.
A tanulmányt, amely a kutatók szerint elsőként azonosítja ezt a problémát és javasol megoldásokat rá, elfogadták a 2026-os International Conference on Machine Learning konferenciára. A projektet Mohammad Soleymani vezette, a csapatban pedig Ashutosh Chaubey és Jiacheng Pang is részt vett. Az eredmény a hangalapú AI-eszközök fejlesztőinek azt mutatja, hogy a beszéd tartalmának felismerése mellett a hang módjának feldolgozása is külön figyelmet igényel.
USC Viterbi (AI): Can AI Read the Room? USC Study Finds AI Is Better at Reading Than Listening


