Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer különösen a kétnyelvű modelleknél javított a hangalapú modellekhez képest.
- Az Apple kutatói korlátozott vizuális megalapozást vontak be kétnyelvű beszédmodellek tanításába.
- A vizuális információ az egynyelvű és a kétnyelvű modellek teljesítményét is javította.
- A fonetikai megkülönböztetésnél a teljesítményrés 31,5 százalékról 8,04 százalékra csökkent.
- A tanulmány 2025 szeptemberében jelent meg az ICASSP konferencián.
A többnyelvű modellek nyelvenként gyengébben teljesítenek
Az önfelügyelt tanulás fontos szerepet kapott a beszéd reprezentációinak megtanulásában. Az olyan modellek, mint a wav2vec 2.0 és a HuBERT, egynyelvű környezetben több beszédfeldolgozási feladatban, köztük a beszédfelismerésben is élvonalbeli eredményeket értek el.
A többnyelvű önfelügyelt beszédmodellek teljesítménye ugyanakkor gyakran elmarad az egyes nyelvekre külön betanított modellekétől. A különbség különösen olyan többnyelvű helyzetekben jelentős, ahol kevés nyelv szerepel, például kétnyelvű modellek esetén. Az Apple kutatása ezt a teljesítményrést vizsgálja, és egy korlátozott vizuális megalapozást vezet be a kétnyelvű beszédmodellek önfelügyelt tanításába.
A vizuális megalapozás a kétnyelvű modelleknél hozta a legnagyobb javulást
A kutatók eredményei szerint a vizuális információ bevonása az egynyelvű és a kétnyelvű modelleknek is előnyös volt. A javulás a kétnyelvű modelleknél bizonyult különösen erősnek.
A tanulmányban vizsgált, zéró tanulású fonetikai megkülönböztetési feladaton az audiocsatornára támaszkodó modellek teljesítménykülönbsége 31,5 százalék volt. Vizuális megalapozással ez a különbség 8,04 százalékra csökkent. A mérőszám azt mutatja, mekkora eltérés maradt a többnyelvű és az egynyelvű modellek között ezen a feladaton.
A kutatás nem a vizuális adatok korlátlan használatát írja le. A megközelítés lényege a korlátozott vizuális megalapozás alkalmazása, amelyet a szerzők a többnyelvű beszédmodellek teljesítményrésének mérséklésére vizsgáltak.
Az eredmények a többnyelvű beszédfeldolgozás számára fontosak
A tanulmány a beszéd és a természetesnyelv-feldolgozás területéhez tartozik, és az ICASSP konferencián jelent meg 2025 szeptemberében. Szerzői María Andrea Cruz Blandón, Zakaria Aldeneh, Jie Chi és Maureen de Seyssel. María Andrea Cruz Blandón a Tampere Egyetemhez kötődik, a kutatás egy része pedig az Apple-nél végzett munka során készült.
Az eredmények alapján a vizuális információ olyan kiegészítő jelzés lehet, amely segít a több nyelven működő önfelügyelt beszédmodelleknek közelebb kerülni az egynyelvű modellek teljesítményéhez. Ez a beszédfelismerési és más beszédfeldolgozási rendszerek fejlesztése szempontjából lehet releváns, különösen olyan esetekben, amikor ugyanazt a modellt több nyelven szeretnék használni.
Az Apple kutatási oldalán 2026. október 2-án egy kapcsolódó írás is megjelent arról, hogy a nyelvek megkülönböztetésének erősítése a tanítás során mérsékelheti, egyes mérésekben pedig meg is szüntetheti a többnyelvű modellek lemaradását. Ez a bejegyzés a folyamatos fonetikai és magasabb szintű nyelvi méréseket említi, miközben a most bemutatott tanulmány a vizuális megalapozás hatását vizsgálja.


