Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség 31,5 százalékról 8,04 százalékra csökkent az audioalapú modellekhez képest.
- Az Apple kutatói vizuális alapozást vontak be kétnyelvű beszédmodellek tanításába.
- A vizuális információ az egynyelvű és a kétnyelvű modelleknek is előnyt jelentett.
- A fonetikai megkülönböztetésben mért különbség 31,5 százalékról 8,04 százalékra csökkent.
- A tanulmány az ICASSP konferenciához kapcsolódik, és 2025 szeptemberében jelent meg.
A többnyelvű modellek problémája
Az önfelügyelt tanulás jelentős előrelépést hozott a beszédreprezentációk tanításában. Az olyan modellek, mint a wav2vec 2.0 és a HuBERT, egynyelvű környezetben a beszédfelismeréshez hasonló feladatokban a legjobb eredmények közé tartozó teljesítményt értek el.
A többnyelvű önfelügyelt beszédmodellek ugyanakkor gyakran gyengébben teljesítenek az egyes nyelveken, mint az adott nyelvre készült egynyelvű modellek. A forrás szerint ez különösen olyan többnyelvű helyzetekben jelent problémát, ahol kevés nyelv szerepel, például kétnyelvű modellek esetében.
Vizuális alapozással próbálták szűkíteni a rést
Az Apple kutatói olyan megközelítést vizsgáltak, amely korlátozott vizuális alapozást, vagyis a beszédhez kapcsolódó vizuális információ bevonását alkalmazza a kétnyelvű beszédmodellek önfelügyelt tanításában. A cél a többnyelvű és az egynyelvű modellek közötti teljesítménykülönbség mérséklése volt.
A kutatás eredményei alapján a vizuális alapozás az egynyelvű és a kétnyelvű modelleknek is előnyt jelentett. A javulás a kétnyelvű modelleknél volt különösen erős.
A fonetikai tesztben nagyobb javulást mértek
Az Apple közlése szerint a módszer a nulla példás fonetikai megkülönböztetésben csökkentette a többnyelvű modellek teljesítményhátrányát. Az audioalapú modelleknél ez a különbség 31,5 százalék volt, vizuális alapozással azonban 8,04 százalékra mérséklődött.
A nulla példás értékelés olyan helyzetet jelöl, amelyben a modellt az adott feladatra vonatkozó célzott példák nélkül vizsgálják. A forrás a kutatás eredményét a vizuális információ kétnyelvű beszédmodellekben betöltött szerepének vizsgálataként mutatja be.
ICASSP-konferencián mutatták be a tanulmányt
A tanulmány címe Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models. A dolgozat az ICASSP konferenciához kapcsolódik, kutatási területe a beszéd- és természetesnyelv-feldolgozás, a forrás szerint pedig 2025 szeptemberében jelent meg.
A szerzők María Andrea Cruz Blandón, Zakaria Aldeneh, Jie Chi és Maureen de Seyssel. A forrás María Andrea Cruz Blandón esetében a Tampere Universityt tünteti fel, és jelzi, hogy Maureen de Seyssel a munkát az Apple-nél végezte.
Az eredmények a felhasználók számára azt mutatják, hogy a beszédmodellek többnyelvű teljesítményének javításához az audioadatok mellett más információforrás is felhasználható. A kutatás konkrétan a kétnyelvű modellek és a nulla példás fonetikai megkülönböztetés területén mutatott ki teljesítményjavulást.


