Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket

Az Apple kutatói szerint a beszédmodellek előzetes tanításakor bevezetett nyelvi megkülönböztetés csökkentheti a többnyelvű és egynyelvű modellek közötti teljesítménykülönbséget. Az angol és francia nyelven vizsgált HuBERT-rendszer több mérésben is javult, miközben jelentős mértékben megmaradt a nyelvek közötti információmegosztás.
- Az Apple kutatása angol és francia nyelven vizsgált HuBERT-modelleket.
- A nyelvi osztályozó és a nyelvenkénti k-means célértékek javították a méréseket.
- A phone-ABX hibaarány 11,6 százalékról 10,4 százalékra csökkent.
- A sWUGGY értéke 52,1 százalékról 56,7 százalékra nőtt.
- A legerősebb javulás többnyire az első tanítási iterációban bevezetett beavatkozásnál jelentkezett.
A többnyelvű tanítás egyik problémája
A többnyelvű, önfelügyelt beszédmodellek több nyelv adataiból tanulnak, így megoszthatják egymással a nyelvek közös információit. Az Apple kutatása szerint azonban azonos összesített előzetes tanítási adatmennyiség mellett ezek a modellek általában gyengébben teljesítenek, mint az egyetlen nyelvre tanított rendszerek.
A tanulmány ezt a különbséget a többnyelvű tanulás többletköltségeként kezeli. A kutatók azt vizsgálták, hogy a modell nyelvek megkülönböztetésére való képességének erősítése mérsékelheti-e ezt a hátrányt. A vizsgálat ellenőrzött, angol és francia nyelvet használó HuBERT-beállításban zajlott.
Két beavatkozással javítottak a modellen
Maureen de Seyssel, Jie Chi és Zakaria Aldeneh két módszert tesztelt a nyelvi megkülönböztetés erősítésére. Az egyik egy kiegészítő nyelvi osztályozó, a másik pedig nyelvenként létrehozott k-means célértékek alkalmazása volt.
A két beavatkozás eredményei több mérésben is javulást hoztak. A folyamatos jellemzőkre épülő fonéma-megkülönböztetés hibaaránya, a phone-ABX értéke, a többnyelvű alapmodell 11,6 százalékáról 10,4 százalékra csökkent. Az egynyelvű modell értéke 10,8 százalék volt.
A lexikai teljesítményt mérő sWUGGY értéke 52,1 százalékról 56,7 százalékra nőtt, miközben az egynyelvű modell 58,5 százalékot ért el. A prozódiai teljesítmény, a ProsAudit lexikai részfeladatában, 68,9 százalékról 72,9 százalékra javult. Ez meghaladta az egynyelvű modell 72,6 százalékos eredményét.
A beavatkozás időzítése is számít
Az Apple kutatói a HuBERT tanítási szakaszait is összehasonlították. A legtöbb nyelvi mérésben akkor jelentkeztek a legerősebb javulások, amikor a nyelvi megkülönböztetést már az első iterációban bevezették.
A későbbi vagy többször megismételt beavatkozások kisebb javulást eredményeztek, és együtt jártak a nyelvek erősebb elkülönülésével. Ez arra utal, hogy a módszer hatása nem csak attól függ, alkalmazzák-e, hanem attól is, mikor kerül be a tanítási folyamatba.
A tanulmány szerzői szerint az eredmények ok-okozati szerepet támasztanak alá a nyelvi megkülönböztetés és a többnyelvű tanulás többletköltségének csökkentése között. A vizsgálat alapján a modellek javíthatják az egyes nyelvekhez kapcsolódó teljesítményüket úgy, hogy közben jelentős mértékű nyelvek közötti információmegosztás marad fenn. A kutatás 2026 októberében jelent meg az Apple gépi tanulási kutatási oldalán.


