Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket

2026. október 2.Forrás: Apple
Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket
Kép: Apple

Az Apple kutatói szerint a beszédmodellek előzetes tanításakor bevezetett nyelvi megkülönböztetés csökkentheti a többnyelvű és egynyelvű modellek közötti teljesítménykülönbséget. Az angol és francia nyelven vizsgált HuBERT-rendszer több mérésben is javult, miközben jelentős mértékben megmaradt a nyelvek közötti információmegosztás.

A lényeg röviden
  • Az Apple kutatása angol és francia nyelven vizsgált HuBERT-modelleket.
  • A nyelvi osztályozó és a nyelvenkénti k-means célértékek javították a méréseket.
  • A phone-ABX hibaarány 11,6 százalékról 10,4 százalékra csökkent.
  • A sWUGGY értéke 52,1 százalékról 56,7 százalékra nőtt.
  • A legerősebb javulás többnyire az első tanítási iterációban bevezetett beavatkozásnál jelentkezett.

A többnyelvű tanítás egyik problémája

A többnyelvű, önfelügyelt beszédmodellek több nyelv adataiból tanulnak, így megoszthatják egymással a nyelvek közös információit. Az Apple kutatása szerint azonban azonos összesített előzetes tanítási adatmennyiség mellett ezek a modellek általában gyengébben teljesítenek, mint az egyetlen nyelvre tanított rendszerek.

A tanulmány ezt a különbséget a többnyelvű tanulás többletköltségeként kezeli. A kutatók azt vizsgálták, hogy a modell nyelvek megkülönböztetésére való képességének erősítése mérsékelheti-e ezt a hátrányt. A vizsgálat ellenőrzött, angol és francia nyelvet használó HuBERT-beállításban zajlott.

Két beavatkozással javítottak a modellen

Maureen de Seyssel, Jie Chi és Zakaria Aldeneh két módszert tesztelt a nyelvi megkülönböztetés erősítésére. Az egyik egy kiegészítő nyelvi osztályozó, a másik pedig nyelvenként létrehozott k-means célértékek alkalmazása volt.

A két beavatkozás eredményei több mérésben is javulást hoztak. A folyamatos jellemzőkre épülő fonéma-megkülönböztetés hibaaránya, a phone-ABX értéke, a többnyelvű alapmodell 11,6 százalékáról 10,4 százalékra csökkent. Az egynyelvű modell értéke 10,8 százalék volt.

A lexikai teljesítményt mérő sWUGGY értéke 52,1 százalékról 56,7 százalékra nőtt, miközben az egynyelvű modell 58,5 százalékot ért el. A prozódiai teljesítmény, a ProsAudit lexikai részfeladatában, 68,9 százalékról 72,9 százalékra javult. Ez meghaladta az egynyelvű modell 72,6 százalékos eredményét.

A beavatkozás időzítése is számít

Az Apple kutatói a HuBERT tanítási szakaszait is összehasonlították. A legtöbb nyelvi mérésben akkor jelentkeztek a legerősebb javulások, amikor a nyelvi megkülönböztetést már az első iterációban bevezették.

A későbbi vagy többször megismételt beavatkozások kisebb javulást eredményeztek, és együtt jártak a nyelvek erősebb elkülönülésével. Ez arra utal, hogy a módszer hatása nem csak attól függ, alkalmazzák-e, hanem attól is, mikor kerül be a tanítási folyamatba.

A tanulmány szerzői szerint az eredmények ok-okozati szerepet támasztanak alá a nyelvi megkülönböztetés és a többnyelvű tanulás többletköltségének csökkentése között. A vizsgálat alapján a modellek javíthatják az egyes nyelvekhez kapcsolódó teljesítményüket úgy, hogy közben jelentős mértékű nyelvek közötti információmegosztás marad fenn. A kutatás 2026 októberében jelent meg az Apple gépi tanulási kutatási oldalán.

Kapcsolódó hírek

Az Apple kutatása szerint a diffúziós modellek magabiztossága félrevezető lehet
Kutatás2026. október 2.

Az Apple kutatása szerint a diffúziós modellek magabiztossága félrevezető lehet

Az Apple kutatói szerint a diffúziós modellek pozíciónkénti valószínűségei önmagukban nem árulják el, hogy a generált tokenek között fennáll-e függőség. Ez torzíthatja a…

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség…