Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

2026. október 2.Forrás: Apple
Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kép: Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség 31,5 százalékról 8,04 százalékra csökkent az audioalapú modellekhez képest.

A lényeg röviden
  • Az Apple kutatói vizuális alapozást vontak be kétnyelvű beszédmodellek tanításába.
  • A vizuális információ az egynyelvű és a kétnyelvű modelleknek is előnyt jelentett.
  • A fonetikai megkülönböztetésben mért különbség 31,5 százalékról 8,04 százalékra csökkent.
  • A tanulmány az ICASSP konferenciához kapcsolódik, és 2025 szeptemberében jelent meg.

A többnyelvű modellek problémája

Az önfelügyelt tanulás jelentős előrelépést hozott a beszédreprezentációk tanításában. Az olyan modellek, mint a wav2vec 2.0 és a HuBERT, egynyelvű környezetben a beszédfelismeréshez hasonló feladatokban a legjobb eredmények közé tartozó teljesítményt értek el.

A többnyelvű önfelügyelt beszédmodellek ugyanakkor gyakran gyengébben teljesítenek az egyes nyelveken, mint az adott nyelvre készült egynyelvű modellek. A forrás szerint ez különösen olyan többnyelvű helyzetekben jelent problémát, ahol kevés nyelv szerepel, például kétnyelvű modellek esetében.

Vizuális alapozással próbálták szűkíteni a rést

Az Apple kutatói olyan megközelítést vizsgáltak, amely korlátozott vizuális alapozást, vagyis a beszédhez kapcsolódó vizuális információ bevonását alkalmazza a kétnyelvű beszédmodellek önfelügyelt tanításában. A cél a többnyelvű és az egynyelvű modellek közötti teljesítménykülönbség mérséklése volt.

A kutatás eredményei alapján a vizuális alapozás az egynyelvű és a kétnyelvű modelleknek is előnyt jelentett. A javulás a kétnyelvű modelleknél volt különösen erős.

A fonetikai tesztben nagyobb javulást mértek

Az Apple közlése szerint a módszer a nulla példás fonetikai megkülönböztetésben csökkentette a többnyelvű modellek teljesítményhátrányát. Az audioalapú modelleknél ez a különbség 31,5 százalék volt, vizuális alapozással azonban 8,04 százalékra mérséklődött.

A nulla példás értékelés olyan helyzetet jelöl, amelyben a modellt az adott feladatra vonatkozó célzott példák nélkül vizsgálják. A forrás a kutatás eredményét a vizuális információ kétnyelvű beszédmodellekben betöltött szerepének vizsgálataként mutatja be.

ICASSP-konferencián mutatták be a tanulmányt

A tanulmány címe Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models. A dolgozat az ICASSP konferenciához kapcsolódik, kutatási területe a beszéd- és természetesnyelv-feldolgozás, a forrás szerint pedig 2025 szeptemberében jelent meg.

A szerzők María Andrea Cruz Blandón, Zakaria Aldeneh, Jie Chi és Maureen de Seyssel. A forrás María Andrea Cruz Blandón esetében a Tampere Universityt tünteti fel, és jelzi, hogy Maureen de Seyssel a munkát az Apple-nél végezte.

Az eredmények a felhasználók számára azt mutatják, hogy a beszédmodellek többnyelvű teljesítményének javításához az audioadatok mellett más információforrás is felhasználható. A kutatás konkrétan a kétnyelvű modellek és a nulla példás fonetikai megkülönböztetés területén mutatott ki teljesítményjavulást.

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket
Kutatás2026. október 2.

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket

Az Apple kutatói szerint a beszédmodellek előzetes tanításakor bevezetett nyelvi megkülönböztetés csökkentheti a többnyelvű és egynyelvű modellek közötti…

Megérkezett a Siri AI az Apple Intelligence új generációjával
Termékek és eszközök2026. szeptember 14.

Megérkezett a Siri AI az Apple Intelligence új generációjával

Elindult a Siri AI, az Apple teljesen újragondolt asszisztense, amely személyes kontextust, képernyőtartalom-értést és szélesebb alkalmazásműveleteket használ. A funkció…