Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

2026. október 2.Forrás: Apple
Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kép: Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer különösen a kétnyelvű modelleknél javított a hangalapú modellekhez képest.

A lényeg röviden
  • Az Apple kutatói korlátozott vizuális megalapozást vontak be kétnyelvű beszédmodellek tanításába.
  • A vizuális információ az egynyelvű és a kétnyelvű modellek teljesítményét is javította.
  • A fonetikai megkülönböztetésnél a teljesítményrés 31,5 százalékról 8,04 százalékra csökkent.
  • A tanulmány 2025 szeptemberében jelent meg az ICASSP konferencián.

A többnyelvű modellek nyelvenként gyengébben teljesítenek

Az önfelügyelt tanulás fontos szerepet kapott a beszéd reprezentációinak megtanulásában. Az olyan modellek, mint a wav2vec 2.0 és a HuBERT, egynyelvű környezetben több beszédfeldolgozási feladatban, köztük a beszédfelismerésben is élvonalbeli eredményeket értek el.

A többnyelvű önfelügyelt beszédmodellek teljesítménye ugyanakkor gyakran elmarad az egyes nyelvekre külön betanított modellekétől. A különbség különösen olyan többnyelvű helyzetekben jelentős, ahol kevés nyelv szerepel, például kétnyelvű modellek esetén. Az Apple kutatása ezt a teljesítményrést vizsgálja, és egy korlátozott vizuális megalapozást vezet be a kétnyelvű beszédmodellek önfelügyelt tanításába.

A vizuális megalapozás a kétnyelvű modelleknél hozta a legnagyobb javulást

A kutatók eredményei szerint a vizuális információ bevonása az egynyelvű és a kétnyelvű modelleknek is előnyös volt. A javulás a kétnyelvű modelleknél bizonyult különösen erősnek.

A tanulmányban vizsgált, zéró tanulású fonetikai megkülönböztetési feladaton az audiocsatornára támaszkodó modellek teljesítménykülönbsége 31,5 százalék volt. Vizuális megalapozással ez a különbség 8,04 százalékra csökkent. A mérőszám azt mutatja, mekkora eltérés maradt a többnyelvű és az egynyelvű modellek között ezen a feladaton.

A kutatás nem a vizuális adatok korlátlan használatát írja le. A megközelítés lényege a korlátozott vizuális megalapozás alkalmazása, amelyet a szerzők a többnyelvű beszédmodellek teljesítményrésének mérséklésére vizsgáltak.

Az eredmények a többnyelvű beszédfeldolgozás számára fontosak

A tanulmány a beszéd és a természetesnyelv-feldolgozás területéhez tartozik, és az ICASSP konferencián jelent meg 2025 szeptemberében. Szerzői María Andrea Cruz Blandón, Zakaria Aldeneh, Jie Chi és Maureen de Seyssel. María Andrea Cruz Blandón a Tampere Egyetemhez kötődik, a kutatás egy része pedig az Apple-nél végzett munka során készült.

Az eredmények alapján a vizuális információ olyan kiegészítő jelzés lehet, amely segít a több nyelven működő önfelügyelt beszédmodelleknek közelebb kerülni az egynyelvű modellek teljesítményéhez. Ez a beszédfelismerési és más beszédfeldolgozási rendszerek fejlesztése szempontjából lehet releváns, különösen olyan esetekben, amikor ugyanazt a modellt több nyelven szeretnék használni.

Az Apple kutatási oldalán 2026. október 2-án egy kapcsolódó írás is megjelent arról, hogy a nyelvek megkülönböztetésének erősítése a tanítás során mérsékelheti, egyes mérésekben pedig meg is szüntetheti a többnyelvű modellek lemaradását. Ez a bejegyzés a folyamatos fonetikai és magasabb szintű nyelvi méréseket említi, miközben a most bemutatott tanulmány a vizuális megalapozás hatását vizsgálja.

Kapcsolódó hírek

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket
Kutatás2026. október 2.

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket

Az Apple kutatói szerint a beszédmodellek előzetes tanításakor bevezetett nyelvi megkülönböztetés csökkentheti a többnyelvű és egynyelvű modellek közötti…

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség…

Megérkezett a Siri AI az Apple Intelligence új generációjával
Termékek és eszközök2026. szeptember 14.

Megérkezett a Siri AI az Apple Intelligence új generációjával

Elindult a Siri AI, az Apple teljesen újragondolt asszisztense, amely személyes kontextust, képernyőtartalom-értést és szélesebb alkalmazásműveleteket használ. A funkció…