Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple új módszert mutatott be a beszédfelismerő modellek tanítására

2026. szeptember 24.Forrás: Apple
Az Apple új módszert mutatott be a beszédfelismerő modellek tanítására
Kép: Apple

Az Apple kutatói olyan módszert vizsgáltak, amely címkézetlen felhasználói adatokkal is stabilabbá teheti a federált automatikus beszédfelismerés tanítását. A megközelítés az úgynevezett álcímkék előállítását és a szerveroldali tanítás közbeni stabilizálást hangolja össze.

A lényeg röviden
  • Az Apple kutatása a félig felügyelt federált automatikus beszédfelismerést vizsgálja.
  • A módszer a tanármodell és a szerveroldali stabilizálás összehangolására épít.
  • A szervernek a tanítási körök között címkézett adatokon is tovább kell tanítania.
  • A korábbi legerősebb módszerhez képest 11 párosításból 9 esetben javultak az eredmények.
  • Az átlagos javulás 20,8 százalék volt tartományon belül, és 10,0 százalék tartományváltáskor.

A címkézetlen adatok jelentik a kihívást

Az Apple szeptember 24-én közzétett kutatása a félig felügyelt federált tanulásra, vagyis az SSFL-re összpontosít. Ebben a beállításban a modellek a klienseken, például különböző eszközökön található címkézetlen adatokból tanulnak. A tanármodell ezekhez az adatokhoz álcímkéket, vagyis a modell által előállított tanítási címkéket készít. A szerveren közben egy kisebb, címkézett kezdő adathalmaz áll rendelkezésre.

Az automatikus beszédfelismerés, az ASR, ezen a területen különösen érzékeny. Az álcímkék hibái egy kimeneti sorozaton belül, majd az egymást követő tanítási körökben is továbbgyűrűzhetnek. Ez eltérítést okozhat a tanításban, és nagy különbséget eredményezhet a teljesen felügyelt federált tanuláshoz képest.

Két egymáshoz kapcsolódó tervezési tengely

A tanulmány szerint a különbség csökkentéséhez két, egymással összefüggő tényezőt kell kezelni. Az első a tanármodell, amely az álcímkéket generálja. A kutatók megvizsgálták a kliensenként működő online tanárt, amelyben minden kliens a saját, folyamatosan változó modelljét használja. Ez a megoldás önmagában eltérhet a kívánt iránytól, stabilizálás után azonban az Apple szerint elérte vagy meghaladta a körönként kiküldött globális tanár teljesítményét. Ez a javulás a vizsgált tartományon belül határozottan megjelent, tartományváltás esetén pedig versenyképes maradt.

A kutatók egy átmeneti tanárt is vizsgáltak, amely egy meghatározott, r jelű körtől a globális modellről az online modellre vált. Erősebb kezdő adathalmaz esetén az online tanár előnye csökkent, az átmeneti megoldás viszont elérte vagy meghaladta mindkét másik tanár eredményét.

A második tengely a szerveroldali horgony. A szervernek a körök között továbbra is címkézett adatokon kell tanítania a modellt, különben az online tanár elmozdulhat. A kutatás szerint ez a közbeiktatott tanítás erősebben meghatározza a konvergenciát, mint önmagában a kezdőmodell.

Kilenc tesztpárban javult a korábbi módszer

A két tengely hatása nem választható el egymástól. Az agresszívebb tanárválasztások csak akkor hoznak eredményt, ha a horgony stabilizálja a tanítást. Ennek hatékonysága érzékeny az adataugmentációra és a kötegméretre, mivel ezek határozzák meg, mennyi bemeneti és gradienszajt ad a szerver a tanításhoz.

A szükséges stabilizálás mértéke tartományfüggő. A kutatók szerint ezt a kezdő adatok szóródása, valamint a kezdő adatok és a klienseken található adatok átfedése befolyásolja.

Az Apple kutatása alapján az ismertetett irányelvek a legerősebb korábbi módszerhez képest 11 vizsgált párosításból 9 esetben javulást hoztak. Az átlagos javulás a tartományon belüli teszteknél 20,8 százalék, tartományok közötti vizsgálatban pedig 10,0 százalék volt. A szerzők szerint ezzel szűkült a különbség a teljesen felügyelt federált tanuláshoz képest.

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket
Kutatás2026. október 2.

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket

Az Apple kutatói szerint a beszédmodellek előzetes tanításakor bevezetett nyelvi megkülönböztetés csökkentheti a többnyelvű és egynyelvű modellek közötti…

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség…