Az Apple új módszert mutatott be a beszédfelismerő modellek tanítására

Az Apple kutatói olyan módszert vizsgáltak, amely címkézetlen felhasználói adatokkal is stabilabbá teheti a federált automatikus beszédfelismerés tanítását. A megközelítés az úgynevezett álcímkék előállítását és a szerveroldali tanítás közbeni stabilizálást hangolja össze.
- Az Apple kutatása a félig felügyelt federált automatikus beszédfelismerést vizsgálja.
- A módszer a tanármodell és a szerveroldali stabilizálás összehangolására épít.
- A szervernek a tanítási körök között címkézett adatokon is tovább kell tanítania.
- A korábbi legerősebb módszerhez képest 11 párosításból 9 esetben javultak az eredmények.
- Az átlagos javulás 20,8 százalék volt tartományon belül, és 10,0 százalék tartományváltáskor.
A címkézetlen adatok jelentik a kihívást
Az Apple szeptember 24-én közzétett kutatása a félig felügyelt federált tanulásra, vagyis az SSFL-re összpontosít. Ebben a beállításban a modellek a klienseken, például különböző eszközökön található címkézetlen adatokból tanulnak. A tanármodell ezekhez az adatokhoz álcímkéket, vagyis a modell által előállított tanítási címkéket készít. A szerveren közben egy kisebb, címkézett kezdő adathalmaz áll rendelkezésre.
Az automatikus beszédfelismerés, az ASR, ezen a területen különösen érzékeny. Az álcímkék hibái egy kimeneti sorozaton belül, majd az egymást követő tanítási körökben is továbbgyűrűzhetnek. Ez eltérítést okozhat a tanításban, és nagy különbséget eredményezhet a teljesen felügyelt federált tanuláshoz képest.
Két egymáshoz kapcsolódó tervezési tengely
A tanulmány szerint a különbség csökkentéséhez két, egymással összefüggő tényezőt kell kezelni. Az első a tanármodell, amely az álcímkéket generálja. A kutatók megvizsgálták a kliensenként működő online tanárt, amelyben minden kliens a saját, folyamatosan változó modelljét használja. Ez a megoldás önmagában eltérhet a kívánt iránytól, stabilizálás után azonban az Apple szerint elérte vagy meghaladta a körönként kiküldött globális tanár teljesítményét. Ez a javulás a vizsgált tartományon belül határozottan megjelent, tartományváltás esetén pedig versenyképes maradt.
A kutatók egy átmeneti tanárt is vizsgáltak, amely egy meghatározott, r jelű körtől a globális modellről az online modellre vált. Erősebb kezdő adathalmaz esetén az online tanár előnye csökkent, az átmeneti megoldás viszont elérte vagy meghaladta mindkét másik tanár eredményét.
A második tengely a szerveroldali horgony. A szervernek a körök között továbbra is címkézett adatokon kell tanítania a modellt, különben az online tanár elmozdulhat. A kutatás szerint ez a közbeiktatott tanítás erősebben meghatározza a konvergenciát, mint önmagában a kezdőmodell.
Kilenc tesztpárban javult a korábbi módszer
A két tengely hatása nem választható el egymástól. Az agresszívebb tanárválasztások csak akkor hoznak eredményt, ha a horgony stabilizálja a tanítást. Ennek hatékonysága érzékeny az adataugmentációra és a kötegméretre, mivel ezek határozzák meg, mennyi bemeneti és gradienszajt ad a szerver a tanításhoz.
A szükséges stabilizálás mértéke tartományfüggő. A kutatók szerint ezt a kezdő adatok szóródása, valamint a kezdő adatok és a klienseken található adatok átfedése befolyásolja.
Az Apple kutatása alapján az ismertetett irányelvek a legerősebb korábbi módszerhez képest 11 vizsgált párosításból 9 esetben javulást hoztak. Az átlagos javulás a tartományon belüli teszteknél 20,8 százalék, tartományok közötti vizsgálatban pedig 10,0 százalék volt. A szerzők szerint ezzel szűkült a különbség a teljesen felügyelt federált tanuláshoz képest.


