Az Apple tömörítette az eszközön futó beszédfelismerés enkóderét

Az Apple kutatói olyan módszert mutattak be, amellyel tömöríthető a vállalat eszközön futó diktálási rendszerének beszédfelismerő tokenizálója. A 2,8-szor kisebb modell öt vizsgált tanár-diák párosból hat esetben legfeljebb 1,9 százalékos relatív szókintési hibaarányt mutatott a tanármodellhez képest.
- Az Apple eszközön futó System-wide Dictation rendszerének tokenizálóját vizsgálták.
- A desztilláció célpontja a tanármodell kvantálás előtti latens reprezentációja volt.
- 2,8-szoros tömörítés mellett öt párosból hat esetben 1,9 százalékon belül maradt a relatív WER.
- A modell 3,9 százalékkal felülmúlta az azonos kapacitású, függetlenül tanított tokenizálót.
- A tanulmányt 2026 szeptemberében publikálták.
A beszéd útja a nyelvi modellhez
Az Apple 2026 szeptemberében publikált kutatása a streaming neurális audioenkóderek tömörítését vizsgálja. A vállalat System-wide Dictation rendszere teljes egészében az eszközön fut, az átírt beszéd pedig egy tokenizálón keresztül jut el az alapmodellhez.
A tokenizáló egy enkóder, amely a hanghullám rövid szakaszait olyan reprezentációvá alakítja, amelyet a nyelvi modell képes feldolgozni. A kutatók szerint a modell az Instruction-Following Pruning eljárás miatt ritkán aktiválódik teljes egészében, ezért egyszerre csak a szakértői hálózat egy kisebb része foglalja a dinamikus memóriát. Az állandóan működő tokenizáló így ugyanazért a memóriáért versenyez, a paraméterszáma pedig közvetlenül hat a fogyasztásra és a késleltetésre.
A tanármodell belső reprezentációját célozták
Az Apple kutatói tudásdesztillációval, vagyis egy nagyobb tanármodell tudásának kisebb diákmodellbe másolásával próbálták csökkenteni a tokenizáló méretét. A felügyeleti célpontként nem a végső diszkrét tokent és nem is a kimeneti eloszlást választották. Ehelyett azt a kvantálás előtti latens reprezentációt használták, amelyet a nyelvi modell ténylegesen fogyaszt.
Ez a reprezentáció az utolsó olyan pont, amelyen a két támogatott tokeninterfész osztozik. A diákenkódert arra tanították, hogy négyzetes hibafüggvény mellett képkockánként kövesse a tanármodell latens kimenetét. A tanár és a diák eltérő szélességét egyetlen affin réteg kezeli.
Mivel a célpont a kvantáló és a nyelvi modell közötti híd előtt található, ugyanaz a módszer mindkét tokeninterfészhez használható. Az eljárás olyan tokenizálónál is alkalmazható, amelyet önállóan előtanítottak, és olyan modellnél is, amelyet közösen tanítottak a nyelvi modellel.
A kisebb modell közel maradt a tanár pontosságához
A tanulmány eredménye szerint 2,8-szoros tömörítés mellett a desztillált diákmodell öt tanár-diák párosból hat esetben a tanármodell 1,9 százalékos relatív szókintési hibaarányán belül maradt. A kutatók ezt finomhangolás nélkül mérték.
A desztillált tokenizáló egy ugyanekkora kapacitású, függetlenül betanított tokenizálónál is jobb eredményt ért el: relatív értelemben 3,9 százalékkal javított a teljesítményén. A munka szerzői Prasanth Yadla, Mohammad Samragh Razlighi, Dongseong Hwang, Mingbin Xu, Yuanyuan Zhang, Chung-Cheng Chiu, Yongqiang Wang, Yuan Liu, Zhen Huang és Xiaodan Zhuang.
Az eredmények a felhasználók számára azt jelentik, hogy az Apple kutatása egy kisebb, folyamatosan működő beszédfeldolgozó komponens kialakítását célozza, miközben a tanármodellhez közeli átírási pontosságot tart fenn. A forrás szerint ez a memóriahasználat, a fogyasztás és a késleltetés szempontjából lehet fontos az eszközön futó diktálásnál.


