Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple tömörítette az eszközön futó beszédfelismerés enkóderét

2026. szeptember 24.Forrás: Apple
Az Apple tömörítette az eszközön futó beszédfelismerés enkóderét
Kép: Apple

Az Apple kutatói olyan módszert mutattak be, amellyel tömöríthető a vállalat eszközön futó diktálási rendszerének beszédfelismerő tokenizálója. A 2,8-szor kisebb modell öt vizsgált tanár-diák párosból hat esetben legfeljebb 1,9 százalékos relatív szókintési hibaarányt mutatott a tanármodellhez képest.

A lényeg röviden
  • Az Apple eszközön futó System-wide Dictation rendszerének tokenizálóját vizsgálták.
  • A desztilláció célpontja a tanármodell kvantálás előtti latens reprezentációja volt.
  • 2,8-szoros tömörítés mellett öt párosból hat esetben 1,9 százalékon belül maradt a relatív WER.
  • A modell 3,9 százalékkal felülmúlta az azonos kapacitású, függetlenül tanított tokenizálót.
  • A tanulmányt 2026 szeptemberében publikálták.

A beszéd útja a nyelvi modellhez

Az Apple 2026 szeptemberében publikált kutatása a streaming neurális audioenkóderek tömörítését vizsgálja. A vállalat System-wide Dictation rendszere teljes egészében az eszközön fut, az átírt beszéd pedig egy tokenizálón keresztül jut el az alapmodellhez.

A tokenizáló egy enkóder, amely a hanghullám rövid szakaszait olyan reprezentációvá alakítja, amelyet a nyelvi modell képes feldolgozni. A kutatók szerint a modell az Instruction-Following Pruning eljárás miatt ritkán aktiválódik teljes egészében, ezért egyszerre csak a szakértői hálózat egy kisebb része foglalja a dinamikus memóriát. Az állandóan működő tokenizáló így ugyanazért a memóriáért versenyez, a paraméterszáma pedig közvetlenül hat a fogyasztásra és a késleltetésre.

A tanármodell belső reprezentációját célozták

Az Apple kutatói tudásdesztillációval, vagyis egy nagyobb tanármodell tudásának kisebb diákmodellbe másolásával próbálták csökkenteni a tokenizáló méretét. A felügyeleti célpontként nem a végső diszkrét tokent és nem is a kimeneti eloszlást választották. Ehelyett azt a kvantálás előtti latens reprezentációt használták, amelyet a nyelvi modell ténylegesen fogyaszt.

Ez a reprezentáció az utolsó olyan pont, amelyen a két támogatott tokeninterfész osztozik. A diákenkódert arra tanították, hogy négyzetes hibafüggvény mellett képkockánként kövesse a tanármodell latens kimenetét. A tanár és a diák eltérő szélességét egyetlen affin réteg kezeli.

Mivel a célpont a kvantáló és a nyelvi modell közötti híd előtt található, ugyanaz a módszer mindkét tokeninterfészhez használható. Az eljárás olyan tokenizálónál is alkalmazható, amelyet önállóan előtanítottak, és olyan modellnél is, amelyet közösen tanítottak a nyelvi modellel.

A kisebb modell közel maradt a tanár pontosságához

A tanulmány eredménye szerint 2,8-szoros tömörítés mellett a desztillált diákmodell öt tanár-diák párosból hat esetben a tanármodell 1,9 százalékos relatív szókintési hibaarányán belül maradt. A kutatók ezt finomhangolás nélkül mérték.

A desztillált tokenizáló egy ugyanekkora kapacitású, függetlenül betanított tokenizálónál is jobb eredményt ért el: relatív értelemben 3,9 százalékkal javított a teljesítményén. A munka szerzői Prasanth Yadla, Mohammad Samragh Razlighi, Dongseong Hwang, Mingbin Xu, Yuanyuan Zhang, Chung-Cheng Chiu, Yongqiang Wang, Yuan Liu, Zhen Huang és Xiaodan Zhuang.

Az eredmények a felhasználók számára azt jelentik, hogy az Apple kutatása egy kisebb, folyamatosan működő beszédfeldolgozó komponens kialakítását célozza, miközben a tanármodellhez közeli átírási pontosságot tart fenn. A forrás szerint ez a memóriahasználat, a fogyasztás és a késleltetés szempontjából lehet fontos az eszközön futó diktálásnál.

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket
Kutatás2026. október 2.

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket

Az Apple kutatói szerint a beszédmodellek előzetes tanításakor bevezetett nyelvi megkülönböztetés csökkentheti a többnyelvű és egynyelvű modellek közötti…

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség…