Az Apple megosztott útválasztót javasol a beszédfelismerő MoE-modellekhez

Az Apple kutatói olyan Omni-router Transformer modellt mutattak be, amely a beszédfelismerésben több rétegen keresztül megosztja az útválasztási döntéseket. A kutatás szerint a megoldás 11,2 százalékkal csökkentette az átlagos szóhibaarányt a sűrű modellekhez képest, és 8,2 százalékkal a Switch Transformerhez viszonyítva.
- Az Omni-router Transformer megosztott útválasztót használ több MoE-réteg között.
- A módszert beszédfelismerési modelleken és tíz out-of-domain benchmarkon értékelték.
- Az átlagos szóhibaarány 11,2 százalékkal csökkent a sűrű modellekhez képest.
- A Switch Transformerhez képest 8,2 százalékos csökkenést mértek.
- A kutatók strukturáltabb szakértőhasználatról és jobb robusztusságról számoltak be.
Közös döntés több MoE-rétegben
A tanulmány a ritka szakértőkeverék, vagyis a sparse Mixture-of-Experts, röviden MoE, architektúrák beszédfelismerési alkalmazását vizsgálja. Ezekben a rendszerekben az útválasztó választja ki, hogy egy adott bemeneti egységet, vagyis tokent, a rendelkezésre álló szakértői modellek közül melyek dolgozzák fel.
A hagyományos MoE-megoldások, köztük a Switch Transformer, minden rétegben egymástól függetlenül végzik el ezt a kiválasztást. Az Apple kutatói szerint a legtöbb réteg útválasztói között nincs erős korreláció, vagyis az egyik réteg szakértőválasztása kevéssé függ össze a többi réteg döntésével.
Az Omni-router Transformer ezt a működést egy, a különböző MoE-rétegek között megosztott útválasztóval módosítja. A cél a rétegek szakértői közötti együttműködés növelése és a szakértők specializációjának ösztönzése.
Alacsonyabb tanítási veszteség és kevesebb szóhiba
A kutatók nagyméretű, pszeudo-címkézett adathalmazon végeztek kísérleteket, majd tíz különböző, a tanítás során nem használt beszédfelismerési referenciaértéken, vagyis out-of-domain ASR benchmarkon értékelték a modelleket.
Az Apple kutatási oldala szerint az Omni-router Transformer alacsonyabb tanítási veszteséget ért el a sűrű és a Switch Transformer modelleknél. A tíz benchmarkon a modell következetesen jobban teljesített mindkét összehasonlítási alapnál.
Az átlagos szóhibaarány a sűrű modellekhez képest 11,2 százalékkal, a Switch Transformerhez képest pedig 8,2 százalékkal csökkent. A kutatók emellett strukturáltabb szakértőhasználatról és a változatos adatokkal szembeni jobb robusztusságról számoltak be.
A szakértői útvonalak új nézőpontot adnak
Az Apple kapcsolódó kutatásai között szerepel a Path-Constrained Mixture-of-Experts című munka is. Ez a megközelítés a MoE-számításokat szakértői útvonalakként vizsgálja. Egy token útvonala azoknak a szakértőknek a sorozata, amelyeket a rendszer az összes rétegen keresztül kiválaszt.
Az elmélet szerint N szakértő és L réteg esetén NL lehetséges útvonal létezhet. A kutatás leírása szerint a gyakorlatban a tokenek az útvonalaknak csak egy kis részére csoportosulnak, és ezek az útvonalak nyelvi funkciókhoz igazodnak.
Az Omni-Router tanulmány szerzői Zijin Gu, Tatiana Likhomanenko és Navdeep Jaitly. A dolgozat a beszédfelismerés és a módszerek, illetve algoritmusok kutatási területéhez kapcsolódik, és az ASRU konferenciához kötődik. A publikáció a forrásoldal szerint 2025 júliusában jelent meg.
Mit jelenthet ez a beszédfelismerő rendszereknek?
A bemutatott módszer a beszédfelismerő modellekben használt szakértők koordinációját változtatja meg. A forrásban közölt eredmények alapján az útválasztási döntések megosztása egyszerre kapcsolódik az alacsonyabb tanítási veszteséghez, a kisebb szóhibaarányhoz és a strukturáltabb szakértőhasználathoz.
A tíz, tanításon kívüli benchmarkon mért eredmények arra utalnak, hogy az Omni-router Transformer eltérő adatok mellett is robusztusabban működhet a vizsgált sűrű és Switch Transformer modelleknél. A kutatási oldal ugyanakkor módszertani eredményként mutatja be a megoldást, és a forrás nem közöl konkrét termékbevezetést vagy felhasználói elérhetőséget.


