Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple megosztott útválasztót javasol a beszédfelismerő MoE-modellekhez

2026. július 6.Forrás: Apple
Az Apple megosztott útválasztót javasol a beszédfelismerő MoE-modellekhez
Kép: Apple

Az Apple kutatói olyan Omni-router Transformer modellt mutattak be, amely a beszédfelismerésben több rétegen keresztül megosztja az útválasztási döntéseket. A kutatás szerint a megoldás 11,2 százalékkal csökkentette az átlagos szóhibaarányt a sűrű modellekhez képest, és 8,2 százalékkal a Switch Transformerhez viszonyítva.

A lényeg röviden
  • Az Omni-router Transformer megosztott útválasztót használ több MoE-réteg között.
  • A módszert beszédfelismerési modelleken és tíz out-of-domain benchmarkon értékelték.
  • Az átlagos szóhibaarány 11,2 százalékkal csökkent a sűrű modellekhez képest.
  • A Switch Transformerhez képest 8,2 százalékos csökkenést mértek.
  • A kutatók strukturáltabb szakértőhasználatról és jobb robusztusságról számoltak be.

Közös döntés több MoE-rétegben

A tanulmány a ritka szakértőkeverék, vagyis a sparse Mixture-of-Experts, röviden MoE, architektúrák beszédfelismerési alkalmazását vizsgálja. Ezekben a rendszerekben az útválasztó választja ki, hogy egy adott bemeneti egységet, vagyis tokent, a rendelkezésre álló szakértői modellek közül melyek dolgozzák fel.

A hagyományos MoE-megoldások, köztük a Switch Transformer, minden rétegben egymástól függetlenül végzik el ezt a kiválasztást. Az Apple kutatói szerint a legtöbb réteg útválasztói között nincs erős korreláció, vagyis az egyik réteg szakértőválasztása kevéssé függ össze a többi réteg döntésével.

Az Omni-router Transformer ezt a működést egy, a különböző MoE-rétegek között megosztott útválasztóval módosítja. A cél a rétegek szakértői közötti együttműködés növelése és a szakértők specializációjának ösztönzése.

Alacsonyabb tanítási veszteség és kevesebb szóhiba

A kutatók nagyméretű, pszeudo-címkézett adathalmazon végeztek kísérleteket, majd tíz különböző, a tanítás során nem használt beszédfelismerési referenciaértéken, vagyis out-of-domain ASR benchmarkon értékelték a modelleket.

Az Apple kutatási oldala szerint az Omni-router Transformer alacsonyabb tanítási veszteséget ért el a sűrű és a Switch Transformer modelleknél. A tíz benchmarkon a modell következetesen jobban teljesített mindkét összehasonlítási alapnál.

Az átlagos szóhibaarány a sűrű modellekhez képest 11,2 százalékkal, a Switch Transformerhez képest pedig 8,2 százalékkal csökkent. A kutatók emellett strukturáltabb szakértőhasználatról és a változatos adatokkal szembeni jobb robusztusságról számoltak be.

A szakértői útvonalak új nézőpontot adnak

Az Apple kapcsolódó kutatásai között szerepel a Path-Constrained Mixture-of-Experts című munka is. Ez a megközelítés a MoE-számításokat szakértői útvonalakként vizsgálja. Egy token útvonala azoknak a szakértőknek a sorozata, amelyeket a rendszer az összes rétegen keresztül kiválaszt.

Az elmélet szerint N szakértő és L réteg esetén NL lehetséges útvonal létezhet. A kutatás leírása szerint a gyakorlatban a tokenek az útvonalaknak csak egy kis részére csoportosulnak, és ezek az útvonalak nyelvi funkciókhoz igazodnak.

Az Omni-Router tanulmány szerzői Zijin Gu, Tatiana Likhomanenko és Navdeep Jaitly. A dolgozat a beszédfelismerés és a módszerek, illetve algoritmusok kutatási területéhez kapcsolódik, és az ASRU konferenciához kötődik. A publikáció a forrásoldal szerint 2025 júliusában jelent meg.

Mit jelenthet ez a beszédfelismerő rendszereknek?

A bemutatott módszer a beszédfelismerő modellekben használt szakértők koordinációját változtatja meg. A forrásban közölt eredmények alapján az útválasztási döntések megosztása egyszerre kapcsolódik az alacsonyabb tanítási veszteséghez, a kisebb szóhibaarányhoz és a strukturáltabb szakértőhasználathoz.

A tíz, tanításon kívüli benchmarkon mért eredmények arra utalnak, hogy az Omni-router Transformer eltérő adatok mellett is robusztusabban működhet a vizsgált sűrű és Switch Transformer modelleknél. A kutatási oldal ugyanakkor módszertani eredményként mutatja be a megoldást, és a forrás nem közöl konkrét termékbevezetést vagy felhasználói elérhetőséget.

AppleOmni-router TransformerSwitch Transformerhang és beszédnyelvi modellekkutatási eredmény

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket
Kutatás2026. október 2.

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket

Az Apple kutatói szerint a beszédmodellek előzetes tanításakor bevezetett nyelvi megkülönböztetés csökkentheti a többnyelvű és egynyelvű modellek közötti…