Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az AssemblyAI szerint félrevezető lehet a beszédfelismerés WER-mérőszáma

2026. szeptember 30.Forrás: AssemblyAI
Az AssemblyAI szerint félrevezető lehet a beszédfelismerés WER-mérőszáma
Kép: AssemblyAI

A hagyományos szóhibaarány, vagyis a WER egyes esetekben rosszabbnak mutathatja az újabb beszédfelismerő modelleket, állítja az AssemblyAI. A vállalat szerint a probléma gyakran a hibás emberi átiratból és a jelentésben azonos, de eltérően formázott szavakból ered.

A lényeg röviden
  • A hibás emberi referenciaátirat a jobb modellt is rosszabbnak mutathatja a WER-ben.
  • Az AssemblyAI szerint a Universal-3 Pro több, valóban elhangzott, de a referenciából hiányzó szót ismert fel.
  • A szemantikailag azonos, eltérően írt szavak szintén WER-hibaként jelenhetnek meg.
  • Az új eszközök a referenciafájlok javítását és szemantikai szólisták létrehozását segítik.
  • Az aszinkron és a streaming modelleket külön benchmarkban kell értékelni.

A WER a hibás referencia miatt is büntethet

Az AssemblyAI szeptember 30-án közzétett elemzése szerint a WER, vagyis a Word Error Rate régóta a beszédfelismerő rendszerek összehasonlításának meghatározó mérőszáma. A módszer lényege, hogy egy ember által elkészített referenciaátiratot vetnek össze több mesterséges intelligenciával készült átirattal. A szövegeket általában egységesítik, majd a WER azt méri, a szavak hány százalékát írta át hibásan a rendszer. Az alacsonyabb érték számít jobbnak.

A vállalat szerint a folyamat jellemzően 10 és 20, a felhasználási területet reprezentáló hangfájllal indul. Ezekhez emberi „truth file”, vagyis referenciaátirat készül, majd ugyanazokat a felvételeket több beszédfelismerő-szolgáltató rendszerén is lefuttatják. Az értékelés során a Whisper Normalizer egységesítheti a szövegeket, a WER kiszámítására pedig olyan nyílt forráskódú csomagokat használhatnak, mint a jiwer.

Az AssemblyAI akkor kezdte részletesebben vizsgálni a módszert, amikor egyes ügyfelei szerint a vállalat új Universal-3 Pro modellje rosszabb eredményt ért el a korábbi modelleknél. A cég belső tapasztalatai nem ezt mutatták, ezért átnézték az ügyféltől származó benchmarkokat.

A beszélt, de a referenciaátiratból hiányzó szavak problémája

A vizsgálat során az AssemblyAI aránytalanul sok beszúrást talált. A WER három gyakori hibakategóriája a beszúrás, a törlés és a helyettesítés. Beszúrásnak számít, ha a rendszer olyan szót ír le, amely a referenciaátiratban nem szerepel, törlésnek, ha kihagy egy elhangzott szót, helyettesítésnek pedig, ha egy másik szóval írja le ugyanazt a részletet.

A vállalat munkatársai meghallgatták a Universal-3 Pro által beszúrásként jelölt szavakat az eredeti hangfelvételeken. Állításuk szerint ezek nagy része valóban elhangzott, csak az emberi átíró nem rögzítette. Ez különösen zajos környezetben, akcentusos beszédnél, egymásba vágó megszólalásoknál és gyors beszéd esetén fordult elő. Az AssemblyAI szerint ilyenkor a modell jobb lehetett a vele összevetett emberi referenciaátiratnál, a WER mégis hibaként számolta el a helyes felismeréseket.

A helyettesítések különösen problémásak lehetnek, ha az átiratot később nagy nyelvi modell vagy más beszédértő rendszer dolgozza fel. Az AssemblyAI példája szerint a „Cadillac” szó „cataracts” formában való felismerése ugyan egyetlen szóhibának tűnik, de a jelentést teljesen megváltoztatja. A vállalat ezért a ritka és fontos elemek, például tulajdonnevek, cégnevek, gyógyszernevek, alfanumerikus azonosítók, telefonszámok, dátumok és címek pontos felismerését külön Missed Entity Rate mutatóval is vizsgálja.

Új eszközök a referenciaátiratok javítására

Az AssemblyAI egy olyan eszközt készített, amely a meglévő referenciaátiratot és a hozzá tartozó hanganyagot vizsgálja át. A Universal-3 Pro átiratát összeveti az emberi szöveggel, majd minden eltéréshez lejátszható hangrészletet kínál. A felhasználó jelezheti, hogy a modell volt helyes, az emberi átiratot kell megtartani, vagy egyik változat sem pontos. Utóbbi esetben saját szöveget írhat be, illetve az érthetetlen részeket inaudible, vagyis nem hallható jelöléssel láthatja el.

A WER az ellenőrzés közben folyamatosan frissül, így láthatóvá válik, milyen hatással vannak a javítások az eredményre. Az AssemblyAI szerint a korrigált referenciafájlokat későbbi mérésekhez és több szolgáltató összehasonlításához is fel lehet használni.

A vállalat szemantikai szólisták létrehozására is ad eszközt. Ezekben olyan szóalakok csoportosíthatók, amelyek jelentése azonos, de írásmódjuk eltér, például az „all right” és az „alright”, a „health care” és a „healthcare”, illetve a „set up” és a „setup”. A Whisper Normalizer bizonyos eltéréseket már kezel, de az AssemblyAI szerint nem minden szakterületi vagy stilisztikai változatot fed le.

A cég emellett GitHub-adattárat is kiadott saját belső benchmarkfolyamatok felépítéséhez. Az AssemblyAI külön felhívja a figyelmet arra, hogy az aszinkron és a valós idejű, streaming modelleket külön kell értékelni, mivel a streaming rendszereknél a hangot a teljes felvétel ideje alatt, valós időben kell feldolgozni.

AssemblyAIUniversal-3 ProWhisper Normalizerjiwerhang és beszédbenchmarkkutatási eredmény

Kapcsolódó hírek

Hét tanulság a valódi hangalapú ügynökök építéséről
Termékek és eszközök2026. szeptember 30.

Hét tanulság a valódi hangalapú ügynökök építéséről

A bemutatón jól működő hangalapú AI-ügynököt gyorsan össze lehet rakni, éles környezetben azonban a hangposta, a megszakítások, a késleltetés és a bizalom komoly…

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp
Kutatás2026. szeptember 28. 16:16

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp

A Krisp 265 valódi beszélgetésből álló tesztadatbázist készített a háttérben megszólaló hangok vizsgálatára. A felvételek irodákban, call centerekben és mozgó autókban…

A Speechmatics szerint 20 másodperc alatt átír egyórányi hangot a Melia
Modellek2026. augusztus 26.

A Speechmatics szerint 20 másodperc alatt átír egyórányi hangot a Melia

A Speechmatics Melia beszédfelismerő modellje a cég szerint egyórányi hangfelvételt kevesebb mint 20 másodperc alatt ír át. Az Artificial Analysis független rangsorán…