Az AssemblyAI szerint félrevezető lehet a beszédfelismerés WER-mérőszáma

A hagyományos szóhibaarány, vagyis a WER egyes esetekben rosszabbnak mutathatja az újabb beszédfelismerő modelleket, állítja az AssemblyAI. A vállalat szerint a probléma gyakran a hibás emberi átiratból és a jelentésben azonos, de eltérően formázott szavakból ered.
- A hibás emberi referenciaátirat a jobb modellt is rosszabbnak mutathatja a WER-ben.
- Az AssemblyAI szerint a Universal-3 Pro több, valóban elhangzott, de a referenciából hiányzó szót ismert fel.
- A szemantikailag azonos, eltérően írt szavak szintén WER-hibaként jelenhetnek meg.
- Az új eszközök a referenciafájlok javítását és szemantikai szólisták létrehozását segítik.
- Az aszinkron és a streaming modelleket külön benchmarkban kell értékelni.
A WER a hibás referencia miatt is büntethet
Az AssemblyAI szeptember 30-án közzétett elemzése szerint a WER, vagyis a Word Error Rate régóta a beszédfelismerő rendszerek összehasonlításának meghatározó mérőszáma. A módszer lényege, hogy egy ember által elkészített referenciaátiratot vetnek össze több mesterséges intelligenciával készült átirattal. A szövegeket általában egységesítik, majd a WER azt méri, a szavak hány százalékát írta át hibásan a rendszer. Az alacsonyabb érték számít jobbnak.
A vállalat szerint a folyamat jellemzően 10 és 20, a felhasználási területet reprezentáló hangfájllal indul. Ezekhez emberi „truth file”, vagyis referenciaátirat készül, majd ugyanazokat a felvételeket több beszédfelismerő-szolgáltató rendszerén is lefuttatják. Az értékelés során a Whisper Normalizer egységesítheti a szövegeket, a WER kiszámítására pedig olyan nyílt forráskódú csomagokat használhatnak, mint a jiwer.
Az AssemblyAI akkor kezdte részletesebben vizsgálni a módszert, amikor egyes ügyfelei szerint a vállalat új Universal-3 Pro modellje rosszabb eredményt ért el a korábbi modelleknél. A cég belső tapasztalatai nem ezt mutatták, ezért átnézték az ügyféltől származó benchmarkokat.
A beszélt, de a referenciaátiratból hiányzó szavak problémája
A vizsgálat során az AssemblyAI aránytalanul sok beszúrást talált. A WER három gyakori hibakategóriája a beszúrás, a törlés és a helyettesítés. Beszúrásnak számít, ha a rendszer olyan szót ír le, amely a referenciaátiratban nem szerepel, törlésnek, ha kihagy egy elhangzott szót, helyettesítésnek pedig, ha egy másik szóval írja le ugyanazt a részletet.
A vállalat munkatársai meghallgatták a Universal-3 Pro által beszúrásként jelölt szavakat az eredeti hangfelvételeken. Állításuk szerint ezek nagy része valóban elhangzott, csak az emberi átíró nem rögzítette. Ez különösen zajos környezetben, akcentusos beszédnél, egymásba vágó megszólalásoknál és gyors beszéd esetén fordult elő. Az AssemblyAI szerint ilyenkor a modell jobb lehetett a vele összevetett emberi referenciaátiratnál, a WER mégis hibaként számolta el a helyes felismeréseket.
A helyettesítések különösen problémásak lehetnek, ha az átiratot később nagy nyelvi modell vagy más beszédértő rendszer dolgozza fel. Az AssemblyAI példája szerint a „Cadillac” szó „cataracts” formában való felismerése ugyan egyetlen szóhibának tűnik, de a jelentést teljesen megváltoztatja. A vállalat ezért a ritka és fontos elemek, például tulajdonnevek, cégnevek, gyógyszernevek, alfanumerikus azonosítók, telefonszámok, dátumok és címek pontos felismerését külön Missed Entity Rate mutatóval is vizsgálja.
Új eszközök a referenciaátiratok javítására
Az AssemblyAI egy olyan eszközt készített, amely a meglévő referenciaátiratot és a hozzá tartozó hanganyagot vizsgálja át. A Universal-3 Pro átiratát összeveti az emberi szöveggel, majd minden eltéréshez lejátszható hangrészletet kínál. A felhasználó jelezheti, hogy a modell volt helyes, az emberi átiratot kell megtartani, vagy egyik változat sem pontos. Utóbbi esetben saját szöveget írhat be, illetve az érthetetlen részeket inaudible, vagyis nem hallható jelöléssel láthatja el.
A WER az ellenőrzés közben folyamatosan frissül, így láthatóvá válik, milyen hatással vannak a javítások az eredményre. Az AssemblyAI szerint a korrigált referenciafájlokat későbbi mérésekhez és több szolgáltató összehasonlításához is fel lehet használni.
A vállalat szemantikai szólisták létrehozására is ad eszközt. Ezekben olyan szóalakok csoportosíthatók, amelyek jelentése azonos, de írásmódjuk eltér, például az „all right” és az „alright”, a „health care” és a „healthcare”, illetve a „set up” és a „setup”. A Whisper Normalizer bizonyos eltéréseket már kezel, de az AssemblyAI szerint nem minden szakterületi vagy stilisztikai változatot fed le.
A cég emellett GitHub-adattárat is kiadott saját belső benchmarkfolyamatok felépítéséhez. Az AssemblyAI külön felhívja a figyelmet arra, hogy az aszinkron és a valós idejű, streaming modelleket külön kell értékelni, mivel a streaming rendszereknél a hangot a teljes felvétel ideje alatt, valós időben kell feldolgozni.
AssemblyAI: Why your word error rate (WER) benchmark might be lying to you


