A Krisp új hangszigetelő modellje az átírás pontosságára fókuszál

A Krisp bemutatta a Voice Isolation 2.5 hangszigetelő modellt, amelyet kifejezetten beszédfelismerő rendszerekhez (STT) optimalizáltak. A vállalat tesztjeiben az új modell átlagosan 46,4 százalékkal csökkentette a szöveges átírás hibaarányát a feldolgozatlan hanghoz képest.
- A Voice Isolation 2.5-et STT-rendszerekhez optimalizálták.
- A Krisp tesztjeiben az átlagos WER 46,4 százalékkal csökkent.
- Átfedő beszéd esetén a WER 35,92 százalékról 10,90 százalékra esett.
- A teszt 1685 valós felvételt és 10 STT-rendszert tartalmazott.
- A lite változat körülbelül 3,5-szer kisebb a teljes modellnél.
A háttérbeszéd különösen nehéz a beszédfelismerőknek
A Krisp szerint a modern beszédfelismerő modellek a ventilátor- vagy közlekedési zajhoz hasonló háttérhangokat már jól kezelik. A háttérben megszólaló másik ember hangja viszont komolyabb problémát jelent. Ha két beszélő hangja átfedésbe kerül, a szavak hibaaránya (WER) jelentősen romlik, a hagyományos zajszűrés pedig ezt nem tudja megfelelően kezelni, mivel a zavaró jel maga is beszéd.
A Voice Isolation a VIVA nevű, hangalapú ügynökökhöz fejlesztett valós idejű modellek része. A Krisp közlése szerint az izolálás a feldolgozási lánc elején távolítja el a zajt és a háttérbeszédet, hogy a további modellek pontosabban felismerjék, mikor fejezte be a beszélő a mondandóját. Ezek a modellek jelenleg havonta több mint 1 milliárd percnyi hangalapú AI-beszélgetésben futnak éles környezetben.
A Voice Isolation 2.5 eredményei
A Krisp augusztus 12-i bejelentése szerint a Voice Isolation 2.5 a vállalat legújabb általános célú hangszigetelő modellje. A modellt nem egyetlen STT-rendszerhez hangolták, és a cég által vizsgált minden beszédfelismerőnél csökkentette a WER-t. A feldolgozatlan hang 15,35 százalékos átlagos hibaaránya 8,22 százalékra esett, ami 46,4 százalékos javulást jelent.
Olyan hívásoknál, ahol egy másik beszélő is megszólal a háttérben, a WER 35,92 százalékról 10,90 százalékra csökkent. Ez 69,7 százalékkal kevesebb hibának felel meg a Krisp számítása szerint. A korábbi VI 2.1 modellhez képest a kihívást jelentő akusztikai környezetekben mért hibaarány 15,42 százalékról 11,61 százalékra javult.
A teszt 1685 valós felvételből, összesen körülbelül 7 óra hanganyagból állt. A felvételeket 10, streaming és nem streaming beszédfelismerő rendszerrel vizsgálták, hét szolgáltatótól: Deepgram, NVIDIA, Soniox, ElevenLabs, AssemblyAI, Google és Cartesia.
Kisebb változat a korlátozott számítási kapacitású környezetekhez
A Krisp két méretben kínálja a modellt. A teljes Voice Isolation 2.5 mellett egy lite változat is készül, amely a vállalat szerint körülbelül 3,5-szer kisebb. Ezt CPU-korlátozott és peremhálózati telepítésekhez szánják, és tipikus hívásoknál a teljes modellhez hasonló eredményt ad.
A fejlesztés egyik célja, hogy a hangszigetelés használata ne rontsa a tiszta, egyetlen beszélős felvételek átírását. A Voice Isolation 2.5 esetében a standard akusztikai környezetben mért WER 2,15 százalék volt, miközben feldolgozás nélkül 2,10 százalékot mértek. A Krisp szerint így az izolálás bekapcsolva hagyható minden hívásnál, miközben a háttérben zajló beszéd eltávolítása javítja a nehezebb felvételek átírását.


