Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Krisp új hangszigetelő modellje az átírás pontosságára fókuszál

2026. augusztus 12. 15:26Forrás: Krisp
A Krisp új hangszigetelő modellje az átírás pontosságára fókuszál
Kép: Krisp

A Krisp bemutatta a Voice Isolation 2.5 hangszigetelő modellt, amelyet kifejezetten beszédfelismerő rendszerekhez (STT) optimalizáltak. A vállalat tesztjeiben az új modell átlagosan 46,4 százalékkal csökkentette a szöveges átírás hibaarányát a feldolgozatlan hanghoz képest.

A lényeg röviden
  • A Voice Isolation 2.5-et STT-rendszerekhez optimalizálták.
  • A Krisp tesztjeiben az átlagos WER 46,4 százalékkal csökkent.
  • Átfedő beszéd esetén a WER 35,92 százalékról 10,90 százalékra esett.
  • A teszt 1685 valós felvételt és 10 STT-rendszert tartalmazott.
  • A lite változat körülbelül 3,5-szer kisebb a teljes modellnél.

A háttérbeszéd különösen nehéz a beszédfelismerőknek

A Krisp szerint a modern beszédfelismerő modellek a ventilátor- vagy közlekedési zajhoz hasonló háttérhangokat már jól kezelik. A háttérben megszólaló másik ember hangja viszont komolyabb problémát jelent. Ha két beszélő hangja átfedésbe kerül, a szavak hibaaránya (WER) jelentősen romlik, a hagyományos zajszűrés pedig ezt nem tudja megfelelően kezelni, mivel a zavaró jel maga is beszéd.

A Voice Isolation a VIVA nevű, hangalapú ügynökökhöz fejlesztett valós idejű modellek része. A Krisp közlése szerint az izolálás a feldolgozási lánc elején távolítja el a zajt és a háttérbeszédet, hogy a további modellek pontosabban felismerjék, mikor fejezte be a beszélő a mondandóját. Ezek a modellek jelenleg havonta több mint 1 milliárd percnyi hangalapú AI-beszélgetésben futnak éles környezetben.

A Voice Isolation 2.5 eredményei

A Krisp augusztus 12-i bejelentése szerint a Voice Isolation 2.5 a vállalat legújabb általános célú hangszigetelő modellje. A modellt nem egyetlen STT-rendszerhez hangolták, és a cég által vizsgált minden beszédfelismerőnél csökkentette a WER-t. A feldolgozatlan hang 15,35 százalékos átlagos hibaaránya 8,22 százalékra esett, ami 46,4 százalékos javulást jelent.

Olyan hívásoknál, ahol egy másik beszélő is megszólal a háttérben, a WER 35,92 százalékról 10,90 százalékra csökkent. Ez 69,7 százalékkal kevesebb hibának felel meg a Krisp számítása szerint. A korábbi VI 2.1 modellhez képest a kihívást jelentő akusztikai környezetekben mért hibaarány 15,42 százalékról 11,61 százalékra javult.

A teszt 1685 valós felvételből, összesen körülbelül 7 óra hanganyagból állt. A felvételeket 10, streaming és nem streaming beszédfelismerő rendszerrel vizsgálták, hét szolgáltatótól: Deepgram, NVIDIA, Soniox, ElevenLabs, AssemblyAI, Google és Cartesia.

Kisebb változat a korlátozott számítási kapacitású környezetekhez

A Krisp két méretben kínálja a modellt. A teljes Voice Isolation 2.5 mellett egy lite változat is készül, amely a vállalat szerint körülbelül 3,5-szer kisebb. Ezt CPU-korlátozott és peremhálózati telepítésekhez szánják, és tipikus hívásoknál a teljes modellhez hasonló eredményt ad.

A fejlesztés egyik célja, hogy a hangszigetelés használata ne rontsa a tiszta, egyetlen beszélős felvételek átírását. A Voice Isolation 2.5 esetében a standard akusztikai környezetben mért WER 2,15 százalék volt, miközben feldolgozás nélkül 2,10 százalékot mértek. A Krisp szerint így az izolálás bekapcsolva hagyható minden hívásnál, miközben a háttérben zajló beszéd eltávolítása javítja a nehezebb felvételek átírását.

Kapcsolódó hírek

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp
Kutatás2026. szeptember 28. 16:16

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp

A Krisp 265 valódi beszélgetésből álló tesztadatbázist készített a háttérben megszólaló hangok vizsgálatára. A felvételek irodákban, call centerekben és mozgó autókban…

A beszédfelismerők még elbuknak, ha más is beszél a háttérben
Kutatás2026. szeptember 23. 13:51

A beszédfelismerők még elbuknak, ha más is beszél a háttérben

A modern beszédfelismerők jól kezelik a forgalom, a légkondicionáló és a billentyűzet zaját, de egy másik beszélő hangja továbbra is komoly hibákat okoz. A Krisp 265…

Mind a hat Krisp-kihívást továbbviszi az amerikai szabadalmi hivatal
Cégek és üzlet2026. szeptember 8. 15:50

Mind a hat Krisp-kihívást továbbviszi az amerikai szabadalmi hivatal

Az amerikai szabadalmi hivatal, az USPTO mind a hat, Krisp által benyújtott szabadalmi kifogás ügyében engedélyezte az eljárás folytatását. A beadványok a Sanas által a…