Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A beszédfelismerők még elbuknak, ha más is beszél a háttérben

2026. szeptember 23.Forrás: Krisp
A beszédfelismerők még elbuknak, ha más is beszél a háttérben
Kép: Krisp

A modern beszédfelismerők jól kezelik a forgalom, a légkondicionáló és a billentyűzet zaját, de egy másik beszélő hangja továbbra is komoly hibákat okoz. A Krisp 265 valódi beszélgetésen mérte meg, hogyan változik 11 beszédfelismerő-konfiguráció pontossága a Voice Isolation használatával.

A lényeg röviden
  • A Krisp 265 valódi felvételen vizsgálta a háttérbeszéd hatását.
  • A teszt 11 beszédfelismerő-konfigurációt és négy Voice Isolation modellt fedett le.
  • A teljes korpuszon 73 százalékkal csökkent a szóhibaarány.
  • Munkahelyi környezetben 31,84 százalékról 6,30 százalékra esett a hibaarány.
  • Gyenge, háttérbeszéd nélküli telefonhangoknál az izoláció ronthatott az eredményen.

A másik beszélő hangja más típusú probléma

A Krisp szerint a zaj azért szűrhető viszonylag jól, mert nem hasonlít a felismerni kívánt beszédre. Egy másik ember hangja viszont ugyanazokat a jellemzőket hordozza, mint a fő beszélőé, ezért a beszéd kiemelése egy másik hang alól eltérő feladat a hagyományos zajszűréstől.

Ez különösen problémás lehet hangalapú ügynököknél. A háttérben beszélő személy szavai bekerülhetnek az átiratba, így a rendszer olyan információkra támaszkodhat, amelyeket a felhasználó nem mondott. Az is előfordulhat, hogy a rendszer a másik beszélőt azonosítja fő beszélőként, átadja neki a szót, félbeszakítja a felhasználót, vagy egy elhangzott kérdés nélkül válaszol.

Valódi irodákban és telefonhívásokban teszteltek

A Krisp saját benchmarkot készített, mert állítása szerint nem talált olyan iparági mérési rendszert, amely változatos, valós környezetekben vizsgálná a párhuzamos beszéd hatását. A három hónapos adatgyűjtési projektben minden felvétel valódi emberrel, valódi helyiségben és valódi eszközön készült. Szintetikus keverést és utólag hozzáadott zajt nem használtak.

Az adatbázis három fő helyzetet fed le: munkahelyi környezeteket, négy működő call center emeletet, valamint telefonhívásokat autóban, utcán, üzletben és metróban. A felvételek 24 audioeszközzel és 18 fejhallgatómodellel készültek. A legtöbb munkairodai és call centeres felvételen a fő beszélő megszólal, egy második beszélő bekapcsolódik, a fő beszélő elhallgat, majd visszatér. A legnehezebb szakasz az, amikor csak a másodlagos beszélő hallható, mert a helyes átirat ilyenkor üres.

Mind a 265 fájl kézzel ellenőrzött átiratot és JSON-metaadatot kapott. A szegmenseket négy címkével látták el: primary, mix, secondary és noise. Így külön mérhető, mi történik akkor, amikor csak a fő beszélő, mindkét beszélő, csak a háttérbeszélő, illetve egyikük sem beszél.

A Voice Isolation 73 százalékkal csökkentette a hibaarányt

A Krisp 11 konfigurációt futtatott kilenc beszédfelismerő-motoron, streaming és kötegelt feldolgozásban. Minden felvételt egyszer eredeti hangon, majd a négy Voice Isolation modell mindegyikén keresztül dolgoztak fel.

A teljes korpuszon a szóhibaarány 73 százalékkal csökkent. A munkakörnyezetekben az érték 31,84 százalékról 6,30 százalékra, a call centerekben pedig 23,83 százalékról 6,86 százalékra esett. A 11 konfiguráció mindegyike javult, és egyik sem romlott az eredeti hanghoz képest.

A javulás azonban nem minden helyzetben azonos. Gyenge sávszélességű, háttérbeszéd nélküli telefonhangoknál a Voice Isolation ronthat is az eredményen. A VI 2.5 Balanced ilyen esetekben 3,53 százalékos szóhibaarányt ért el, de egy felvételnél az érték 9,42 százalékról 21,65 százalékra nőtt.

A Krisp a benchmark adatállományát, a modellkimeneteket és az értékelési eszköztárat is közzéteszi. A vállalat szerint ez lehetővé teszi, hogy a fejlesztők olyan körülmények között vizsgálják a beszédfelismerő rendszereket, amelyekben a háttérben zajló valódi beszélgetések jelentik a fő kihívást.

Kapcsolódó hírek

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp
Kutatás2026. szeptember 28.

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp

A Krisp 265 valódi beszélgetésből álló tesztadatbázist készített a háttérben megszólaló hangok vizsgálatára. A felvételek irodákban, call centerekben és mozgó autókban…

Mind a hat Krisp-kihívást továbbviszi az amerikai szabadalmi hivatal
Cégek és üzlet2026. szeptember 8.

Mind a hat Krisp-kihívást továbbviszi az amerikai szabadalmi hivatal

Az amerikai szabadalmi hivatal, az USPTO mind a hat, Krisp által benyújtott szabadalmi kifogás ügyében engedélyezte az eljárás folytatását. A beadványok a Sanas által a…

A Krisp a hívások mellé az ügyintézők képernyőjét is rögzíti
Termékek és eszközök2026. augusztus 20.

A Krisp a hívások mellé az ügyintézők képernyőjét is rögzíti

A Krisp új képernyőrögzítési funkcióval bővíti Speech Analytics szolgáltatását. A megoldás az aktív hívások alatt rögzíti az ügyintéző képernyőjét, majd a videót a…