Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp

2026. szeptember 28.Forrás: Krisp
265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp
Kép: Krisp

A Krisp 265 valódi beszélgetésből álló tesztadatbázist készített a háttérben megszólaló hangok vizsgálatára. A felvételek irodákban, call centerekben és mozgó autókban készültek, valódi eszközökkel, majd minden szakaszt kézzel átírtak és felcímkéztek.

A lényeg röviden
  • A Krisp 265 valódi beszélgetést rögzített három hónap alatt.
  • A benchmark irodai, call centeres és telefonos forgatókönyveket tartalmaz.
  • A felvételek 24 irodai eszközzel, 18 headsetmodellel és 18 telefonmodellel készültek.
  • Minden felvételhez kézzel készített átirat és JSON-metaadat tartozik.
  • A Krisp szerint a Voice Isolation háttérhang mellett nagyjából háromnegyedével csökkenti a szavak hibaarányát.

Három hónap, 265 felvétel

A Krisp mérnöki csapata szeptember 28-án ismertette, hogyan hozta létre a másodlagos hangok felismerésére szolgáló benchmarkot. A vállalat szerint azért volt szükség saját adathalmazra, mert a háttérben beszélő személyek vizsgálatára nem találtak megfelelő nyilvános tesztet.

A felvételek elkészítése három hónapig tartott, és három különböző helyzetet fed le. Az irodai forgatókönyvben 29 beszélő 96 felvételt készített 24 eszközzel, négyféle helyiségben és 17 szövegkönyv alapján. A call centeres rész négy valódi helyszínen készült, hét beszélővel, 106 felvétellel, 18 fejhallgatóval és 28 szövegkönyvvel. A telefonos kategóriában 26 beszélő 63 felvételt rögzített 18 telefonmodellel, négy helyzettípusban és 20 szövegkönyvvel.

Valódi irodák, ügyfélszolgálatok és autók

A Krisp célja az volt, hogy ne mesterségesen kevert hanganyaggal, hanem olyan felvételekkel dolgozzon, amelyek a mindennapi használat körülményeit mutatják. A csapat nyitott irodákban, kisebb és nagyobb helyiségekben, konferenciatermekben, négy működő call centerben, valamint autókban is rögzített.

A call centeres felvételeken több ügynök beszél párhuzamosan, miközben egyikük közelebb ül az elsődleges beszélő mikrofonjához. A telefonos felvételek többsége autóban készült Bluetooth-mikrofonnal, távolabb elhelyezett kihangosított telefonnal vagy vezetés közben használt fülhallgatóval. A csapat emellett zajos épületekben, üzletekben, utcákon és metróállomásokon is rögzített.

A munka során 24 irodai audioeszközt, 18 headsetmodellt, 18 telefonmodellt és az autókban használt Bluetooth-mikrofonokat is bevonták. A felvételek egy részét újra kellett venni, ha a másodlagos beszélő túl korán kezdett, túl hamar elhallgatott, túl halk volt, vagy elnyomta az elsődleges beszélőt. Olyan eset is előfordult, amikor a némított mikrofon vagy a hibás bemenet miatt a helyszínen megfelelőnek tűnő felvétel használhatatlanná vált.

Miért kevés a mesterséges zaj hozzáadása?

A szokásos értékelési módszerben tiszta beszédhez zajfelvételt és helyiséghatást adnak. A Krisp szerint ez képzéshez megfelelő lehet, az értékeléshez azonban nem feltétlenül elég, mert így kimaradhatnak azok a romlási tényezők, amelyeket előzetesen nem próbáltak meg szimulálni.

A háttérben beszélő hang különösen nehéz probléma a beszédfelismerő rendszerek számára. A forgalom, a légkondicionáló vagy a billentyűzet zaja sok esetben kezelhető, egy másik ember hangja azonban ugyanazokat az akusztikai jellemzőket hordozza, mint a felismerni kívánt beszéd. Emiatt a rendszer a másodlagos beszélő szavait is átírhatja.

Ez egy AI-asszisztenssel folytatott beszélgetésben is gondot okozhat. Ha a háttérben elhangzó mondatok bekerülnek a beszédfelismerés eredményébe, azokat a nyelvi modell is megkaphatja, és a Krisp szerint ez megváltoztathatja a rendszer viselkedését.

A felvételek kézi címkézése

A benchmark minden rögzített beszélgetéshez kézzel készített átiratot és JSON-formátumú metaadatfájlt tartalmaz. A metaadatok között szerepel az átirat szövege, a beszélő neme, a rögzítéshez használt eszköz és a környezet. A Krisp közlése szerint az átiratok a beszédet a tényleges elhangzás szerint rögzítik.

A vállalat rövid összefoglalója szerint a háttérhang jelenléte esetén a Krisp Voice Isolation nagyjából háromnegyedével csökkenti a szavak hibaarányát. A már eleve tiszta telefonos hanganyagokon ugyanakkor a technológia valamivel többe kerül, mint amennyit visszaad. A fejlesztők a benchmarkot azért készítették el, hogy a hangszigetelési és beszédfelismerési rendszereket valós körülmények között lehessen összehasonlítani.

Kapcsolódó hírek

Az AssemblyAI szerint félrevezető lehet a beszédfelismerés WER-mérőszáma
Kutatás2026. szeptember 30.

Az AssemblyAI szerint félrevezető lehet a beszédfelismerés WER-mérőszáma

A hagyományos szóhibaarány, vagyis a WER egyes esetekben rosszabbnak mutathatja az újabb beszédfelismerő modelleket, állítja az AssemblyAI. A vállalat szerint a probléma…

A beszédfelismerők még elbuknak, ha más is beszél a háttérben
Kutatás2026. szeptember 23.

A beszédfelismerők még elbuknak, ha más is beszél a háttérben

A modern beszédfelismerők jól kezelik a forgalom, a légkondicionáló és a billentyűzet zaját, de egy másik beszélő hangja továbbra is komoly hibákat okoz. A Krisp 265…

Mind a hat Krisp-kihívást továbbviszi az amerikai szabadalmi hivatal
Cégek és üzlet2026. szeptember 8.

Mind a hat Krisp-kihívást továbbviszi az amerikai szabadalmi hivatal

Az amerikai szabadalmi hivatal, az USPTO mind a hat, Krisp által benyújtott szabadalmi kifogás ügyében engedélyezte az eljárás folytatását. A beadványok a Sanas által a…