265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp

A Krisp 265 valódi beszélgetésből álló tesztadatbázist készített a háttérben megszólaló hangok vizsgálatára. A felvételek irodákban, call centerekben és mozgó autókban készültek, valódi eszközökkel, majd minden szakaszt kézzel átírtak és felcímkéztek.
- A Krisp 265 valódi beszélgetést rögzített három hónap alatt.
- A benchmark irodai, call centeres és telefonos forgatókönyveket tartalmaz.
- A felvételek 24 irodai eszközzel, 18 headsetmodellel és 18 telefonmodellel készültek.
- Minden felvételhez kézzel készített átirat és JSON-metaadat tartozik.
- A Krisp szerint a Voice Isolation háttérhang mellett nagyjából háromnegyedével csökkenti a szavak hibaarányát.
Három hónap, 265 felvétel
A Krisp mérnöki csapata szeptember 28-án ismertette, hogyan hozta létre a másodlagos hangok felismerésére szolgáló benchmarkot. A vállalat szerint azért volt szükség saját adathalmazra, mert a háttérben beszélő személyek vizsgálatára nem találtak megfelelő nyilvános tesztet.
A felvételek elkészítése három hónapig tartott, és három különböző helyzetet fed le. Az irodai forgatókönyvben 29 beszélő 96 felvételt készített 24 eszközzel, négyféle helyiségben és 17 szövegkönyv alapján. A call centeres rész négy valódi helyszínen készült, hét beszélővel, 106 felvétellel, 18 fejhallgatóval és 28 szövegkönyvvel. A telefonos kategóriában 26 beszélő 63 felvételt rögzített 18 telefonmodellel, négy helyzettípusban és 20 szövegkönyvvel.
Valódi irodák, ügyfélszolgálatok és autók
A Krisp célja az volt, hogy ne mesterségesen kevert hanganyaggal, hanem olyan felvételekkel dolgozzon, amelyek a mindennapi használat körülményeit mutatják. A csapat nyitott irodákban, kisebb és nagyobb helyiségekben, konferenciatermekben, négy működő call centerben, valamint autókban is rögzített.
A call centeres felvételeken több ügynök beszél párhuzamosan, miközben egyikük közelebb ül az elsődleges beszélő mikrofonjához. A telefonos felvételek többsége autóban készült Bluetooth-mikrofonnal, távolabb elhelyezett kihangosított telefonnal vagy vezetés közben használt fülhallgatóval. A csapat emellett zajos épületekben, üzletekben, utcákon és metróállomásokon is rögzített.
A munka során 24 irodai audioeszközt, 18 headsetmodellt, 18 telefonmodellt és az autókban használt Bluetooth-mikrofonokat is bevonták. A felvételek egy részét újra kellett venni, ha a másodlagos beszélő túl korán kezdett, túl hamar elhallgatott, túl halk volt, vagy elnyomta az elsődleges beszélőt. Olyan eset is előfordult, amikor a némított mikrofon vagy a hibás bemenet miatt a helyszínen megfelelőnek tűnő felvétel használhatatlanná vált.
Miért kevés a mesterséges zaj hozzáadása?
A szokásos értékelési módszerben tiszta beszédhez zajfelvételt és helyiséghatást adnak. A Krisp szerint ez képzéshez megfelelő lehet, az értékeléshez azonban nem feltétlenül elég, mert így kimaradhatnak azok a romlási tényezők, amelyeket előzetesen nem próbáltak meg szimulálni.
A háttérben beszélő hang különösen nehéz probléma a beszédfelismerő rendszerek számára. A forgalom, a légkondicionáló vagy a billentyűzet zaja sok esetben kezelhető, egy másik ember hangja azonban ugyanazokat az akusztikai jellemzőket hordozza, mint a felismerni kívánt beszéd. Emiatt a rendszer a másodlagos beszélő szavait is átírhatja.
Ez egy AI-asszisztenssel folytatott beszélgetésben is gondot okozhat. Ha a háttérben elhangzó mondatok bekerülnek a beszédfelismerés eredményébe, azokat a nyelvi modell is megkaphatja, és a Krisp szerint ez megváltoztathatja a rendszer viselkedését.
A felvételek kézi címkézése
A benchmark minden rögzített beszélgetéshez kézzel készített átiratot és JSON-formátumú metaadatfájlt tartalmaz. A metaadatok között szerepel az átirat szövege, a beszélő neme, a rögzítéshez használt eszköz és a környezet. A Krisp közlése szerint az átiratok a beszédet a tényleges elhangzás szerint rögzítik.
A vállalat rövid összefoglalója szerint a háttérhang jelenléte esetén a Krisp Voice Isolation nagyjából háromnegyedével csökkenti a szavak hibaarányát. A már eleve tiszta telefonos hanganyagokon ugyanakkor a technológia valamivel többe kerül, mint amennyit visszaad. A fejlesztők a benchmarkot azért készítették el, hogy a hangszigetelési és beszédfelismerési rendszereket valós körülmények között lehessen összehasonlítani.


