A Speechmatics új beszédfelismerője a hangalapú ügynököket célozza

A Speechmatics bemutatta az Agent STT beszédfelismerő API-t, amelyet kifejezetten élesben működő hangalapú ügynökökhöz fejlesztett. A szolgáltatás mögött a Linden 1 modell áll, amely a vállalat szerint 55-nél több nyelven dolgozik, és 350 ezredmásodperc alatti véglegesítést céloz.
- A Speechmatics Agent STT API-t hangalapú ügynökökhöz fejlesztették.
- A Linden 1 több mint 55 nyelven működik a vállalat szerint.
- A Pipecat benchmarkjában 369 ezredmásodperces medián késleltetést és 1,05 százalékos szemantikai WER-t mértek.
- Az API legfeljebb 1000 egyedi szó hozzáadását támogatja.
- Az Agent STT LiveKitben, Pipecatben, Python SDK-val és WebSocketen keresztül is használható.
A hagyományos pontossági mutató nem minden hibát mér egyformán
A Speechmatics szeptember 17-i bejelentése szerint az Agent STT abból a problémából indult ki, hogy a beszédfelismerő rendszerek szokásos mérőszáma, a szóhibaarány (WER), nem mutatja meg pontosan, mely hibák okoznak valódi gondot egy hangalapú ügynök működésében.
A WER minden beszúrást, törlést és helyettesítést azonos súllyal kezel. Egy jelentéktelen szó elvesztése ugyanúgy jelenik meg benne, mint egy számlaszám egyetlen karakterének félrehallása vagy egy tagadás eltűnése. A Speechmatics példája szerint egy rövid megerősítés, például a „Yep.” felismerésének hibája is megakaszthatja a beszélgetést, mivel az ügynök erre a válaszra vár.
A vállalat szerint a valós telefonhívásokban a kiejtés, a háttérzaj, az alacsony minőségű, 8 kHz-es telefonos kapcsolat és az egymásba beszélés is befolyásolja a rendszerek teljesítményét. Emiatt az Agent STT fejlesztésénél a szemantikai WER-t is figyelembe vették, amely azt vizsgálja, hogy megmaradt-e a közlés jelentése.
A Linden 1 a rövid és kritikus részletekre koncentrál
Az Agent STT alapmodellje a Linden, amelyet a Speechmatics olyan ügynökökhöz tervezett, amelyeknek rövid idő alatt kell megállapítaniuk, mit mondott a hívó, és ki beszélt. A modellhez legfeljebb 1000, egyedi szót lehet hozzáadni, például cégneveket, termékneveket vagy cikkszámokat.
A Speechmatics külön fejlesztésekkel kezelte a betűkből és számokból álló adatokat is. A vállalat szerint a telefonszámok, számlaszámok és címek felismerésénél a természetes nyelvre épülő modellek statisztikai mintái könnyen hibás „javításhoz” vezethetnek. A Linden 1-et ezeknek a helyzeteknek a kezelésére is optimalizálták.
A modell támogatja az élő beszélő-hozzárendelést, valamint a Speaker ID funkciót. A diarizálás valós időben minden szót egy beszélőhöz rendel, a Speaker ID pedig lehetővé teszi, hogy az ügynök meghatározott hangokat is felismerjen.
A külső benchmarkban 1,05 százalékos szemantikai hibaarányt mértek
A Speechmatics saját mérése szerint a beszéd végének felismerésétől a végleges átiratig kevesebb mint 300 ezredmásodperc telik el. A Pipecat 1000 mintás, szemantikai pontosságot és sebességet vizsgáló benchmarkjában a Linden 369 ezredmásodperces medián késleltetést és 1,05 százalékos, összevont szemantikai WER-t ért el.
A vállalat közlése szerint a 23 streaming modellt tartalmazó listán egyik modell sem volt egyszerre gyorsabb és pontosabb a Lindennél. A Speechmatics ugyanakkor kiemeli, hogy a Deepgram Nova 3 körülbelül 120 ezredmásodperccel hamarabb ad végleges átiratot, viszont nagyjából kétszeres hibaaránnyal. A választás így az adott fejlesztői felhasználási esettől függhet.
Az Agent STT a Speechmatics regionális szerverei közül automatikusan a legközelebbihez irányítja a kapcsolatot. A vállalat szerint ez további 50 és 80 ezredmásodperc közötti időt takaríthat meg. Az adatok régióhoz is köthetők, az elérhető régiók az Egyesült Államok, Európa és Ausztrália.
Integráció LiveKitben és Pipecatben
Az Agent STT használható a Speechmatics Python SDK-jával, a nyers WebSocket API-n vagy a LiveKit és a Pipecat integrációin keresztül. A vállalat szerint a két platformhoz készült bővítményeket a bejelentés napján frissítették, a LiveKit Inference felhasználói pedig augusztus óta választhatják a Lindent.
Az API a /v2/agent WebSocket-végponton érhető el, a modell neve linden-1. A kapcsolat ugyanazon a csatornán küldi vissza az átiratrészleteket és a beszélgetési eseményeket. A Speechmatics szerint a cél az, hogy a fejlesztőknek ne kelljen külön felépíteniük a fordulóváltás és a szegmensek kezelését.
Speechmatics: Introducing Agent STT: built for the words that cost you the call


