A Speechmatics Linden modellje elérhető a LiveKit Inference platformján

A Speechmatics Linden beszédfelismerő modellje elérhetővé vált a LiveKit Inference platformján, így a fejlesztők külön API-kulcs, fiók vagy számla nélkül válthatnak rá. A vállalat szerint a modell a hangalapú ügynökök éles környezetben jelentkező pontatlanságait célozza, többek között akcentusok, zajos hang és alfanumerikus adatok esetén.
- A Speechmatics Linden elérhető a LiveKit Inference platformján.
- A fejlesztők külön API-kulcs, fiók vagy számla nélkül válthatnak a modellre.
- A modell több mint 55 nyelven, akcentusokkal és zajos hanggal is használható.
- A LiveKit kezeli az útválasztást, a számlázást és a beszédfordulók felismerését.
- A boost.ai már éles hangalapú ügynökökben használja a Speechmatics és a LiveKit technológiáját.
Egy perc alatt válthatnak a fejlesztők
A Speechmatics augusztus 27-i bejelentése szerint a Linden, a vállalat első, kifejezetten hangalapú ügynökökhöz fejlesztett beszédből szöveget készítő modellje mostantól natívan elérhető a LiveKit Inference szolgáltatásán keresztül. A fejlesztők a LiveKit felületén vagy kódból, egy percen belül válthatnak a Speechmatics modelljére.
A használathoz nincs szükség külön Speechmatics API-kulcsra, felhasználói fiókra vagy külön számlázásra. A LiveKit Inference kezeli az útválasztást, a számlázást és a beszédfordulók felismerését, vagyis azt, hogy mikor fejezte be a felhasználó a mondandóját, és mikor szólaljon meg az ügynök.
A nehéz helyzetekre összpontosít a Linden
A Speechmatics szerint a bemutatók körülményei gyakran kedveznek a beszédfelismerésnek: egyetlen beszélő hallható, tiszta a hang, és rövid a párbeszéd. Éles használatban azonban előfordulhat erős akcentus, nem anyanyelvi beszélő, zajos kávézó vagy rossz minőségű telefonvonalon bediktált 16 számjegyű bankkártyaszám. Ha a rendszer ezeknél a fontos szavaknál hibázik, az ügynök további működése is sérülhet.
A Linden a Speechmatics közlése szerint több mint 55 nyelven, nem anyanyelvi beszélők, nyelvjárások és akcentusok esetében is dolgozik. A modell az olyan alfanumerikus adatok átírására is készült, mint a számla- és kártyaszámok. A LiveKit közlése alapján a Speechmatics integrációja beszélőszétválasztást is kínál, amely több beszélő esetén követi, hogy ki mit mondott. A LiveKit ezt különösen fizikai mesterséges intelligenciát és valós, több beszélős környezeteket használó alkalmazásoknál tartja hasznosnak.
Már éles környezetben is használják
A norvég boost.ai beszélgetési mesterséges intelligenciával foglalkozó vállalat már éles környezetben használja a Speechmatics és a LiveKit technológiáját az európai vállalatok számára készített hangalapú ügynökeiben. A Speechmatics szerint az ehhez használt infrastruktúra az xAI Grok és a Salesforce Agentforce működését is támogatja.
Rasmus Hauch, a boost.ai technológiai igazgatója szerint a Speechmatics alacsony késleltetésű, valós idejű modelleket, gyors fejlesztést biztosít az alfanumerikus adatok és a megszólalások végének felismerésénél, valamint széles európai nyelvi lefedettséget ad. A kijelentést a Speechmatics közölte.
A LiveKit Inference 2025 októberében indult. A platform egyetlen API-kulccsal teszi elérhetővé a beszédfelismerő, nyelvi és beszédszintetizáló modelleket, a modellek cseréje pedig egyetlen kódmódosítással megoldható. A számlázás, a sebességkorlátok kezelése és a használati jelentések a LiveKit Cloudon futnak.
A Speechmatics a LiveKit Agents nyílt forráskódú keretrendszeréhez készült bővítményen, a LiveKit Agent Builderen és közvetlenül a LiveKit Inference-en keresztül is használható. A fejlesztők így a Speechmatics beszédfelismerését a meglévő LiveKit-alapú hangügynökeikhez illeszthetik, miközben a modellváltás és az infrastruktúra kezelése a platformon belül marad.


