A Speechmatics helyben futó beszédfelismerést kínál vállalatoknak

A Speechmatics korai hozzáférést nyitott On-Device beszédfelismerő technológiájához, amely a hangot teljes egészében a felhasználó számítógépén dolgozza fel. A vállalat szerint a helyi modell pontossága a felhős változatétól legfeljebb 5 százalékkal marad el, miközben a feldolgozás költsége nem nő a használattal.
- A Speechmatics On-Device a felhasználó gépén dolgozza fel a hangot.
- A vállalat szerint a helyi modell pontossága a felhős modellétől legfeljebb 5 százalékkal marad el.
- A valós idejű feldolgozás támogatott hardveren 200 milliszekundum alatt fut.
- A rendszer korai hozzáférése vállalati fejlesztők és OEM-ek számára kérhető.
- A helyi futtatás körülbelül 800 MB memóriát és nagyjából egy processzormagot igényel.
A hang nem hagyja el az eszközt
A Speechmatics szeptember 24-én közzétett anyaga szerint az On-Device egy, az alkalmazásba beágyazható natív könyvtárként fut a végfelhasználó gépén. A mikrofonból vagy fájlból érkező hangot ez a könyvtár dolgozza fel, a szöveges átirat pedig helyben készül el. A hang és az átirat így nem kerül Speechmatics-szerverre, illetve a fejlesztő saját szervereire sem.
A vállalat szerint a helyi feldolgozás különösen olyan területeken lehet fontos, ahol adatvédelmi, adatkezelési vagy hálózati korlátok merülnek fel. Ide sorolják a jogi, média-, egészségügyi és közszféra-alkalmazásokat, a terepi munkát, valamint a nagy mennyiségű jegyzetelést. A rendszer internetkapcsolat nélkül is működhet, ezért a Speechmatics bírósági, klinikai, repülési és távoli terepi környezeteket is említ lehetséges felhasználásként.
A helyi feldolgozás megváltoztatja a költségmodellt
A felhős beszédfelismerő API-k használatakor minden feldolgozott másodperc költséget jelent, így a kiadás a használattal együtt nő. A Speechmatics szerint az eszközön futó modell ezzel szemben a helyi gép hardverére és energiafogyasztására támaszkodik. A működési költség ezért nem skálázódik közvetlenül az átiratok mennyiségével.
Ez olyan alkalmazásoknál lehet fontos, amelyeknek nagy és változó felhasználói bázisa van. A vállalat példaként egy olyan megbeszélést említ, ahol száz résztvevő használ helyi mesterségesintelligencia-asszisztenst. Felhős feldolgozás esetén ilyenkor megugorhat a szükséges infrastruktúra terhelése, helyi feldolgozásnál viszont ez nem növeli a szolgáltató szerverterhelését. A bevezetéshez ugyanakkor kezdeti fejlesztési munka kell, beleértve a C/C++ könyvtár beépítését, életciklusának kezelését és a modellfrissítések saját kiadásokkal történő terjesztését.
A Speechmatics szerint a helyi megoldás elsősorban a jelentős vagy gyorsan növekvő átírási költségekkel szembesülő szervezeteknek lehet előnyös. Kisebb forgalomnál a felhős API egyszerűbb és költséghatékonyabb választás maradhat.
A felhő továbbra is indokolt lehet
A Speechmatics On-Device a vállalat állítása szerint a felhős modellek pontosságának 5 százalékán belül teljesít. A cég Adobe 10 millió szavas értékelésére is hivatkozik, amelyben a rendszer 12, illetve 16 százalékkal jobb eredményt ért el az összehasonlított Whisper-ellenőrzőpontoknál. A valós idejű adatfolyam-feldolgozás támogatott hardveren 200 milliszekundum alatt fut, mivel nincs szükség hálózati oda-vissza útra.
A helyi futtatás körülbelül egy processzormagot, opcionális mesterségesintelligencia-gyorsítót és nagyjából 800 MB memóriát igényel. A teljesítmény ezért függhet a végfelhasználói eszközök képességeitől. A felhő akkor lehet megfelelőbb, ha a legmagasabb pontosság, a gyors integráció vagy az eltérő hardvereken is egységes teljesítmény a legfontosabb.
A Speechmatics korai hozzáférési programja vállalati szoftvergyártókat és olyan OEM-eket céloz, amelyek macOS- vagy Windows-alkalmazásokat fejlesztenek, és rendelkeznek a natív C/C++ könyvtár integrálásához szükséges mérnöki erőforrással. A hozzáférés igényléshez kötött. A vállalat szerint a technológia az Adobe-val és a Stenograph-fal végzett korábbi munkára épül, és most szélesebb körű, valós idejű és kötegelt felhasználásra teszik elérhetővé.
Speechmatics: On-device speech-to-text, in 10 questions


