A Speechmatics szerint 20 másodperc alatt átír egyórányi hangot a Melia

A Speechmatics Melia beszédfelismerő modellje a cég szerint egyórányi hangfelvételt kevesebb mint 20 másodperc alatt ír át. Az Artificial Analysis független rangsorán 206-szoros sebességi faktort ért el, ezzel több versenytársat is megelőzött.
- A Melia 206-szoros sebességi faktort ért el az Artificial Analysis rangsorán.
- A Speechmatics szerint egyórányi hang kevesebb mint 20 másodperc alatt átírható.
- A modell több mint 55 nyelvet kezel egyetlen modellben.
- A bevezetéshez a cég szerint elég a konfigurációban a melia-1 és multi értéket beállítani.
- A szolgáltatás óránként 0,129 dollártól érhető el, 100 dollár értékű kezdő kredittel.
206-szoros sebességi faktor az Artificial Analysis mérésén
A Speechmatics augusztus 26-án számolt be a Melia eredményéről. A vállalat közlése szerint a modell 206-szoros sebességi faktort ért el az Artificial Analysis rangsorán. Ez azt jelenti, hogy egy másodpercnyi feldolgozás alatt 206 másodpercnyi hangot ír át.
A Speechmatics szerint a Melia ezzel megelőzte az AssemblyAI legfeljebb 105-szörös, az ElevenLabs legfeljebb 55-szörös, a Soniox legfeljebb 37-szeres, a Gladia legfeljebb 81-szeres, az Amazon legfeljebb 18-szoros és a Rev AI legfeljebb 13-szoros értékét. Az Artificial Analysis több beszédszöveg-átalakító modellt folyamatosan, egymástól függetlenül mér a feldolgozási sebesség alapján.
A cég példái szerint 30 percnyi hang kevesebb mint 10 másodperc alatt, 10 percnyi hang pedig kevesebb mint 5 másodperc alatt dolgozható fel. A Speechmatics azt állítja, hogy ez egyetlen feldolgozási menetben történik, nem feldarabolt hangrészletek összefűzésével.
Egy modell több mint 55 nyelvhez
A Melia egy modellben kezeli a Speechmatics által támogatott több mint 55 nyelvet. A vállalat szerint ezért többnyelvű felvételeknél nem szükséges előre kiválasztani a feldolgozás nyelvét. Ha a felhasználó ismeri a várható nyelveket, nyelvi tippekkel tovább irányíthatja a felismerést.
A Speechmatics szerint a gyors feldolgozás több olyan helyzetben lehet hasznos, ahol a felvétel elkészülte és az átirat felhasználása között kevés idő áll rendelkezésre. Ilyen lehet az ügyfélszolgálati hívások elemzése, a megfelelőség ellenőrzése, az egészségügyi konzultációk dokumentálása, az egyetemi előadások feliratozása, valamint a podcastok és videók szerkesztése.
A cég példája alapján egy ügyfélszolgálati platform még azelőtt lefuttathatja a hangulatelemzést, a beszélőváltások felismerését és a témák kinyerését, hogy az ügyintéző a következő hívást fogadná. Megfelelőségi ellenőrzésnél a rendszer egy angolról spanyolra vagy arabra váltó beszélgetést is egyetlen, címkézett átiratként kezelhet.
A használathoz konfigurációváltást ígér a Speechmatics
A Speechmatics szerint a Melia bevezetéséhez nincs szükség új integrációra. A meglévő átírási konfigurációban a model értékét melia-1-re, a language értékét pedig multi-ra kell állítani.
A feladatok alapértelmezés szerint aszinkron módon futnak. A felhasználó elküldi a feldolgozási kérést, majd lekérdezheti az állapotot, vagy webhookos értesítésre várhat. Aki egyetlen kérésben szeretné megkapni az eredményt, szinkron átírást is használhat. A Speechmatics futtatható példákat kínál a GitHub Academy felületén a Melia Multilingual és a Call Analytics projektekhez.
A szolgáltatás a közlemény szerint óránként 0,129 dollártól érhető el, a kezdéshez pedig 100 dollár értékű ingyenes kreditet adnak bankkártya nélkül. A Melia a Speechmatics állítása szerint úgy csökkenti jelentősen a várakozási időt, hogy közben a felhasználónak nem kell alacsonyabb minőségű modellre váltania, saját mikrokötegelést kialakítania vagy teljesen streamingalapú architektúrát kiépítenie.

