Nyílt forrású arab beszédfelismerő modellt adott ki a Cohere

A Cohere nyílt forrásúvá tette a Cohere Transcribe Arabic beszédfelismerő modellt, amelyet arab dialektusokra, kétnyelvű beszédre és vállalati használatra optimalizáltak. A vállalat mérései szerint a modell pontosabb a vezető alternatíváknál, köztük az OpenAI Whispernél és a Meta OmniASR-nél.
- A Cohere kiadta a Cohere Transcribe Arabic nyílt forrású modellt.
- A modell átlagos WER-értéke 25,87 a Hugging Face arab ASR-rangsorán.
- A Cohere szerint a rendszer a Whisper Large V3-nál 11 ponttal jobb WER-t ért el.
- A modell arab dialektusokat, kódváltást és szakterületi szókincset is kezel.
- Apache 2.0 licenc alatt, Hugging Face-en, a Cohere API-ján és a Model Vaulton érhető el.
Arab dialektusokra és kódváltásra készült
A Cohere július 7-én jelentette be a Cohere Transcribe Arabic kiadását. A modell a vállalat korábban bemutatott, 2 milliárd paraméteres, határterületet képviselő automatikus beszédfelismerő modelljére épül.
A fejlesztés célja, hogy a rendszer az arab nyelv üzleti és fejlesztői környezetben jellemző sajátosságait is kezelje. Ide tartozik a dialektusok közötti változatosság, az arab és angol nyelv keverése, valamint a szakterületi szókincs. A Cohere szerint a modell az arab beszédben megőrzi a regionális megfogalmazásokat, miközben az angol kifejezéseket latin betűs formában írja le.
Az arabot több mint 300 millió ember beszéli anyanyelvként, nagyjából 30 elismert nyelvváltozatban. A mindennapi beszéd jelentősen eltérhet a modern standard arab nyelvtől, ezért az automatikus beszédfelismerés számára különösen nehéz feladat a kiejtési, morfológiai és regionális különbségek kezelése.
A vállalat szerint a Whispernél is pontosabb
A Cohere Transcribe Arabic átlagos szóhibaaránya, vagyis WER-értéke 25,87 lett a Hugging Face arab ASR-rangsorán. Ez 2,45 ponttal jobb a korábbi vezető Meta OmniASR-LLM-7B eredményénél, és 11 ponttal alacsonyabb az OpenAI Whisper Large V3 értékénél.
A közzétett összehasonlításban a Cohere modellje 25,87-es átlagos WER-t ért el, szemben az OmniASR 28,32-es, a Whisper Large V3 36,86-os és a Cohere Transcribe 30,67-es értékével. A modell a hat összetett tesztkészletből négyen első helyen végzett. A Casablanca adathalmazon, amely nyolc dialektusban vizsgál társalgási arab nyelvet, a Cohere szerint közel hat ponttal előzte meg az OmniASR-t.
A tesztelés az MSA, az egyiptomi, az öböl menti, a levantei és a maghrebi arab változatokra is kiterjedt. A Common Voice adathalmaz 25 dialektust fed le, ezen a készleten a modell több mint két ponttal csökkentette a szóhibaarányt a korábbi vezető eredményhez képest.
Emberi értékelésben is jól szerepelt
A Cohere anyanyelvi arab beszélőkkel is összevetette a rendszert. Az értékelők az általános pontosságot, a dialektus hű megőrzését és a kódváltás kezelését vizsgálták. A vállalat szerint a Cohere Transcribe Arabic mindhárom szempontban jobb eredményt ért el a Whispernél és a Cohere Transcribe-nál.
A páros összehasonlításokban az értékelők a Cohere Transcribe Arabic kimenetét a Whisperével szemben a tesztek 95,8 százalékában részesítették előnyben. A forrás kiemel egy vállalati párbeszédet is, amelyben az arab beszélő olyan angol kifejezéseket használ, mint az „annual leave” és a „HRIS”. A modell ezeket az elemeket az elhangzott formában rögzítette, miközben a Whisper több arab, standardizált megfogalmazásra váltott.
Angol, arab akcentussal elmondott beszéd esetén a Cohere Transcribe Arabic a Cohere Transcribe-nál a tesztek 77,2 százalékában bizonyult jobbnak. A Whisperrel összevetve 52,6 százalékos előnyt ért el.
Nyílt licenc és vállalati kiszolgálás
A modell Apache 2.0 licenc alatt érhető el. A fejlesztők letölthetik a súlyokat, és gyors kezdési példákat olvashatnak a Hugging Face-en. A hosztolt változat a Cohere API-ján és a Model Vault szolgáltatáson keresztül is hozzáférhető.
A Cohere a rendszert nagy terhelésű, éles vállalati környezetre optimalizálta. A vLLM-re épülő kiszolgálás különböző hosszúságú hanganyagok és párhuzamos kérések mellett is nagy áteresztőképességet céloz. A vállalat szerint a futtatási környezet és a modellverem módosításai akár kétszeres áteresztőképességet hoztak.
A modell RTFx értéke 525, míg a Whisper Large V3-é 146, az omniASR 7B-LLM-é pedig 66. Az RTFx azt méri, hogy a rendszer a valós időhöz képest milyen gyorsan dolgozza fel a hanganyagot. A nyílt hozzáférés és a több arab nyelvváltozatot kezelő kialakítás elsősorban azoknak a fejlesztőknek és vállalatoknak lehet fontos, amelyek arab nyelvű hangadatokat dolgoznának fel saját rendszereikben.
Cohere: Cohere Transcribe Arabic: Open-Source Speech AI | Cohere


