Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Nyílt forrású arab beszédfelismerő modellt adott ki a Cohere

2026. július 7.Forrás: Cohere
Nyílt forrású arab beszédfelismerő modellt adott ki a Cohere
Kép: Cohere

A Cohere nyílt forrásúvá tette a Cohere Transcribe Arabic beszédfelismerő modellt, amelyet arab dialektusokra, kétnyelvű beszédre és vállalati használatra optimalizáltak. A vállalat mérései szerint a modell pontosabb a vezető alternatíváknál, köztük az OpenAI Whispernél és a Meta OmniASR-nél.

A lényeg röviden
  • A Cohere kiadta a Cohere Transcribe Arabic nyílt forrású modellt.
  • A modell átlagos WER-értéke 25,87 a Hugging Face arab ASR-rangsorán.
  • A Cohere szerint a rendszer a Whisper Large V3-nál 11 ponttal jobb WER-t ért el.
  • A modell arab dialektusokat, kódváltást és szakterületi szókincset is kezel.
  • Apache 2.0 licenc alatt, Hugging Face-en, a Cohere API-ján és a Model Vaulton érhető el.

Arab dialektusokra és kódváltásra készült

A Cohere július 7-én jelentette be a Cohere Transcribe Arabic kiadását. A modell a vállalat korábban bemutatott, 2 milliárd paraméteres, határterületet képviselő automatikus beszédfelismerő modelljére épül.

A fejlesztés célja, hogy a rendszer az arab nyelv üzleti és fejlesztői környezetben jellemző sajátosságait is kezelje. Ide tartozik a dialektusok közötti változatosság, az arab és angol nyelv keverése, valamint a szakterületi szókincs. A Cohere szerint a modell az arab beszédben megőrzi a regionális megfogalmazásokat, miközben az angol kifejezéseket latin betűs formában írja le.

Az arabot több mint 300 millió ember beszéli anyanyelvként, nagyjából 30 elismert nyelvváltozatban. A mindennapi beszéd jelentősen eltérhet a modern standard arab nyelvtől, ezért az automatikus beszédfelismerés számára különösen nehéz feladat a kiejtési, morfológiai és regionális különbségek kezelése.

A vállalat szerint a Whispernél is pontosabb

A Cohere Transcribe Arabic átlagos szóhibaaránya, vagyis WER-értéke 25,87 lett a Hugging Face arab ASR-rangsorán. Ez 2,45 ponttal jobb a korábbi vezető Meta OmniASR-LLM-7B eredményénél, és 11 ponttal alacsonyabb az OpenAI Whisper Large V3 értékénél.

A közzétett összehasonlításban a Cohere modellje 25,87-es átlagos WER-t ért el, szemben az OmniASR 28,32-es, a Whisper Large V3 36,86-os és a Cohere Transcribe 30,67-es értékével. A modell a hat összetett tesztkészletből négyen első helyen végzett. A Casablanca adathalmazon, amely nyolc dialektusban vizsgál társalgási arab nyelvet, a Cohere szerint közel hat ponttal előzte meg az OmniASR-t.

A tesztelés az MSA, az egyiptomi, az öböl menti, a levantei és a maghrebi arab változatokra is kiterjedt. A Common Voice adathalmaz 25 dialektust fed le, ezen a készleten a modell több mint két ponttal csökkentette a szóhibaarányt a korábbi vezető eredményhez képest.

Emberi értékelésben is jól szerepelt

A Cohere anyanyelvi arab beszélőkkel is összevetette a rendszert. Az értékelők az általános pontosságot, a dialektus hű megőrzését és a kódváltás kezelését vizsgálták. A vállalat szerint a Cohere Transcribe Arabic mindhárom szempontban jobb eredményt ért el a Whispernél és a Cohere Transcribe-nál.

A páros összehasonlításokban az értékelők a Cohere Transcribe Arabic kimenetét a Whisperével szemben a tesztek 95,8 százalékában részesítették előnyben. A forrás kiemel egy vállalati párbeszédet is, amelyben az arab beszélő olyan angol kifejezéseket használ, mint az „annual leave” és a „HRIS”. A modell ezeket az elemeket az elhangzott formában rögzítette, miközben a Whisper több arab, standardizált megfogalmazásra váltott.

Angol, arab akcentussal elmondott beszéd esetén a Cohere Transcribe Arabic a Cohere Transcribe-nál a tesztek 77,2 százalékában bizonyult jobbnak. A Whisperrel összevetve 52,6 százalékos előnyt ért el.

Nyílt licenc és vállalati kiszolgálás

A modell Apache 2.0 licenc alatt érhető el. A fejlesztők letölthetik a súlyokat, és gyors kezdési példákat olvashatnak a Hugging Face-en. A hosztolt változat a Cohere API-ján és a Model Vault szolgáltatáson keresztül is hozzáférhető.

A Cohere a rendszert nagy terhelésű, éles vállalati környezetre optimalizálta. A vLLM-re épülő kiszolgálás különböző hosszúságú hanganyagok és párhuzamos kérések mellett is nagy áteresztőképességet céloz. A vállalat szerint a futtatási környezet és a modellverem módosításai akár kétszeres áteresztőképességet hoztak.

A modell RTFx értéke 525, míg a Whisper Large V3-é 146, az omniASR 7B-LLM-é pedig 66. Az RTFx azt méri, hogy a rendszer a valós időhöz képest milyen gyorsan dolgozza fel a hanganyagot. A nyílt hozzáférés és a több arab nyelvváltozatot kezelő kialakítás elsősorban azoknak a fejlesztőknek és vállalatoknak lehet fontos, amelyek arab nyelvű hangadatokat dolgoznának fel saját rendszereikben.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az Aleph Alpha bemutatta a Kolibri nevű, nyílt súlyú AI-modellt
Modellek2026. október 3.

Az Aleph Alpha bemutatta a Kolibri nevű, nyílt súlyú AI-modellt

Az Aleph Alpha bemutatta a Kolibrit, egy német és angol nyelvre fejlesztett, nyílt súlyú Mixture-of-Experts modellt. A 78 milliárd teljes és 3 milliárd aktív…

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható
Kutatás2026. október 1. 07:00

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi najdi és hidzsázi arab dialektusok felismerésére szabható. A vállalat…

Az NVIDIA Nemotron a szaúdi arab nyelvjárásokhoz is finomhangolható
Kutatás2026. október 1. 07:00

Az NVIDIA Nemotron a szaúdi arab nyelvjárásokhoz is finomhangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi arab Najdi és Hijazi nyelvjárásokhoz igazítható. A vállalat szerint a…