Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható

2026. október 1.Forrás: NVIDIA Developer
A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható
Kép: NVIDIA Developer

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi najdi és hidzsázi arab dialektusok felismerésére szabható. A vállalat kísérletében a célzott tesztkészlet szóhibaaránya 55,05 százalékról 29,96 százalékra csökkent.

A lényeg röviden
  • A Nemotron 3.5 ASR 40 nyelvi és régiós változatban támogatja a folyamatos átírást.
  • A szaúdi najdi és hidzsázi adatokból 133,7 órát használtak fel a finomhangoláshoz.
  • A célzott tesztkészlet WER értéke 55,05 százalékról 29,96 százalékra csökkent.
  • A 13 előretekintő keretre növelt figyelmi környezet és a beam-8 dekódolás 2,71 százalékponttal javított.
  • A Nemotron 3 Diarization legfeljebb nyolc beszélőhöz rendelheti az átiratot.

A helyi dialektusok külön finomhangolást igényelhetnek

Az NVIDIA Developer szeptember 30-án közzétett bejegyzése szerint a beszédfelismerő rendszereknek a ténylegesen használt nyelvváltozatokat és a helyi felvételi körülményeket is kezelniük kell. A nagyobb nyelvekre és általános stílusokra épülő előtanítás önmagában nem garantál jó eredményt minden régiós dialektusban.

A Nemotron 3.5 ASR 40 nyelvi és régiós változatban támogatja a folyamatos, többnyelvű átírást, köztük az arab nyelvet. Az NVIDIA szerint azonban a konkrét telepítési környezetekben használt dialektusok, például a szaúdi najdi és hidzsázi beszéd, célzott finomhangolással javíthatók. A bemutatott módszer az NVIDIA NeMo keretrendszerére épül.

133,7 órányi beszédanyaggal javult a felismerés

A kísérlethez a SADA 2022 adatbázis najdi és hidzsázi beszédfelvételeit használták. A kezdeti 125 490 megnyilatkozásból 103 559 maradt meg a válogatás után, ami 133,7 órányi adatnak, a kiinduló készlet 82,5 százalékának felelt meg.

A szűrés célja a használhatatlan címkék és a nyilvánvalóan rosszul illesztett felvételek eltávolítása volt. Kihagyták például a túl rövid vagy túl hosszú klipeket, a hibás átiratokat, valamint azokat a jelöléseket, amelyek a nem hallható beszédet írták le. Az NVIDIA külön kiemelte, hogy a nehéz kiejtésű vagy zajos, de még használható felvételeket nem akarták automatikusan eltávolítani.

A finomhangolást a FLEURS adataival végzett súlyozott visszakeveréssel egészítették ki. Ez a korábban megtanult adatok egy részét is a tanításban tartotta, hogy mérsékelje a korábbi nyelvi képességek elvesztésének, vagyis a katasztrofális felejtésnek a kockázatát. A hanganyagok feldolgozásánál időtartam szerinti csoportosítást alkalmaztak, így csökkenthető volt a kitöltésből adódó többlet.

A célzott tesztkészleten a szóhibaarány 55,05 százalékról 29,96 százalékra esett. Az angol teljesítmény közben 11,04 százalékról 10,42 százalékos WER-re javult, és az NVIDIA beszámolója szerint a többi arab dialektus teljesítménye sem romlott.

A pontosság és a számítási igény között kell választani

A bemutatott recept nem egyetlen kötelező beállítást ír elő. A modell összesen 24 kódolórétegének frissítése adta a legalacsonyabb hibaarányokat, ehhez azonban 230,4 millió tanítható paraméterre volt szükség. Ha a rétegek egy részét rögzítik, csökken a számítási és memóriaigény, viszont a pontosság is változhat.

Az NVIDIA egy újratanítás nélküli dekódolási lehetőséget is vizsgált. A 13 előretekintő keretre növelt figyelmi környezet, valamint a beam-8 MALSD dekódolás 2,71 százalékponttal csökkentette a WER-t. Ennek ára körülbelül 800 milliszekundumnyi többletkésleltetés volt, ezért a megoldást a vállalat elsősorban kötegelt átírási feladatokhoz tartja megfelelőnek.

A kiinduló, 12 000 lépéses kísérlethez két NVIDIA RTX PRO 6000 Blackwell Workstation Edition GPU-t használtak. Az NVIDIA hangsúlyozza, hogy a bemutatott beállítások az adott kísérlet optimalizálási és memóriaigényeire adott válaszok, nem általános alapértékek.

A módszer beszélőkhöz is hozzárendelheti az átiratot

A munkafolyamatot az NVIDIA Nemotron 3 Diarization egészíti ki. Ez a rendszer legfeljebb nyolc beszélő esetén képes a beszélőkhöz rendelt átiratra, és a beszélőváltások határait az automatikus beszédfelismerés időbélyegeihez igazítja.

A bemutatott megközelítés azoknak lehet hasznos, akiknek egy már több nyelvet támogató modell helyi dialektusokra vagy saját szakterületükre szabott változatára van szükségük. A forrás szerint a finomhangolási folyamat reprodukálható az NVIDIA ASR-finomhangolási jegyzetfüzetével, a megvalósítást pedig külön Nemotron ASR-finomhangolási útmutató segíti.

Kapcsolódó hírek

Az NVIDIA Nemotron a szaúdi arab nyelvjárásokhoz is finomhangolható
Kutatás2026. október 1.

Az NVIDIA Nemotron a szaúdi arab nyelvjárásokhoz is finomhangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi arab Najdi és Hijazi nyelvjárásokhoz igazítható. A vállalat szerint a…

Nyílt ranglista indult a többnyelvű TTS-modellek mérésére
Kutatás2026. szeptember 30.

Nyílt ranglista indult a többnyelvű TTS-modellek mérésére

Az Open TTS Leaderboard nyílt értékelési platformként a többnyelvű szövegfelolvasó és hangklónozó modellek összehasonlítását teszi skálázhatóbbá. A Hugging Face blogján…

NVIDIA Kumo Tabular: új bejegyzés jelent meg a táblázatos előrejelzésről
Modellek2026. szeptember 29.

NVIDIA Kumo Tabular: új bejegyzés jelent meg a táblázatos előrejelzésről

Az NVIDIA Kumo Tabular nevű rendszeréről jelent meg bejegyzés a Hugging Face-en. A cím szerint a megoldás a táblázatos előrejelzés pontossága és hatékonysága között…