Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az NVIDIA Nemotron a szaúdi arab nyelvjárásokhoz is finomhangolható

2026. október 1. 07:00Forrás: NVIDIA Developer
Az NVIDIA Nemotron a szaúdi arab nyelvjárásokhoz is finomhangolható
Kép: NVIDIA Developer

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi arab Najdi és Hijazi nyelvjárásokhoz igazítható. A vállalat szerint a módszer jelentősen csökkentette a felismerési hibaarányt, miközben más nyelvek és arab nyelvjárások teljesítménye nem romlott.

A lényeg röviden
  • A Nemotron 3.5 ASR 40 nyelvi és területi változaton támogat folyamatos átírást.
  • A Najdi és Hijazi beszédre finomhangolt modell szóhibaaránya 55,05 százalékról 29,96 százalékra csökkent.
  • A tanítás után az angol teljesítménye is javult, más arab nyelvjárások romlása nélkül.
  • A 13 előretekintő keretből álló kontextus és a beam-8 MALSD dekódolás 2,71 százalékponttal javított az offline eredményen.
  • A Nemotron 3 Diarization legfeljebb nyolc beszélőhöz rendelheti az átírt szöveget.

A helyi nyelvjárások külön kihívást jelentenek

Az NVIDIA Developer szeptember 30-án ismertetett bejegyzése szerint a Nemotron 3.5 ASR 40 nyelvi és területi változaton támogat folyamatos, többnyelvű beszédfelismerést. A széles körű támogatás azonban önmagában nem garantálja, hogy egy modell jól kezeli a kevésbé reprezentált nyelvjárásokat vagy a helyi felvételi körülményeket.

A szaúdi arab erre konkrét példa. A modell felismerheti a modern standard arabot vagy az angolt, miközben a Najdi és Hijazi beszéd, illetve a helyi rögzítési környezet nehézséget okozhat. Az NVIDIA bemutatott módszere olyan helyzetekre készült, amikor elegendő címkézett beszéd áll rendelkezésre egy modell specializálásához, de teljesen új modell betanításához nincs elegendő adat.

133,7 óra beszéddel javították a felismerést

A kísérlethez a SADA 2022 adatkészlet Najdi és Hijazi beszédét használták, és a tanítást a NVIDIA NeMo keretrendszerével végezték. A feldolgozás során eltávolították a használhatatlan címkéket, az igazolhatóan hibás illesztéseket és a túl rövid vagy túl hosszú felvételeket, miközben igyekeztek megtartani a nehéz akcentusokat és a zajos, de még használható beszédet.

A szűrés után 125 490 megszólalásból 103 559 maradt, összesen 133,7 óra terjedelemben. A kiinduló adathalmaz 82,5 százalékát tartották meg. A tanításban korábban megtanult adatok kisebb részét is újra felhasználták, így próbálták mérsékelni a katasztrofális felejtést, vagyis azt, hogy a célzott finomhangolás rontsa a már meglévő képességeket.

Az NVIDIA összegzése szerint a célzott tesztadaton a szóhibaarány 55,05 százalékról 29,96 százalékra csökkent. Az angol teljesítménye közben 11,04 százalékról 10,42 százalékos szóhibaarányra javult, és a vállalat szerint a többi arab nyelvjárás teljesítménye sem romlott.

A pontosság és a számítási igény között kell választani

A munkafolyamat többféle beállítást kínál. A modell mind a 24 kódolórétegének frissítése érte el a legalacsonyabb hibaarányokat, ehhez azonban 230,4 millió tanítható paraméterre volt szükség. Ha az adatok vagy a memória korlátozott, egyes rétegek rögzítése csökkentheti a számítási igényt, cserébe a pontosság is változhat.

A tanítás hatékonyságát a hasonló hosszúságú hanganyagok csoportosítása is segítette, mert így kevesebb kitöltő adatot kellett feldolgozni. A bejegyzés szerint a finomhangolás alapjául szolgáló kísérlethez két NVIDIA RTX PRO 6000 Blackwell Workstation Edition GPU-t használtak, 12 000 tanítási lépés mellett.

Újratanítás nélkül is lehetett javítani az offline átírás pontosságán. A 13 előretekintő keretből álló nagyobb figyelmi kontextus és a beam-8 MALSD dekódolás együtt 2,71 százalékponttal csökkentette a szóhibaarányt, körülbelül 800 milliszekundumos késleltetés árán. Ez a beállítás az NVIDIA szerint kötegelt átírási feladatokhoz lehet megfelelő.

A módszer többnyelvű és több beszélős rendszerekhez is használható

Az NVIDIA a bemutatott receptet nem kizárólag a szaúdi arabhoz köti. A leírás szerint hasonló megközelítés alkalmazható más nyelvjárásokhoz, szakterületi átíráshoz és olyan telepítésekhez, amelyeknek meg kell őrizniük a modell korábbi nyelveit. A vállalat ugyanakkor hangsúlyozza, hogy a beállítások nem tekinthetők minden nyelvre vagy környezetre érvényes alapértékeknek.

A munkafolyamatot a Nemotron 3 Diarization is kiegészíti. Ez a rendszer legfeljebb nyolc beszélőhöz rendelhet átírt szöveget, és a beszélőváltások határait a beszédfelismerő rendszer időbélyegeihez igazítja. A felhasználók az NVIDIA által közzétett notebookkal reprodukálhatják a szaúdi arab adaptációt, a NeMo finomhangolási képességével pedig vezetett megvalósítást is kipróbálhatnak.

Kapcsolódó hírek

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható
Kutatás2026. október 1. 07:00

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi najdi és hidzsázi arab dialektusok felismerésére szabható. A vállalat…

Nyílt ranglista indult a többnyelvű TTS-modellek mérésére
Kutatás2026. szeptember 30.

Nyílt ranglista indult a többnyelvű TTS-modellek mérésére

Az Open TTS Leaderboard nyílt értékelési platformként a többnyelvű szövegfelolvasó és hangklónozó modellek összehasonlítását teszi skálázhatóbbá. A Hugging Face blogján…

NVIDIA Kumo Tabular: új bejegyzés jelent meg a táblázatos előrejelzésről
Modellek2026. szeptember 29. 17:30

NVIDIA Kumo Tabular: új bejegyzés jelent meg a táblázatos előrejelzésről

Az NVIDIA Kumo Tabular nevű rendszeréről jelent meg bejegyzés a Hugging Face-en. A cím szerint a megoldás a táblázatos előrejelzés pontossága és hatékonysága között…