Az NVIDIA Nemotron a szaúdi arab nyelvjárásokhoz is finomhangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi arab Najdi és Hijazi nyelvjárásokhoz igazítható. A vállalat szerint a módszer jelentősen csökkentette a felismerési hibaarányt, miközben más nyelvek és arab nyelvjárások teljesítménye nem romlott.
- A Nemotron 3.5 ASR 40 nyelvi és területi változaton támogat folyamatos átírást.
- A Najdi és Hijazi beszédre finomhangolt modell szóhibaaránya 55,05 százalékról 29,96 százalékra csökkent.
- A tanítás után az angol teljesítménye is javult, más arab nyelvjárások romlása nélkül.
- A 13 előretekintő keretből álló kontextus és a beam-8 MALSD dekódolás 2,71 százalékponttal javított az offline eredményen.
- A Nemotron 3 Diarization legfeljebb nyolc beszélőhöz rendelheti az átírt szöveget.
A helyi nyelvjárások külön kihívást jelentenek
Az NVIDIA Developer szeptember 30-án ismertetett bejegyzése szerint a Nemotron 3.5 ASR 40 nyelvi és területi változaton támogat folyamatos, többnyelvű beszédfelismerést. A széles körű támogatás azonban önmagában nem garantálja, hogy egy modell jól kezeli a kevésbé reprezentált nyelvjárásokat vagy a helyi felvételi körülményeket.
A szaúdi arab erre konkrét példa. A modell felismerheti a modern standard arabot vagy az angolt, miközben a Najdi és Hijazi beszéd, illetve a helyi rögzítési környezet nehézséget okozhat. Az NVIDIA bemutatott módszere olyan helyzetekre készült, amikor elegendő címkézett beszéd áll rendelkezésre egy modell specializálásához, de teljesen új modell betanításához nincs elegendő adat.
133,7 óra beszéddel javították a felismerést
A kísérlethez a SADA 2022 adatkészlet Najdi és Hijazi beszédét használták, és a tanítást a NVIDIA NeMo keretrendszerével végezték. A feldolgozás során eltávolították a használhatatlan címkéket, az igazolhatóan hibás illesztéseket és a túl rövid vagy túl hosszú felvételeket, miközben igyekeztek megtartani a nehéz akcentusokat és a zajos, de még használható beszédet.
A szűrés után 125 490 megszólalásból 103 559 maradt, összesen 133,7 óra terjedelemben. A kiinduló adathalmaz 82,5 százalékát tartották meg. A tanításban korábban megtanult adatok kisebb részét is újra felhasználták, így próbálták mérsékelni a katasztrofális felejtést, vagyis azt, hogy a célzott finomhangolás rontsa a már meglévő képességeket.
Az NVIDIA összegzése szerint a célzott tesztadaton a szóhibaarány 55,05 százalékról 29,96 százalékra csökkent. Az angol teljesítménye közben 11,04 százalékról 10,42 százalékos szóhibaarányra javult, és a vállalat szerint a többi arab nyelvjárás teljesítménye sem romlott.
A pontosság és a számítási igény között kell választani
A munkafolyamat többféle beállítást kínál. A modell mind a 24 kódolórétegének frissítése érte el a legalacsonyabb hibaarányokat, ehhez azonban 230,4 millió tanítható paraméterre volt szükség. Ha az adatok vagy a memória korlátozott, egyes rétegek rögzítése csökkentheti a számítási igényt, cserébe a pontosság is változhat.
A tanítás hatékonyságát a hasonló hosszúságú hanganyagok csoportosítása is segítette, mert így kevesebb kitöltő adatot kellett feldolgozni. A bejegyzés szerint a finomhangolás alapjául szolgáló kísérlethez két NVIDIA RTX PRO 6000 Blackwell Workstation Edition GPU-t használtak, 12 000 tanítási lépés mellett.
Újratanítás nélkül is lehetett javítani az offline átírás pontosságán. A 13 előretekintő keretből álló nagyobb figyelmi kontextus és a beam-8 MALSD dekódolás együtt 2,71 százalékponttal csökkentette a szóhibaarányt, körülbelül 800 milliszekundumos késleltetés árán. Ez a beállítás az NVIDIA szerint kötegelt átírási feladatokhoz lehet megfelelő.
A módszer többnyelvű és több beszélős rendszerekhez is használható
Az NVIDIA a bemutatott receptet nem kizárólag a szaúdi arabhoz köti. A leírás szerint hasonló megközelítés alkalmazható más nyelvjárásokhoz, szakterületi átíráshoz és olyan telepítésekhez, amelyeknek meg kell őrizniük a modell korábbi nyelveit. A vállalat ugyanakkor hangsúlyozza, hogy a beállítások nem tekinthetők minden nyelvre vagy környezetre érvényes alapértékeknek.
A munkafolyamatot a Nemotron 3 Diarization is kiegészíti. Ez a rendszer legfeljebb nyolc beszélőhöz rendelhet átírt szöveget, és a beszélőváltások határait a beszédfelismerő rendszer időbélyegeihez igazítja. A felhasználók az NVIDIA által közzétett notebookkal reprodukálhatják a szaúdi arab adaptációt, a NeMo finomhangolási képességével pedig vezetett megvalósítást is kipróbálhatnak.
NVIDIA Developer: Fine-Tuning NVIDIA Nemotron for Saudi Arabic Dialects, with a Path to Other Languages


