A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi najdi és hidzsázi arab dialektusok felismerésére szabható. A vállalat kísérletében a célzott tesztkészlet szóhibaaránya 55,05 százalékról 29,96 százalékra csökkent.
- A Nemotron 3.5 ASR 40 nyelvi és régiós változatban támogatja a folyamatos átírást.
- A szaúdi najdi és hidzsázi adatokból 133,7 órát használtak fel a finomhangoláshoz.
- A célzott tesztkészlet WER értéke 55,05 százalékról 29,96 százalékra csökkent.
- A 13 előretekintő keretre növelt figyelmi környezet és a beam-8 dekódolás 2,71 százalékponttal javított.
- A Nemotron 3 Diarization legfeljebb nyolc beszélőhöz rendelheti az átiratot.
A helyi dialektusok külön finomhangolást igényelhetnek
Az NVIDIA Developer szeptember 30-án közzétett bejegyzése szerint a beszédfelismerő rendszereknek a ténylegesen használt nyelvváltozatokat és a helyi felvételi körülményeket is kezelniük kell. A nagyobb nyelvekre és általános stílusokra épülő előtanítás önmagában nem garantál jó eredményt minden régiós dialektusban.
A Nemotron 3.5 ASR 40 nyelvi és régiós változatban támogatja a folyamatos, többnyelvű átírást, köztük az arab nyelvet. Az NVIDIA szerint azonban a konkrét telepítési környezetekben használt dialektusok, például a szaúdi najdi és hidzsázi beszéd, célzott finomhangolással javíthatók. A bemutatott módszer az NVIDIA NeMo keretrendszerére épül.
133,7 órányi beszédanyaggal javult a felismerés
A kísérlethez a SADA 2022 adatbázis najdi és hidzsázi beszédfelvételeit használták. A kezdeti 125 490 megnyilatkozásból 103 559 maradt meg a válogatás után, ami 133,7 órányi adatnak, a kiinduló készlet 82,5 százalékának felelt meg.
A szűrés célja a használhatatlan címkék és a nyilvánvalóan rosszul illesztett felvételek eltávolítása volt. Kihagyták például a túl rövid vagy túl hosszú klipeket, a hibás átiratokat, valamint azokat a jelöléseket, amelyek a nem hallható beszédet írták le. Az NVIDIA külön kiemelte, hogy a nehéz kiejtésű vagy zajos, de még használható felvételeket nem akarták automatikusan eltávolítani.
A finomhangolást a FLEURS adataival végzett súlyozott visszakeveréssel egészítették ki. Ez a korábban megtanult adatok egy részét is a tanításban tartotta, hogy mérsékelje a korábbi nyelvi képességek elvesztésének, vagyis a katasztrofális felejtésnek a kockázatát. A hanganyagok feldolgozásánál időtartam szerinti csoportosítást alkalmaztak, így csökkenthető volt a kitöltésből adódó többlet.
A célzott tesztkészleten a szóhibaarány 55,05 százalékról 29,96 százalékra esett. Az angol teljesítmény közben 11,04 százalékról 10,42 százalékos WER-re javult, és az NVIDIA beszámolója szerint a többi arab dialektus teljesítménye sem romlott.
A pontosság és a számítási igény között kell választani
A bemutatott recept nem egyetlen kötelező beállítást ír elő. A modell összesen 24 kódolórétegének frissítése adta a legalacsonyabb hibaarányokat, ehhez azonban 230,4 millió tanítható paraméterre volt szükség. Ha a rétegek egy részét rögzítik, csökken a számítási és memóriaigény, viszont a pontosság is változhat.
Az NVIDIA egy újratanítás nélküli dekódolási lehetőséget is vizsgált. A 13 előretekintő keretre növelt figyelmi környezet, valamint a beam-8 MALSD dekódolás 2,71 százalékponttal csökkentette a WER-t. Ennek ára körülbelül 800 milliszekundumnyi többletkésleltetés volt, ezért a megoldást a vállalat elsősorban kötegelt átírási feladatokhoz tartja megfelelőnek.
A kiinduló, 12 000 lépéses kísérlethez két NVIDIA RTX PRO 6000 Blackwell Workstation Edition GPU-t használtak. Az NVIDIA hangsúlyozza, hogy a bemutatott beállítások az adott kísérlet optimalizálási és memóriaigényeire adott válaszok, nem általános alapértékek.
A módszer beszélőkhöz is hozzárendelheti az átiratot
A munkafolyamatot az NVIDIA Nemotron 3 Diarization egészíti ki. Ez a rendszer legfeljebb nyolc beszélő esetén képes a beszélőkhöz rendelt átiratra, és a beszélőváltások határait az automatikus beszédfelismerés időbélyegeihez igazítja.
A bemutatott megközelítés azoknak lehet hasznos, akiknek egy már több nyelvet támogató modell helyi dialektusokra vagy saját szakterületükre szabott változatára van szükségük. A forrás szerint a finomhangolási folyamat reprodukálható az NVIDIA ASR-finomhangolási jegyzetfüzetével, a megvalósítást pedig külön Nemotron ASR-finomhangolási útmutató segíti.
NVIDIA Developer: Fine-Tuning NVIDIA Nemotron for Saudi Arabic Dialects, with a Path to Other Languages


