Az NVIDIA Nemotron 3 valós időben azonosítja a beszélőket

A Baseten Model Library kínálatában elérhető az NVIDIA Nemotron 3 Diarization, amely valós időben címkézi a különböző beszélők hangját. A modell akár nyolc beszélőt követhet, a konfigurálható késleltetés pedig 320 milliszekundumtól 30,4 másodpercig terjed.
- A Nemotron 3 Diarization akár nyolc beszélőt követ egy hangfolyamban.
- A késleltetés 0,32 és 30,4 másodperc között állítható.
- Az AISHELL-4 teszten 9,8 százalékos hibaarányt mértek.
- A rendszer beszélőkhöz rendelt valós idejű átírást is kínál.
- Egy RTX PRO 6000 több mint 500 egyidejű diarizációs adatfolyamot kezelt.
Egyetlen modell követi a beszélőket
A Baseten szeptember 23-i közlése szerint a Nemotron 3 Diarization nyílt, végponttól végpontig működő beszélőszegmentáló modell. A beszélőszegmentálás, vagyis diarizáció, azt határozza meg, hogy egy hangfolyamban mikor ki beszél, majd az egyes megszólalásokhoz következetes beszélőazonosítót rendel.
A modell a korábban gyakori szegmentálási és vektorképzési folyamatot egyetlen feldolgozási lépéssel váltja ki. A körülbelül 100 millió paraméteres, transzformer-alapú architektúra az NVIDIA Streaming Sortformer technológiájára épül. A 16 kHz-es hangot 10 milliszekundumos keretekre bontja, és minden időpillanathoz nyolc beszélő aktivitási valószínűségét adja meg.
A rendszer két állapotot visz tovább a hangdarabok között. Az egyik a beszélők érkezési sorrendjét tárolja, így az elsőként hallott hang végig speaker_0 marad. A másik a legutóbbi kereteket tartalmazó FIFO, vagyis elsőként be, elsőként ki sor. A Baseten szerint ehhez nincs szükség vektorképzésre vagy klaszterezésre, és a feldolgozás korlátlan hosszúságú hang esetén is folytatható.
Négy késleltetési szintet kínál
Ugyanaz a Nemotron 3 Diarization modell négy algoritmikus késleltetési szinten használható. Ezek 0,32 és 30,4 másodperc közötti értékeket fednek le, attól függően, hogy a modell mennyi jövőbeli hangot vár meg egy címke rögzítése előtt. A beállítások a valós idejű hangügynököktől az utólagos médiatartalom-feldolgozásig többféle feladathoz igazíthatók.
A Baseten szerint az ultraalacsony, 0,32 másodperces szintre váltva a diarizációs hibaarány csak 1-2 százalékponttal nő a rögzített hanganyagokhoz képest. Az eredmény négy beszélő felett is stabil marad. Az AISHELL-4 adathalmazon, az alacsony késleltetésű beállítás mellett, a vállalat 9,8 százalékos hibaarányt mért, szemben a Streaming Sortformer v2.1 27,2 százalékos értékével.
A közleményben szereplő mérések szerint a modell több adathalmazon és több nyelvi környezetben is stabil teljesítményt nyújtott. A NOTSOFAR, AMI, CALLHOME és AISHELL teszteken a Meta Muse Voice Transcribe modellnél minden vizsgált beállításban jobb eredményt ért el. A pyannote Community-1 modellt csak az AMI adathalmazon nem előzte meg.
Hangügynökök és átírás számára is használható
A beszélőnkénti aktivitási adatok a címkézésen túl több hangalapú funkciót is támogathatnak. A rendszer az összes hangcsatorna adatait felhasználva képes beszédaktivitást érzékelni, így a hangosság helyett közvetlenül a hangfolyamból állapítja meg, mikor történik beszéd.
A modell azt is követi, hogy egy adott beszélő mikor fejezi be a mondatát. Ez segíthet megkülönböztetni a fő felhasználó megszólalásának végét a háttérben hallható beszédtől. Ha egy másik hang szólal meg, a rendszer megszakítást érzékelhet, egyidejű beszéd esetén pedig átfedést jelezhet. Az ultraalacsony késleltetésű beállításnál a Baseten szerint ez körülbelül 300 milliszekundum alatt történhet meg.
A Baseten három előre beállított változatot kínál: kötegelt feldolgozást, folyamatos WebSocket-kapcsolaton működő streaminget, valamint beszélőkhöz rendelt valós idejű átírást. Az utóbbi az NVIDIA 600 millió paraméteres, angol nyelvű Parakeet V2 beszédfelismerő modelljét használja. A beszélőaktivitási jellemzők közvetlenül az átírómodell kezdeti kódolórétegeibe kerülnek, így a rendszer egyetlen feldolgozási menetben kezelheti az átfedő beszédet, és megőrizheti a szavak és a beszélők időbeli összhangját.
A Baseten RTX PRO 6000 grafikus processzoron végzett optimalizálása több mint 500 egyidejű, egyórás diarizációs adatfolyamot támogatott, átírással együtt pedig 190-et. A modell a Hugging Face-en és a Baseten Model Libraryben is elérhető kötegelt, streaming és valós idejű átírási változatban.


