Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az NVIDIA Nemotron 3 valós időben azonosítja a beszélőket

2026. szeptember 23.Forrás: Baseten
Az NVIDIA Nemotron 3 valós időben azonosítja a beszélőket
Kép: Baseten

A Baseten Model Library kínálatában elérhető az NVIDIA Nemotron 3 Diarization, amely valós időben címkézi a különböző beszélők hangját. A modell akár nyolc beszélőt követhet, a konfigurálható késleltetés pedig 320 milliszekundumtól 30,4 másodpercig terjed.

A lényeg röviden
  • A Nemotron 3 Diarization akár nyolc beszélőt követ egy hangfolyamban.
  • A késleltetés 0,32 és 30,4 másodperc között állítható.
  • Az AISHELL-4 teszten 9,8 százalékos hibaarányt mértek.
  • A rendszer beszélőkhöz rendelt valós idejű átírást is kínál.
  • Egy RTX PRO 6000 több mint 500 egyidejű diarizációs adatfolyamot kezelt.

Egyetlen modell követi a beszélőket

A Baseten szeptember 23-i közlése szerint a Nemotron 3 Diarization nyílt, végponttól végpontig működő beszélőszegmentáló modell. A beszélőszegmentálás, vagyis diarizáció, azt határozza meg, hogy egy hangfolyamban mikor ki beszél, majd az egyes megszólalásokhoz következetes beszélőazonosítót rendel.

A modell a korábban gyakori szegmentálási és vektorképzési folyamatot egyetlen feldolgozási lépéssel váltja ki. A körülbelül 100 millió paraméteres, transzformer-alapú architektúra az NVIDIA Streaming Sortformer technológiájára épül. A 16 kHz-es hangot 10 milliszekundumos keretekre bontja, és minden időpillanathoz nyolc beszélő aktivitási valószínűségét adja meg.

A rendszer két állapotot visz tovább a hangdarabok között. Az egyik a beszélők érkezési sorrendjét tárolja, így az elsőként hallott hang végig speaker_0 marad. A másik a legutóbbi kereteket tartalmazó FIFO, vagyis elsőként be, elsőként ki sor. A Baseten szerint ehhez nincs szükség vektorképzésre vagy klaszterezésre, és a feldolgozás korlátlan hosszúságú hang esetén is folytatható.

Négy késleltetési szintet kínál

Ugyanaz a Nemotron 3 Diarization modell négy algoritmikus késleltetési szinten használható. Ezek 0,32 és 30,4 másodperc közötti értékeket fednek le, attól függően, hogy a modell mennyi jövőbeli hangot vár meg egy címke rögzítése előtt. A beállítások a valós idejű hangügynököktől az utólagos médiatartalom-feldolgozásig többféle feladathoz igazíthatók.

A Baseten szerint az ultraalacsony, 0,32 másodperces szintre váltva a diarizációs hibaarány csak 1-2 százalékponttal nő a rögzített hanganyagokhoz képest. Az eredmény négy beszélő felett is stabil marad. Az AISHELL-4 adathalmazon, az alacsony késleltetésű beállítás mellett, a vállalat 9,8 százalékos hibaarányt mért, szemben a Streaming Sortformer v2.1 27,2 százalékos értékével.

A közleményben szereplő mérések szerint a modell több adathalmazon és több nyelvi környezetben is stabil teljesítményt nyújtott. A NOTSOFAR, AMI, CALLHOME és AISHELL teszteken a Meta Muse Voice Transcribe modellnél minden vizsgált beállításban jobb eredményt ért el. A pyannote Community-1 modellt csak az AMI adathalmazon nem előzte meg.

Hangügynökök és átírás számára is használható

A beszélőnkénti aktivitási adatok a címkézésen túl több hangalapú funkciót is támogathatnak. A rendszer az összes hangcsatorna adatait felhasználva képes beszédaktivitást érzékelni, így a hangosság helyett közvetlenül a hangfolyamból állapítja meg, mikor történik beszéd.

A modell azt is követi, hogy egy adott beszélő mikor fejezi be a mondatát. Ez segíthet megkülönböztetni a fő felhasználó megszólalásának végét a háttérben hallható beszédtől. Ha egy másik hang szólal meg, a rendszer megszakítást érzékelhet, egyidejű beszéd esetén pedig átfedést jelezhet. Az ultraalacsony késleltetésű beállításnál a Baseten szerint ez körülbelül 300 milliszekundum alatt történhet meg.

A Baseten három előre beállított változatot kínál: kötegelt feldolgozást, folyamatos WebSocket-kapcsolaton működő streaminget, valamint beszélőkhöz rendelt valós idejű átírást. Az utóbbi az NVIDIA 600 millió paraméteres, angol nyelvű Parakeet V2 beszédfelismerő modelljét használja. A beszélőaktivitási jellemzők közvetlenül az átírómodell kezdeti kódolórétegeibe kerülnek, így a rendszer egyetlen feldolgozási menetben kezelheti az átfedő beszédet, és megőrizheti a szavak és a beszélők időbeli összhangját.

A Baseten RTX PRO 6000 grafikus processzoron végzett optimalizálása több mint 500 egyidejű, egyórás diarizációs adatfolyamot támogatott, átírással együtt pedig 190-et. A modell a Hugging Face-en és a Baseten Model Libraryben is elérhető kötegelt, streaming és valós idejű átírási változatban.

BasetenNVIDIA Nemotron 3 DiarizationNVIDIA Streaming SortformerRTX PRO 6000hang és beszédnyílt forráskódú modellekAI-ágensek

Kapcsolódó hírek

A Baseten szerint 200 token/másodperc felett fut nála a GLM-5
Fejlesztőknek2026. október 2.

A Baseten szerint 200 token/másodperc felett fut nála a GLM-5

A Baseten állítása szerint a GLM-5 több mint 200 token/másodperces sebességet ért el a szolgáltatásán, miközben az első tokenig eltelt idő körülbelül 200 ezredmásodperc…

A Baseten nyílt modelleket tesz elérhetővé az OpenAI ügyfeleinek
Cégek és üzlet2026. szeptember 29.

A Baseten nyílt modelleket tesz elérhetővé az OpenAI ügyfeleinek

A Baseten az OpenAI B2B Marketplace egyik első nyíltmodell-inferencia-szolgáltatójaként csatlakozik az OpenAI ökoszisztémájához. A vállalati ügyfelek meglévő…

A LangSmith nyomkövetéseiből saját modelleket lehet finomhangolni
Fejlesztőknek2026. szeptember 24.

A LangSmith nyomkövetéseiből saját modelleket lehet finomhangolni

A LangChain új munkafolyamata a LangSmithben rögzített ügynökfutásokból készít felügyelt finomhangolási adatkészletet, majd Baseten Loops segítségével betanítja a…