Nyílt forrású eszközt adott ki a TTS-rendszerek összehasonlítására az Inworld

Az Inworld nyílt forrású eszköztárat mutatott be a szövegfelolvasó, vagyis TTS-rendszerek reprodukálható és részletes vizsgálatához. A keretrendszer hangmintákat készít, offline elemzi azokat, majd összehasonlítható jelentéseket állít elő.
- Az Inworld nyílt forrású TTS-értékelő eszköztárat adott ki.
- A rendszer hangmintákat készít, offline mér és összehasonlítható jelentéseket generál.
- Az első kiadás többek között WER-, hangminőségi, időtartam- és kifejezőkészség-méréseket kínál.
- A csomag egy 100 angol felszólításból álló párbeszédes stressztesztet tartalmaz.
- A mérési eredmények gyorsítótára csökkentheti az ismételt beszédfelismerés szükségességét.
Egy helyen rögzíti az értékelés teljes folyamatát
Az Inworld 2026. augusztus 28-án jelentette be az Inworld TTS Open Evaluation Toolkit első kiadását. A vállalat szerint az eszköz célja, hogy az értékelések feltételei, mérési eredményei és döntési szabályai egyaránt ellenőrizhetők legyenek.
A keretrendszer minden futtatást egy vizsgálható könyvtárban tart. Rögzíti a használt modelleket, hangokat és szintézisbeállításokat, majd a hangfájlokat helyben, offline értékeli. A felhasználók egy adott pontszámot visszakövethetnek a forrásszöveghez és a hanganyaghoz, megvizsgálhatják a beszédfelismerő rendszer átiratát, valamint ellenőrizhetik az alkalmazott küszöbértékeket.
Beépített adapterek állnak rendelkezésre az Inworld, az ElevenLabs és a Hume rendszereihez. Más szolgáltatások hanganyagai manifestfájlon keresztül adhatók meg. A HTML-jelentés működéséhez nincs szükség CDN-re vagy hosztolt futtatókörnyezetre.
A beállítások jelentősen befolyásolhatják a mérési eredményt
Az Inworld szerint ugyanazt a TTS-modellt és ugyanazt az adathalmazt használva is eltérő eredmény születhet két csapat mérésében. A szóhibaarányt befolyásolhatja a beszédfelismerő modell, a szöveg normalizálása, a választott hang és a szintézis konfigurációja. Az is számít, hogy a hibás mintákat kizárják-e az értékelésből.
A vállalat különösen nehéznek tartja a szubjektív szempontok, például a természetesség és a kifejezőkészség mérését. A modern rendszerek az egyszerű felszólításokat többnyire jól kezelik, ezért a nehezebb esetek hibái és a megvalósítás részletei nagyobb hatással lehetnek az eredményre. Az Inworld álláspontja szerint egy protokoll nélkül közölt átlagos pontszám önmagában ritkán teszi reprodukálhatóvá az állítást.
A több futtatást összevető jelentések szemantikai csoportok szerint rendezik a mutatókat, például pontossághoz kapcsolódó, szubjektív és hibamódokat leíró kategóriákba. A jelentések konfidenciaintervallumokat és a modell állapotára vonatkozó összefoglalókat is tartalmaznak. Ha egy minta nem felel meg egy küszöbnek, a részletes jelentés egymás mellett mutatja a várt szöveget és a beszédfelismerési átiratot, és elérhető hang esetén magát a felvételt is.
Számos hibajelenséget és egy 100 elemes stressztesztet is kezel
Az első kiadás szó- és karakteralapú hibaarányokat, valamint a beszúrások, törlések és helyettesítések bontását méri. Vizsgálható a levágás és a csend aránya, a hangerő, a hanganyag végén jelentkező kattanás, a hossz és a beszédtempó is. Opcionálisan elérhetők a NISQAv2 különböző dimenziói, az ECAPA beszélőhasonlósági mérés és a magánhangzók megnyújtásának felismerése.
Az Inworld hangsúlyozza, hogy ezeket a mutatókat nem szabad egyetlen univerzális rangsorrá összevonni. A WER, vagyis a szóhibaarány a méréshez használt beszédfelismerő hibáit is tükrözheti, és az alacsony WER önmagában keveset árul el a hang természetességéről. A csomag könnyű arousal- és kifejezőkészség-proxykat is kínál. A kapcsolódó, nyílt forrású Voice Lens ezeket a tulajdonságokat helyben, a hangmagasság, a hangerő és a ritmus jellemzőiből számítja, a feltöltött hang pedig a böngészőben marad.
A repository egy 100 felszólításból álló, angol párbeszédekre épülő stressztesztet is tartalmaz. A készletben vannak töredékes mondatok, megszakítások és kiemelési jelölések, továbbá ismétlődő szavak, egymásba ágyazott idézetek és hosszú, drámai sorok. A vállalat szerint ez nem reprezentatív beszédminta, hanem gyors hibakeresésre szolgáló készlet. Éles bevezetés előtt ezért a termék tényleges felszólításait, nyelveit és hangjait is értékelni kell.
Az eszköztár mérési gyorsítótára tartalomcímzésű. Ha a dekódolt hang, a forrásszöveg és a mérési konfiguráció változatlan, a rendszer újra felhasználja a korábbi beszédfelismerési és hangmérési eredményeket. A küszöbértékeket és a jelentéseket ettől még újraépíti, így a döntési szabályok módosítása nem igényli ugyanazon minták ismételt átírását. A kód és a példák a repository README-jében, a telepítési és első parancssori jelentés elkészítéséhez készült útmutatók pedig magában a repositoryban találhatók.
Inworld AI: Introducing the Inworld TTS Open Evaluation Toolkit


