Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Hetek alatt változik a legjobb AI-hangok ranglistája

2026. augusztus 3.Forrás: Vapi
Hetek alatt változik a legjobb AI-hangok ranglistája
Kép: Vapi

Két új beszédszintézis-modell is azonnal a Vapi Humanness Index élmezőnyébe került, ami a cég szerint azt mutatja, hogy a hangalapú AI területén már hetek alatt változhat a technológiai élvonal. A Speechify Simba 3.2 99 pontos eredménnyel vezet, a Fish Audio S2.1-Pro pedig 141 ezredmásodperces első hanggal debütált.

A lényeg röviden
  • A Speechify Simba 3.2 99 ponttal vezeti a Humanness Indexet.
  • A Fish Audio S2.1-Pro 94 ponttal és 141 ezredmásodperces első hanggal debütált.
  • A teszt valódi emberi felvételt használ 100 pontos viszonyítási alapként.
  • A két új modell szavazatszáma még alacsony, ezért helyezésük bizonytalanabb.
  • A Vapi szerint a cserélhető modellek gyorsabb alkalmazkodást tesznek lehetővé.

Új modellek kerültek az élre

A Vapi augusztus 3-i beszámolója szerint a Humanness Index ranglistájára az elmúlt tíz napban felkerült két modell rögtön a mezőny tetején végzett. A Speechify Simba 3.2 július 24-én került be a tesztbe, és 99 pontos emberi hangzásértékeléssel átvette a vezetést. Ez egyetlen ponttal marad el a valódi emberi felvételt jelölő 100-as értéktől.

A Fish Audio S2.1-Pro első heti eredménye 94 pont lett. A modell különösen gyorsan kezdi a megszólalást: az első hangig mért idő 141 ezredmásodperc volt, ami a Vapi szerint a ranglista vezető modelljei között a legalacsonyabb érték. A legtöbb élmezőnybeli modell 300 és 800 ezredmásodperc közötti eredményt ért el.

A Simba 3.2 első hangjáig 428 ezredmásodperc telt el. A Vapi szerint a modell a ranglistán szereplő olcsóbb fizetős modellek közé tartozik.

Így méri a Vapi, mennyire emberi egy hang

A Humanness Index vak, közösségi értékelésen alapuló mérés. A Vapi ugyanazt a hangot minden vizsgált modellhez hozzárendeli, majd ugyanazt a szöveget olvastatja fel velük. A hallgatók két, megjelölés nélküli hangmintát hallanak egymás mellett, és kiválasztják, melyik hangzik emberibbnek.

A tesztben valódi emberi felvétel is szerepel, ez rögzíti a skála 100-as értékét. A 99 pont ezért azt jelenti, hogy a hallgatók a modell hangját majdnem ugyanolyan gyakran választották emberibbnek, mint az eredeti emberi felvételt.

A két új modell eredményeit egyelőre kevés szavazat támasztja alá. A Simba 3.2 139, az S2.1-Pro 126 összehasonlításban szerepelt, miközben a régebbi modellek több mint 500 szavazatnál járnak. Emiatt az új modellek helyezési tartománya még széles, és a Vapi szerint további szavazatok szűkíthetik ezt.

A csúcstechnológia már hetek alatt változik

A ranglista vezetője korábban az xAI Grok TTS volt 95 ponttal, öt ponttal a valódi emberi hang alatt. A Grok TTS három hétig maradt az élen, a Simba 3.2 tíz napja vezette a mezőnyt, míg az S2.1-Pro hét nap alatt két pontra megközelítette.

A Vapi szerint a vezető pontszám a Humanness Index indulása óta 95-ről 99-re emelkedett, miközben a valódi emberi felvételhez rögzített 100-as alapérték nem változott. A cég példája szerint a júniusban használt modellek augusztusra a középmezőnybe kerülhettek úgy, hogy közben a teljesítményük nem romlott. Egyszerűen újabb, jobb eredményű modellek jelentek meg.

Miért számít a modellcsere lehetősége?

A Vapi ebből azt a gyakorlati következtetést vonja le, hogy a hangalapú AI-rendszerek fejlesztőinek olyan szolgáltatót érdemes választaniuk, amely lehetővé teszi a modellek cseréjét. Ha a szövegfelolvasó modell csak egy cserélhető beállítás, a fejlesztők gyorsabban válthatnak, amikor jobb modell válik elérhetővé.

A vállalat szerint ugyanez vonatkozik az átíró- és intelligenciamodellekre is. A Vapi platformján ezeket a komponenseket a felhasználók később is újraválaszthatják. A Humanness Index maga független a Vapi termékétől, az értékeket azonban a Model Intelligence funkción keresztül közvetlenül a platformon is meg lehet tekinteni.

A ranglistán eddig közel 12 ezer szavazat gyűlt össze 21 modellre, 11 szolgáltatótól. A Vapi arra kéri a felhasználókat, hogy vak összehasonlításokban hallgassák meg a hangokat, és válasszák ki, melyiket érzik emberibbnek. A cég szerint a két új modell alacsony szavazatszáma miatt a ranglista a következő időszakban ismét jelentősen változhat.

Kapcsolódó hírek

Az AssemblyAI szerint félrevezető lehet a beszédfelismerés WER-mérőszáma
Kutatás2026. szeptember 30.

Az AssemblyAI szerint félrevezető lehet a beszédfelismerés WER-mérőszáma

A hagyományos szóhibaarány, vagyis a WER egyes esetekben rosszabbnak mutathatja az újabb beszédfelismerő modelleket, állítja az AssemblyAI. A vállalat szerint a probléma…

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp
Kutatás2026. szeptember 28. 16:16

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp

A Krisp 265 valódi beszélgetésből álló tesztadatbázist készített a háttérben megszólaló hangok vizsgálatára. A felvételek irodákban, call centerekben és mozgó autókban…

A Vapi szerint már szinte emberinek hallatszanak a legjobb hangmodellek
Kutatás2026. július 13.

A Vapi szerint már szinte emberinek hallatszanak a legjobb hangmodellek

A Vapi Humanness Index eredményei szerint a vezető hangmodellek hallgatói megítélés alapján már csak néhány ponttal maradnak el a valódi emberi hangfelvételtől. Az xAI…