Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Vapi szerint már szinte emberinek hallatszanak a legjobb hangmodellek

2026. július 13.Forrás: Vapi
A Vapi szerint már szinte emberinek hallatszanak a legjobb hangmodellek
Kép: Vapi

A Vapi Humanness Index eredményei szerint a vezető hangmodellek hallgatói megítélés alapján már csak néhány ponttal maradnak el a valódi emberi hangfelvételtől. Az xAI Grok TTS 95, a MiniMax Speech 2.5 pedig 93 pontot ért el a ranglistán.

A lényeg röviden
  • Az xAI Grok TTS 95 ponttal vezeti a Vapi Humanness Indexét.
  • A MiniMax Speech 2.5 93 pontot ért el.
  • A valódi emberi hangfelvétel 100 pontos referenciaként szerepel.
  • A ranglista több mint 11 000 közösségi szavazatra épül.
  • A Vapi szerint a természetesebb hang a telefonos hangügynökök használhatóságát javíthatja.

A ranglista élén az xAI és a MiniMax modellje

A Vapi július 13-án közzétett beszámolója szerint a Humanness Index első időszakának eredményei azt mutatják, hogy a legjobb hangmodelleket sok hallgató nehezen különbözteti meg egy valódi embertől. A mérés célja kifejezetten az, hogy választ adjon arra, mennyire hangzik emberinek egy modell hangja.

A ranglistán az xAI Grok TTS áll az élen 95 ponttal. Ez öt ponttal marad el a valódi emberi referenciától, amely 100 pontot kapott. A MiniMax Speech 2.5 93 ponttal követi, így hét ponttal van a referenciaérték alatt. A Vapi szerint a legjobb modellek közötti különbség szűk: a top négy helyezettet egyenként egy pont választja el, és mindegyikük egy számjegyű különbséggel marad el az emberi hangtól.

Vaktesztekkel mérik az emberi hatást

A Humanness Index egy közösségi részvételen alapuló, élő ranglista. A tesztben két hangmodell ugyanazzal a klónozott hanggal, ugyanazt a mondatot olvassa fel. A résztvevők úgy választják ki az emberibbnek hangzó változatot, hogy a modellek neveit csak a szavazás után látják.

A Vapi a változók összehasonlíthatósága érdekében valódi emberektől származó idézeteket és felvételeket használ, majd minden modellre ugyanazt a hangot klónozza az adott szolgáltató hangklónozási funkciójával. A modellek ugyanazt a szöveget mondják fel, beleértve a töltelékszavakat és a mondatok végén hallható szüneteket is.

A tesztkészletben maga a valódi emberi felvétel is szerepel. Ez alapján a Vapi értelmezésében a Grok TTS 95 pontos eredménye azt jelenti, hogy a hallgatók vaktesztben közel ugyanolyan arányban választották ezt a modellt, mint a valódi emberi felvételt.

A természetesebb hang a telefonos ügynököknek kedvezhet

A Vapi szerint a hangautomatizálás korlátját sokáig nem kizárólag a modellek értelmi képessége jelentette. A monoton vagy gépies megszólalás elárulhatta a rendszert, ezért a hívó fél emberi ügyintézőt kérhetett. A vállalat úgy látja, hogy a 95 pontos eredmény az emberi és a szintetikus hang közötti távolság gyors csökkenését jelzi.

Ha a hang kevésbé vonja el a figyelmet, a hívó fél jobban megtapasztalhatja a hangügynök mögött működő modellek képességeit. A Vapi példái szerint egy ilyen rendszer azonosíthatja a hívót, előkeresheti a fiókját, kezelhet egy kivételes esetet, és közérthetően elmagyarázhatja a megoldást, akár több ezer hívás során egyszerre. A vállalat szerint az emberibb hang segíthet abban, hogy a hívó a vonalban maradjon a probléma rendezéséig.

A ranglista eredményei egyelőre korai jelzésként szolgálnak. A Vapi arra kéri a technikai és nem technikai hátterű hallgatókat, hogy szavazzanak a teszteken, mert a több és változatosabb értékelés pontosabb képet adhat arról, mely modellek hangzanak a legközelebb az emberhez. A vállalat szerint eddig több mint 11 000 szavazat érkezett, egy összehasonlítás pedig körülbelül egy percet vesz igénybe.

Kapcsolódó hírek

Az AssemblyAI szerint félrevezető lehet a beszédfelismerés WER-mérőszáma
Kutatás2026. szeptember 30.

Az AssemblyAI szerint félrevezető lehet a beszédfelismerés WER-mérőszáma

A hagyományos szóhibaarány, vagyis a WER egyes esetekben rosszabbnak mutathatja az újabb beszédfelismerő modelleket, állítja az AssemblyAI. A vállalat szerint a probléma…

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp
Kutatás2026. szeptember 28. 16:16

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp

A Krisp 265 valódi beszélgetésből álló tesztadatbázist készített a háttérben megszólaló hangok vizsgálatára. A felvételek irodákban, call centerekben és mozgó autókban…

Hetek alatt változik a legjobb AI-hangok ranglistája
Kutatás2026. augusztus 3.

Hetek alatt változik a legjobb AI-hangok ranglistája

Két új beszédszintézis-modell is azonnal a Vapi Humanness Index élmezőnyébe került, ami a cég szerint azt mutatja, hogy a hangalapú AI területén már hetek alatt…