Saját hangmodellt indított a HeyGen, az Artificial Analysis élére került

Elindította saját hangmodelljét a HeyGen, amely a vállalat közlése szerint első helyen debütált az Artificial Analysis hangmodelleket vizsgáló rangsorában. A HeyGen Voice a felhasználó természetes hangszínét, tempóját és kifejezésmódját igyekszik megőrizni videók készítésekor.
- A HeyGen elindította saját hangmodelljét, a HeyGen Voice-t.
- A vállalat szerint a modell első lett az Artificial Analysis rangsorában.
- A HeyGen Voice a platformon és az API-n keresztül ingyenesen elérhető.
- A Professional Voice Clone kiegészítő havi 99 dollárba kerül.
- A hangklónozáshoz a tulajdonos kifejezett hozzájárulását kérik.
Természetesebb hangot ígér a HeyGen
A Los Angeles-i HeyGen október 9-én mutatta be a HeyGen Voice nevű, házon belül fejlesztett hangmodelljét. A vállalat szerint a modell célja, hogy a mesterségesen létrehozott beszéd minél közelebb álljon ahhoz, ahogyan a felhasználó a saját hangján megszólalna.
A HeyGen szerint a rendszer megőrzi a beszéd hangszínét, ritmusát és kifejezőerejét. A termék kiemelt jellemzői közé tartozik a természetes hangsúlyozás, az érzelmek érzékeltetése, a karakteres megszólalás és a megfelelő időzítés. A cég úgy látja, hogy ezek hiánya miatt sok mesterséges hang kevésbé azonosítható és kevésbé meggyőző a hallgatók számára.
„A hang a kommunikáció egyik legerősebb és legszemélyesebb módja, a minőség pedig mindent megváltoztat”, mondta Rong Yan, a HeyGen technológiai igazgatója. Hozzátette, hogy a HeyGen Voice fejlesztésével olyan AI-hang létrehozására törekedtek, amely a technológia lehetőségeihez mérten a lehető legjobban hasonlít a felhasználó saját hangjára.
Első hely az Artificial Analysis rangsorában
A HeyGen közlése szerint a HeyGen Voice az Artificial Analysis Leaderboard rangsorában az első helyen debütált. A vállalat ezt a hangmodellek független értékelésében elért legmagasabb eredményként mutatja be. A rangsorban elért helyezésre Rong Yan is a modell minőségének külső visszaigazolásaként hivatkozott.
A szolgáltatás a HeyGen platformján és API-ján keresztül ingyenesen elérhető. A vállalat egy HeyGen Professional Voice Clone nevű, havi 99 dolláros kiegészítőt is kínál azoknak, akik a saját hangjuk lehető legpontosabb megjelenítését szeretnék. Ennek betanítása a hang tulajdonosának kifejezett hozzájárulásával, 30 perctől három óráig terjedő beszédanyag alapján történik.
A HeyGen Voice ugyanabba a technológiai rendszerbe illeszkedik, amelynek központi modellje az Avatar V. A cég szerint ez azt jelenti, hogy a hang és az identitás egyetlen rendszerből származik, ahelyett, hogy több szolgáltató technológiáit kellene összekapcsolni.
A hozzájárulásra és az identitás védelmére építenek
A vállalat a hang- és képmás használatának ellenőrzését a termékfejlesztés központi elemének nevezi. A HeyGen szerint a hang tulajdonosának kifejezett beleegyezése szükséges, és avatártermékeibe olyan védelmi megoldásokat épített, amelyek segítenek a felhasználóknak ellenőrzésük alatt tartani hangjuk és képmásuk megjelenítését.
A bejelentés egy olyan időszakban érkezett, amikor a HeyGen a videókészítő eszközeit bővíti. A vállalat egy több mint 1000, globális felhasználói bázisába tartozó kisvállalkozás-tulajdonos bevonásával végzett felmérésre hivatkozva azt írja, hogy a válaszadók 71,6 százaléka már rögzített üzleti videót, végül azonban nem tette közzé. A HeyGen szerint a HeyGen Voice a gyártási minőséggel és a kamera előtti szerepléssel kapcsolatos akadályokat enyhítheti.
A cég 2020-ban alakult, és közlése szerint jelenleg több mint 40 millió felhasználót ér el 196 országban. A platformon több mint 118 millió videó készült, a HeyGen technológiáját pedig a Fortune 100 vállalatainak 85 százaléka használja. A vállalat arról is beszámolt, hogy évesített bevétele nemrég meghaladta a 200 millió dollárt, és nyolc hónap alatt megduplázta bevételét. A HeyGen Voice további képességekkel és frissítésekkel bővül majd a felhasználói visszajelzések alapján.

