hang és beszéd

Nyílt ranglista indult a többnyelvű TTS-modellek mérésére
Az Open TTS Leaderboard nyílt értékelési platformként a többnyelvű szövegfelolvasó és hangklónozó modellek összehasonlítását teszi skálázhatóbbá. A Hugging Face blogján…

22 milliárd dollárra értékelték az ElevenLabsot
Az ElevenLabs 300 millió dolláros, dolgozói részvényeladási programot zárt le, amely 22 milliárd dollárra értékeli a hangalapú mesterséges intelligenciával foglalkozó…

Az Inworld AI felvásárolta a valós idejű hangügynököket fejlesztő Ultravoxot
Az Inworld AI felvásárolta az Ultravoxot, a valós idejű hangügynökök fejlesztésére használt platformot. Az Ultravox csapata az Inworldnél folytatja a platform…

22 milliárd dollárra értékelték az ElevenLabst
Az ElevenLabs 300 millió dolláros dolgozói tenderajánlatot zárt le, amely 22 milliárd dollárra értékelte a vállalatot. Ez kétszerese a februári Series D finanszírozási…

Hét tanulság a valódi hangalapú ügynökök építéséről
A bemutatón jól működő hangalapú AI-ügynököt gyorsan össze lehet rakni, éles környezetben azonban a hangposta, a megszakítások, a késleltetés és a bizalom komoly…

Az AssemblyAI szerint félrevezető lehet a beszédfelismerés WER-mérőszáma
A hagyományos szóhibaarány, vagyis a WER egyes esetekben rosszabbnak mutathatja az újabb beszédfelismerő modelleket, állítja az AssemblyAI. A vállalat szerint a probléma…

A Vapi személyes AI-asszisztensekre bízza a telefonhívásokat
Bétában indította el a Vapi a Personal Agent Calling szolgáltatást, amely lehetővé teszi, hogy a személyes AI-asszisztensek telefonhívásokat kezdeményezzenek és…

A Vapi teljes kontrollt ígér a vállalati hangalapú ügyfélszolgálatok felett
A Vapi új, CX-re szánt eszközkészletet mutatott be, amely a vállalati hangalapú ügynökök teljes életciklusát kezeli. A vállalat szerint a cél az, hogy az…

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp
A Krisp 265 valódi beszélgetésből álló tesztadatbázist készített a háttérben megszólaló hangok vizsgálatára. A felvételek irodákban, call centerekben és mozgó autókban…

Érzelmesebb beszédszintézist ígér az ElevenLabs új Eleven v4 modellje
Az ElevenLabs új szövegfelolvasó modellje, az Eleven v4 a cég szerint pontosabban kezeli a hangnemet, az érzelmet, a tempót és a beszédhelyzetet. A modell mellé érkezett…

A Picsart már a Grok Botból is képet, videót és hangot készít
A Picsart plugin megérkezett a Grok Botba, így a felhasználók egyetlen csevegésből kérhetnek képet, videót, hangalámondást, zenét és szerkesztést. A vállalat szerint a…

Gemini 3.8 Flash TTS és Flash-Lite: 29 nyelv és az ár választja el őket
A Gemini 3.8 Flash TTS és a Flash-Lite TTS ugyanazokat a hangkezelési és vezérlési lehetőségeket kínálja, a legfontosabb eltérés a nyelvi lefedettség és az ár. A Flash…

Bővíti az AI-ügynökök eszköztárát a Microsoft Azure
Új modellekkel, hangalapú ügynökökkel és hosszú ideig futó feladatok támogatásával bővíti a Microsoft Foundry képességeit a Microsoft. A vállalat szerint a fejlesztők…
Élő avatárt kapott a Gemini 3.8 Live
A Google DeepMind bemutatta a Gemini 3.8 Live with Live Avatar rendszert, amely valós idő közeli videógenerálással egészíti ki a hangalapú párbeszédet. A vállalat…
Elérhetővé vált a Gemini 3.8 Live Live Avatar funkcióval
A Google Cloud általánosan elérhetővé tette a Gemini 3.8 Live Live Avatar funkcióval kiegészített változatát a Gemini Enterprise vállalati ügyfelei számára. A rendszer…

Egy másodperces, hanggal együtt készülő videókat is generál a Picsart
A Picsart AI Playgroundba megérkezett a Creatify Boreal, amely egyetlen leírásból készít videót és hozzá illesztett hangot. A felhasználó 1 és 20 másodperc közötti…

Az Apple tömörítette az eszközön futó beszédfelismerés enkóderét
Az Apple kutatói olyan módszert mutattak be, amellyel tömöríthető a vállalat eszközön futó diktálási rendszerének beszédfelismerő tokenizálója. A 2,8-szor kisebb modell…

Az Apple új módszert mutatott be a beszédfelismerő modellek tanítására
Az Apple kutatói olyan módszert vizsgáltak, amely címkézetlen felhasználói adatokkal is stabilabbá teheti a federált automatikus beszédfelismerés tanítását. A…

A Vapi három új eszközzel tesztelhetőbbé és skálázhatóbbá teszi a hangalapú AI-t
A Vapi három új funkciójáról válaszolt a fejlesztők kérdéseire: a Model Intelligence a modellek kiválasztását, a Simulations az AI-hangügynökök tesztelését, a Campaigns…

A Speechmatics helyben futó beszédfelismerést kínál vállalatoknak
A Speechmatics korai hozzáférést nyitott On-Device beszédfelismerő technológiájához, amely a hangot teljes egészében a felhasználó számítógépén dolgozza fel. A vállalat…

Az NVIDIA Nemotron 3 valós időben azonosítja a beszélőket
A Baseten Model Library kínálatában elérhető az NVIDIA Nemotron 3 Diarization, amely valós időben címkézi a különböző beszélők hangját. A modell akár nyolc beszélőt…

Új Gemini hangmodellek érkeztek egyedi beszédhangokhoz
Két új szövegfelolvasó modellel bővül a Gemini család: a Gemini 3.8 Flash TTS a kreatív hangtervezésre, a Gemini 3.8 Flash-Lite TTS pedig nagy volumenű használatra…
Termékek és eszközökA Ringg AI-ügynökei az ügyfélhívások akár 65 százalékát megoldják
A Ringg hang- és chatügynök-platformja az OpenAI modelljeire építve az ügyfélszolgálati megkeresések jelentős részét emberi beavatkozás nélkül kezeli. Az OpenAI 2026.…

Új navigációs és hologramos funkciókat kap a Meta Ray-Ban Display
Kerékpáros és tömegközlekedési útvonaltervezéssel, hologramos videóhívással és több új alkalmazással bővíti a Meta Ray-Ban Display képességeit a Meta. A szemüveg az…