hang és beszéd

Az Alexa+ külön díj nélkül érkezik a kompatibilis Fire TV eszközökre
Az Amazon 2026. augusztus 19-én közölte, hogy az Alexa+ külön díj nélkül bekerül a kompatibilis Fire TV eszközökre az Egyesült Államokban. A vállalat szerint a frissítés…

Ingyen érhetők a Fish Audio hangmodelljei a Vercel AI Gatewayben
Négy Fish Audio-modell vált elérhetővé a Vercel AI Gatewayben, a szolgáltatás pedig szeptember 18-ig díjmentesen kínálja őket. A csomag beszédszintézisre és hanganyagok…

A Pika Soundtrack teljes hangkulisszát generál videókhoz
A Pika Soundtrack videókhoz készít szinkronizált, teljes hangkulisszát, beleértve a hangeffekteket, a beszédet, a zenét és a környezeti hangokat. A Pika közlése szerint…

Pika Speech: öt másodpercnyi hangból készít beszédet a modell
A Pika bemutatta a Pika Speech nevű szövegfelolvasó modelljét, amely néhány másodpercnyi referenciahangból képes hangot klónozni, és egy kérésben akár öt percnyi…

Valós időben készít hanghatásokat szövegből a Pika új modellje
A Pika bemutatta a Pika SFX modellt, amely szöveges leírásból készít felhasználásra kész hanghatásokat valós időben. A rendszer egyetlen eseményt, összetett…
Cégek és üzletSzingapúrban nyit APAC-központot a Deepgram az EDBI befektetésével
Szingapúrban hozza létre Ázsia és a csendes-óceáni térség központját a Deepgram, amely a Voice AI infrastruktúrája iránti növekvő regionális keresletre épít. A vállalat…

A Vapi AI-szimulációkkal tesztelné a hangalapú ügynököket
A Vapi elindította a Vapi Simulations funkciót, amely AI-alapú tesztelőkkel folytat valódi beszélgetésekhez hasonló hívásokat a hangalapú ügynökökkel. A rendszer minden…

24 órán át működött a teljesen AI-generált hírcsatorna
A Captions 24 órán át működtette a Mirage News Network nevű, teljesen AI-generált hírcsatornát. A műsorvezetők, a hangok, a grafikai elemek és a vendéginterjúk is a…

A Higgsfieldre érkezett a MiniMax Hailuo 3.0 videógenerátor
Elérhetővé vált a Higgsfielden a MiniMax Hailuo 3.0, amely a szolgáltatás szerint 2K felbontású, legfeljebb 15 másodperces videókat készít natív hanggal. A modell…

A Harvey már hangot, videót és képeket is elemez a jogi munkában
A Harvey mostantól hang- és videofájlokat is átír, valamint képeket, diagramokat és grafikonokat elemez. A jogi platform így a szöveges dokumentumok mellett a…

A Pika négy új hangmodellt indított, akár húszszoros árkülönbséget ígér
Négy generatív hangmodellt mutatott be a Pika, amelyek videók hangosítására, zeneszerzésre, hangeffektek készítésére és beszédszintézisre használhatók. A vállalat…

A Flux 3 egy menetben készíti el a videót és a hangot
A Black Forest Labs Flux 3 modellje egyetlen generálási menetben készíti el a videót és a hozzá tartozó hangot. A Picsartban elérhető rendszer legfeljebb 20 másodperces…

A LiveKit nem adja el és engedély nélkül nem tanítja be az adatokat
A LiveKit közölte, hogy nem értékesíti a platformján áthaladó adatokat, és kifejezett engedély nélkül nem használja fel azokat modellek betanítására. A vállalat szerint…

A Krisp új hangszigetelő modellje az átírás pontosságára fókuszál
A Krisp bemutatta a Voice Isolation 2.5 hangszigetelő modellt, amelyet kifejezetten beszédfelismerő rendszerekhez (STT) optimalizáltak. A vállalat tesztjeiben az új…
Novemberben visszatér a VapiCon, a hangalapú AI csúcstalálkozója
Novemberben két napra visszatér a VapiCon, amelyet a Vapi a hangalapú mesterséges intelligencia első, kifejezetten ennek a területnek szentelt csúcstalálkozójaként mutat…

Érzelmesebb hangot ad a hangalapú ügynököknek a LiveKit új módja
A LiveKit expressive mode funkciója a beszélgetés érzelmi kontextusához igazítja a hangalapú ügynökök előadásmódját. A vállalat szerint az új lehetőség egyetlen…

A Speechmatics beszédfelismerése már 8000 alkalmazással köthető össze a Zapieren
A Speechmatics beszédfelismerő szolgáltatása megjelent a Zapieren, így a felhasználók kódolás, saját szerver és külön API-kliens nélkül kapcsolhatják össze több mint…
Termékek és eszközökA Sierra ügynökei már a nehéz telefonos menürendszerekkel is elboldogulnak
A Sierra AI-ügynökei már képesek önállóan navigálni a vállalatok telefonos menürendszereiben, felismerni, mikor jutottak el egy ügyintézőhöz, és szükség esetén…

Két új funkcióval bővült a Cartesia Ink-2 beszédfelismerő modellje
A Cartesia két új funkcióval egészítette ki Ink-2 beszédfelismerő modelljét: a kulcsszavas befolyásolással pontosabban írhatók át a nevek és szakterminusok, az állítható…

A mesterséges intelligencia jobban olvas, mint hallgat, állítja egy USC-kutatás
A hangalapú mesterséges intelligencia jól átírja, amit mondunk, de gyakran félreérti, hogyan mondjuk. A USC kutatói szerint az audio nagy nyelvi modellek a szöveget…

NVIDIA Magpie TTS: nyílt súlyok többnyelvű hangügynökökhöz
A Hugging Face 2026. augusztus 10-én közölt bejegyzést az NVIDIA Magpie TTS-ről. A cím szerint a technológia alacsony késleltetésű, többnyelvű hangügynökök építését…
Termékek és eszközökA Sierra személyiséget is ad az ügyfélszolgálati AI-agensek hangjához
A Sierra Voice Personas funkciójával a vállalatok saját márkahangot és személyiséget adhatnak AI-agentjeiknek. Ugyanaz az agent eltérő stílusban kommunikálhat különböző…

AudioMosaic és biztonságosabb AI ügynökök az ICML 2026-on
A Melbourne-i Egyetem ADM+S kutatói két tanulmányt mutattak be az ICML 2026 konferencián. Az egyik egy általános célú hangreprezentációk tanulására szolgáló módszert…

A Vercel AI Gatewayre érkezett a ByteDance Seedance 2.5
A ByteDance Seedance 2.5 elérhetővé vált a Vercel AI Gateway szolgáltatásán. A videógeneráló modell akár 30 másodperces, szinkronizált hanggal készülő klipeket hozhat…