hang és beszéd

A MiniMax H3 videót és hozzá illesztett hangot készít a Luma Agentsben
A MiniMax H3 már elérhető a Luma Agentsben, és egyetlen generálási menetben készít videót a hozzá időzített hanggal együtt. A rendszer szöveges, képi, videós és…

Gyorsul a hangalapú AI bevezetése az ügyfélszolgálatokon
Az ügyfélszolgálati vezetők egyre gyorsabban vezetik be a hangalapú mesterséges intelligenciát, miközben a megfelelő régiókban és nyelveken elérhető munkaerő megtalálása…

A Pika egyetlen API-ba gyűjt több mint 100 AI-modellt
A Pika elindította a Pika API Clubot, amely egyetlen API-kulccsal több mint 100 videó-, kép-, hang-, beszéd- és nyelvi modellhez ad hozzáférést. A vállalat szerint a…

Megjelent a FLUX 3 Video, hanggal és akár 20 másodperces klipekkel
A Black Forest Labs elérhetővé tette a FLUX 3 Video kezdeti változatát, amely szövegből és képekből legfeljebb 20 másodperces, hanggal kiegészített videóklipeket készít.…
Termékek és eszközökAz OpenAI új architektúrát épített a gyorsabb hangalapú AI-hoz
Az OpenAI 2026. augusztus 3-án ismertette, hogyan épített hat hónap alatt valós idejű rendszert a GPT-Live hangalapú AI-hoz. A cég szerint az új megközelítés a korábbi…

Hetek alatt változik a legjobb AI-hangok ranglistája
Két új beszédszintézis-modell is azonnal a Vapi Humanness Index élmezőnyébe került, ami a cég szerint azt mutatja, hogy a hangalapú AI területén már hetek alatt…

Az Apple rekordbevételt ért el a 2026-os harmadik negyedévben
Az Apple 109,4 milliárd dolláros bevétellel zárta 2026-os pénzügyi évének harmadik negyedévét, ami 16 százalékos éves növekedést jelent. Az iPhone, a Mac és a Services…
Termékek és eszközökGPT-Realtime-ra épülő, éjjel-nappal működő értékesítési ügynököt teszteltek Japánban
Két hét alatt mintegy 30 ezren használták a Yamada Denki online áruházában az avatarin GPT-Realtime-ra épülő, többnyelvű vásárlási ügynökét. A hangon és szövegen…

Béta API-val bővült a Roblox szövegfelolvasó rendszere
A Roblox béta állapotú, natív szövegfelolvasó API-t kínál a fejlesztőknek, így a játékok futás közben alakíthatják beszéddé a megadott szövegeket. Az AudioTextToSpeech…

A Speechmatics orvosi modellje 93 százalékos pontosságot ígér
A Speechmatics bemutatta Medical Model nevű, valós idejű klinikai átírásra fejlesztett modelljét. A vállalat szerint a rendszer 93 százalékos pontosságot ér el, és 50…
A Captions bemutatta a Mirage Avatar X avatarmodellt
A Captions bemutatta a Mirage Avatar X-et, amely a vállalat szerint eddigi legélethűbb avatarmodellje. A rendszer egyetlen folyamatban generálja az avatar teljes videós…

Az ElevenLabs hangalapú AI-val védené és tenné elérhetőbbé a választásokat
Az ElevenLabs szerint a hangalapú mesterséges intelligencia könnyebbé teheti a választási információk elérését, miközben új visszaélési kockázatokat is teremt. A…

Két új saját AI-modellt mutatott be a Microsoft
Nyilvános előzetesként elérhetővé tette a Microsoft a MAI-Image-2.5-Pro képalkotó és a MAI-Voice-2-Flash hangmodellt. A vállalat szerint az új modellek különböző…

A Black Forest Labs bemutatta a képet, videót és hangot együtt tanuló FLUX 3-at
Korai hozzáférésben elérhetővé vált a Black Forest Labs FLUX 3 nevű multimodális alapmodellje, amely képekből, videókból és hanganyagokból közösen tanul. A modell…

A Vapi éles hívások adatai alapján ajánl modelleket
A Vapi elindította a Model Intelligence csomagot, amely előre összeállított modellkonfigurációkkal és éles hívásokból származó teljesítménymutatókkal segít hangalapú…

Megjelent a LiveKit Unity SDK 2.0.0, kilépett a fejlesztői előzetesből
Megjelent a LiveKit Unity SDK 2.0.0, amely ezzel kilépett a Developer Preview szakaszból. A csomaggal a Unity-fejlesztők valós idejű hangot, videót, adatkommunikációt és…

A Hugging Face bemutatta a Real World VoiceEQ beszéd-AI-mérést
A Hugging Face bemutatta a Real World VoiceEQ benchmarkot, amelynek célja a hangalapú mesterséges intelligencia emberi minőségének mérése. A kezdeményezéshez rendezhető…

Az Oprah Podcast hetente kétszer érkezik a Prime Video-ra
Július 21-től hetente két új epizóddal jelentkezik az Oprah Podcast, keddenként és csütörtökönként. Az adások az Amazon és Oprah Winfrey Harpo Entertainment vállalatának…

A Vapi szerint már szinte emberinek hallatszanak a legjobb hangmodellek
A Vapi Humanness Index eredményei szerint a vezető hangmodellek hallgatói megítélés alapján már csak néhány ponttal maradnak el a valódi emberi hangfelvételtől. Az xAI…
Cégek és üzletA Deutsche Telekom AI-natív távközlési vállalattá alakítja működését
A Deutsche Telekom AI-natív távközlési vállalattá kíván válni, ezért a mesterséges intelligenciát az ügyfélszolgálatban, a hálózatüzemeltetésben és a hangkommunikációban…

Verset ajánl és William Sieghart hangján szólal meg az Ode Poetry
Az Ode Poetry beszélgetés alapján ajánl verset a felhasználónak, majd egy valódi ember felolvasásában játssza le. A Microsoft AI és William Sieghart közös projektje a…
ModellekGPT-Live érkezik, természetesebb beszélgetést ígér a ChatGPT Voice-ban
Az OpenAI bemutatta a GPT-Live hangmodelleket, amelyek egyszerre tudnak figyelni és beszélni, így természetesebb, gyorsabb párbeszédet tesznek lehetővé. A GPT-Live-1 és…

Az ElevenLabs Kanadában terjeszkedik, megduplázza helyi csapatát
Az ElevenLabs hivatalosan is elindította üzleti működését Kanadában, ahol már 30 000 felhasználója van. A vállalat Torontóban nyitja meg első kanadai irodáját, és…

Nyílt forrású arab beszédfelismerő modellt adott ki a Cohere
A Cohere nyílt forrásúvá tette a Cohere Transcribe Arabic beszédfelismerő modellt, amelyet arab dialektusokra, kétnyelvű beszédre és vállalati használatra…