hang és beszéd

A LiveKit Connectors WhatsAppra és Twilióra viszi a hangügynököket
A LiveKit Connectors közvetlen kapcsolatot teremt a LiveKit-szobák és a Twilio Programmable Voice, valamint a WhatsApp Business Calling között. A vállalat szerint így a…

A Speechmatics Melia 1 modellje javította a többnyelvű átírást
A Speechmatics szerint Melia 1 beszédfelismerő modellje vezeti a tesztelt rendszerek mezőnyét az arab, mandarin és tamil nyelv közötti váltások felismerésében. Arab és…

A Salesforce Winter ’27 az AI-ügynökökre bízná a teljes vállalati munkafolyamatokat
A Salesforce 2026. augusztus 31-én mutatta be a Winter ’27 Release fő újdonságait. A vállalat szerint a kiadás középpontjában olyan AI-ügynökök állnak, amelyek már…

Az Inworld új hangmodellje a beszéd természetes ritmusát utánozza
Az Inworld bemutatta a Realtime TTS-2 hangmodellt, amely a beszéd természetesnek ható részleteire épít, például a töltelékszavakra, a szünetekre és az önkorrekciókra. A…

Újjáépítette tömeges hívásindító rendszerét a Vapi
A Vapi újraépítette Campaigns szolgáltatását, amely egyetlen kampányban akár 10 000 kontakt automatikus felhívását kezeli. A rendszer személyre szabott hívásokat indít…

Global South nyelv került az Open ASR Leaderboardra
A Hugging Face 2026. augusztus 28-án közölte, hogy az Open ASR Leaderboard felvette első Global South nyelvét. A bejelentés az automatikus beszédfelismerési rendszerek…

Nyílt forrású eszközt adott ki a TTS-rendszerek összehasonlítására az Inworld
Az Inworld nyílt forrású eszköztárat mutatott be a szövegfelolvasó, vagyis TTS-rendszerek reprodukálható és részletes vizsgálatához. A keretrendszer hangmintákat készít…

Az ausztrálok bizalmatlanok a be nem jelentett Voice AI-jal szemben
Az ausztrál közönség egy kis létszámú pilotfelmérésben többnyire negatívan reagált a Voice AI használatára, különösen akkor, amikor a szintetikus hang jelenlétét nem…

A Daily bemutatta a PhoneLLM Alpha 1 hangügynök-modellt
A Daily kiadta a PhoneLLM Alpha 1-et, egy nyílt súlyú, telefonos hangügynökökhöz fejlesztett nyelvi modellt. A vállalat szerint a modell alacsonyabb költséggel és…

A Speechmatics Linden modellje elérhető a LiveKit Inference platformján
A Speechmatics Linden beszédfelismerő modellje elérhetővé vált a LiveKit Inference platformján, így a fejlesztők külön API-kulcs, fiók vagy számla nélkül válthatnak rá.…

A Google DeepMind bemutatta a Gemini 3.5 Transcribe beszédfelismerő modellt
A Google DeepMind 2026. augusztus 26-án bemutatta a Gemini 3.5 Transcribe modellt, amelyet pontos, intelligens, valós idejű beszédátírásra terveztek. A modell a Gemini…

A Pydantic AI ügynökei mostantól hangalapú beszélgetésre is képesek
A Pydantic AI realtime támogatással bővült, így a fejlesztők ugyanazokat a Python-alapú ügynököket hangalapú beszélgetésekhez is használhatják. A rendszer több…

A Vercel AI Gatewayre érkezett a Gemini 3.5 Transcribe
A Google Gemini 3.5 Transcribe már elérhető a Vercel AI Gateway szolgáltatásán keresztül rögzített és élő hanganyagok átírására. A modellek több mint 85 nyelvet képesek…

A Speechmatics szerint 20 másodperc alatt átír egyórányi hangot a Melia
A Speechmatics Melia beszédfelismerő modellje a cég szerint egyórányi hangfelvételt kevesebb mint 20 másodperc alatt ír át. Az Artificial Analysis független rangsorán…

A Vercel Connect már Linqon keresztül is küldhet üzeneteket
A Vercel Connect mostantól kezelt Linq-csatlakozót kínál, így az alkalmazások és ügynökök iMessage-en, RCS-en és SMS-ben is küldhetnek és fogadhatnak üzeneteket. A…

SOC 2 Type II tanúsítást szerzett a Murf AI
A Murf AI megszerezte a SOC 2 Type II tanúsítást, amely a vállalat szerint igazolja adatvédelmi és biztonsági gyakorlatainak következetes működését. A kapcsolódó…

EISA-díjat kapott a Samsung Galaxy Buds4 Pro
A Samsung Electronics 2026. augusztus 24-én bejelentette, hogy a Galaxy Buds4 Pro megkapta az EISA In-Ear Headphones 2026-2027 Award díjat. A vállalat szerint ez az első…

Terminálba költözteti az ElevenLabs API-t az új CLI v1
Az ElevenLabs 2026. augusztus 24-én bemutatta az ElevenLabs CLI v1-et, amely a vállalat API-ját közvetlenül a terminálból teszi használhatóvá. Az eszközt kifejezetten…

Másodperc alapú számlázásra vált a LiveKit több szolgáltatása
A LiveKit másodperc alapú számlázást vezetett be az agent munkamenetekre, a felvételekre, valamint a WebRTC- és SIP-kapcsolatokra. A módosítás minden csomagra és fiókra…

Hugging Face-blogposzt a beszédfelismerési benchmarkok méréséről
A Hugging Face 2026. augusztus 21-én közölt blogposztot „Measuring benchmark optimization in speech recognition” címmel. A bejegyzés az automatikus beszédfelismeréshez…

A Krisp a hívások mellé az ügyintézők képernyőjét is rögzíti
A Krisp új képernyőrögzítési funkcióval bővíti Speech Analytics szolgáltatását. A megoldás az aktív hívások alatt rögzíti az ügyintéző képernyőjét, majd a videót a…

Murf AI megszerezte az EU és az USA közötti adatvédelmi tanúsítást
A Murf AI tanúsítást szerzett az EU és az USA közötti adatvédelmi keretrendszerben, az EU, az Egyesült Királyság és Svájc felől érkező személyesadat-átadások…

A Murf szerint a jó AI-szinkron alapja a kontextusos fordítás
A Murf szerint az AI-szinkronizálás minőségét elsősorban a fordítás határozza meg, nem önmagában a hang természetessége. A vállalat saját benchmarkjében a Murf, a HeyGen…

Tanórai AI-asszisztenst mutatott be a Samsung interaktív kijelzőkhöz
A Samsung 2026. augusztus 19-én videóban mutatta be a Samsung AI Assistant oktatási funkcióit. A beépített alkalmazás kompatibilis, Android-alapú Samsung Interactive…