hang és beszéd

Bemutatkozott az iPhone 18 Pro változó rekeszű kamerával és A20 Pro chippel
Az Apple 2026. szeptember 9-én bemutatta az iPhone 18 Pro és iPhone 18 Pro Max modelleket. Az új Pro készülékek fő újdonságai a változó rekeszű 48MP Fusion Main kamera…

Mind a hat Krisp-kihívást továbbviszi az amerikai szabadalmi hivatal
Az amerikai szabadalmi hivatal, az USPTO mind a hat, Krisp által benyújtott szabadalmi kifogás ügyében engedélyezte az eljárás folytatását. A beadványok a Sanas által a…

Az Adyen korábbi pénzügyi vezetője lett az ElevenLabs CFO-ja
Az ElevenLabs 2026. szeptember 8-án bejelentette, hogy Ethan Tandowsky csatlakozott a vállalathoz pénzügyi vezérigazgató-helyettesként, vagyis CFO-ként. Tandowsky…

Tizen 10.0 frissítést kapnak egyes Samsung hűtők és mosógépek
A Samsung Electronics 2026. szeptember 7-én jelentette be, hogy szeptembertől Tizen OS 10.0 frissítést ad ki egyes hűtőkhöz és mosógépekhez. A csomag a legújabb Bixbyt…

A Microsoft bemutatta a MAI-Transcribe-2 beszédfelismerő modellt
A Microsoft 2026. szeptember 3-án bemutatta a MAI-Transcribe-2 beszédfelismerő és átíró modellt. A vállalat szerint ez az eddigi legerősebb transzkripciós modellje…

A Claude-ból kreatív stúdiót csinál a Higgsfield MCP-kapcsolata
A Higgsfield MCP-kapcsolata közvetlen hozzáférést ad a Claude számára a szolgáltatás kreatív eszközeihez. A felhasználók egyetlen beszélgetésből képeket, videókat és…

Alexa for Shopping ellenőrzi, valóban az Amazontól jött-e egy üzenet
Az Amazon 2026. szeptember 2-án bejelentette, hogy az Egyesült Államokban az Alexa for Shopping már üzenetek, e-mailek, telefonhívások és SMS-ek eredetét is ellenőrzi. A…

A LiveKit külön tesztkörnyezetet ad a hangügynökök mellé
A LiveKit új non-production deployment funkciója lehetővé teszi, hogy a hangügynökök módosításait ugyanazon infrastruktúrán, az éles verzió mellett lehessen kipróbálni.…
Google: augusztusban jött a Gemini 3.7 Flash és a Pixel 11 sorozat
A Google 2026. szeptember 1-jén összefoglalta augusztusi AI-bejelentéseit. A lista új Gemini-modelleket, Pixel 11 készülékeket, oktatási funkciókat, videógenerálást és…

2026-ban már a videók többségéhez felirat készül
2026-ban a videók többsége már felirattal készül a Kapwing platformján, miközben az amerikai nézők több mint fele legalább időnként bekapcsolja a feliratokat. A…

A vLLM szerint valós időben készülhet el a MiniMax H3 videója
A vLLM bemutatta, hogyan gyorsította fel a MiniMax H3 kiszolgálását teljes rendszeroptimalizálással és a FastVideo négy lépéses FastH3 eljárásával. A tesztben egy 10,125…

A LiveKit Connectors WhatsAppra és Twilióra viszi a hangügynököket
A LiveKit Connectors közvetlen kapcsolatot teremt a LiveKit-szobák és a Twilio Programmable Voice, valamint a WhatsApp Business Calling között. A vállalat szerint így a…

A Speechmatics Melia 1 modellje javította a többnyelvű átírást
A Speechmatics szerint Melia 1 beszédfelismerő modellje vezeti a tesztelt rendszerek mezőnyét az arab, mandarin és tamil nyelv közötti váltások felismerésében. Arab és…

A Salesforce Winter ’27 az AI-ügynökökre bízná a teljes vállalati munkafolyamatokat
A Salesforce 2026. augusztus 31-én mutatta be a Winter ’27 Release fő újdonságait. A vállalat szerint a kiadás középpontjában olyan AI-ügynökök állnak, amelyek már…

Az Inworld új hangmodellje a beszéd természetes ritmusát utánozza
Az Inworld bemutatta a Realtime TTS-2 hangmodellt, amely a beszéd természetesnek ható részleteire épít, például a töltelékszavakra, a szünetekre és az önkorrekciókra. A…

Újjáépítette tömeges hívásindító rendszerét a Vapi
A Vapi újraépítette Campaigns szolgáltatását, amely egyetlen kampányban akár 10 000 kontakt automatikus felhívását kezeli. A rendszer személyre szabott hívásokat indít…

Global South nyelv került az Open ASR Leaderboardra
A Hugging Face 2026. augusztus 28-án közölte, hogy az Open ASR Leaderboard felvette első Global South nyelvét. A bejelentés az automatikus beszédfelismerési rendszerek…

Nyílt forrású eszközt adott ki a TTS-rendszerek összehasonlítására az Inworld
Az Inworld nyílt forrású eszköztárat mutatott be a szövegfelolvasó, vagyis TTS-rendszerek reprodukálható és részletes vizsgálatához. A keretrendszer hangmintákat készít…

Az ausztrálok bizalmatlanok a be nem jelentett Voice AI-jal szemben
Az ausztrál közönség egy kis létszámú pilotfelmérésben többnyire negatívan reagált a Voice AI használatára, különösen akkor, amikor a szintetikus hang jelenlétét nem…

A Daily bemutatta a PhoneLLM Alpha 1 hangügynök-modellt
A Daily kiadta a PhoneLLM Alpha 1-et, egy nyílt súlyú, telefonos hangügynökökhöz fejlesztett nyelvi modellt. A vállalat szerint a modell alacsonyabb költséggel és…

A Speechmatics Linden modellje elérhető a LiveKit Inference platformján
A Speechmatics Linden beszédfelismerő modellje elérhetővé vált a LiveKit Inference platformján, így a fejlesztők külön API-kulcs, fiók vagy számla nélkül válthatnak rá.…

A Google DeepMind bemutatta a Gemini 3.5 Transcribe beszédfelismerő modellt
A Google DeepMind 2026. augusztus 26-án bemutatta a Gemini 3.5 Transcribe modellt, amelyet pontos, intelligens, valós idejű beszédátírásra terveztek. A modell a Gemini…

A Pydantic AI ügynökei mostantól hangalapú beszélgetésre is képesek
A Pydantic AI realtime támogatással bővült, így a fejlesztők ugyanazokat a Python-alapú ügynököket hangalapú beszélgetésekhez is használhatják. A rendszer több…

A Vercel AI Gatewayre érkezett a Gemini 3.5 Transcribe
A Google Gemini 3.5 Transcribe már elérhető a Vercel AI Gateway szolgáltatásán keresztül rögzített és élő hanganyagok átírására. A modellek több mint 85 nyelvet képesek…