Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

hang és beszéd

A beszédre optimalizált szöveg generálását kutatja a NAVER LABS Europe
Kutatás2026. október 4.

A beszédre optimalizált szöveg generálását kutatja a NAVER LABS Europe

A NAVER LABS Europe olyan nagy nyelvi modellek fejlesztését vizsgálja, amelyek közvetlenül beszédszintézishez alkalmas szöveget állítanak elő. A kutatók szerint a…

A Google szeptemberi AI újdonságai: Gemini 4 Argon és WeatherNext 3
Modellek2026. október 2.

A Google szeptemberi AI újdonságai: Gemini 4 Argon és WeatherNext 3

A Google szeptemberben bemutatta a Gemini 4 Argon modellt, új hangalapú AI-eszközöket és a Gemini alkalmazáshoz kapcsolható szolgáltatásokat. A vállalat tudományos…

AWS-ről CoreWeave-re költözött a Tarteel, csökkentek a költségei
Cégek és üzlet2026. október 2.

AWS-ről CoreWeave-re költözött a Tarteel, csökkentek a költségei

A Tarteel AI a Zeet segítségével AWS-ről CoreWeave-re költöztette teljes felhőinfrastruktúráját. A vállalat közlése szerint a váltás 22 százalékos késleltetésjavulást és…

Az Apple kutatása szerint a nyelvek felismerése javítja a beszédmodelleket
Kutatás2026. október 2.

Az Apple kutatása szerint a nyelvek felismerése javítja a beszédmodelleket

Az Apple kutatói szerint a többnyelvű, önfelügyelt beszédmodellek teljesítménye javítható, ha a tanítás során erősítik a nyelvek megkülönböztetésének képességét. Egy…

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

A Microsoft új, valós idejű átírómodellt és hangmodelleket mutatott be
Modellek2026. október 1.

A Microsoft új, valós idejű átírómodellt és hangmodelleket mutatott be

A Microsoft bemutatta első folyamatos átírásra készült modelljét, a MAI-Transcribe-2-Streaminget, amely a cég szerint az Artificial Analysis rangsorában az első helyen…

C++-os mintákkal gyorsítaná a helyi AI-futtatást az NVIDIA
Fejlesztőknek2026. október 1.

C++-os mintákkal gyorsítaná a helyi AI-futtatást az NVIDIA

Az NVIDIA nyílt forráskódú C++-mintákat tett közzé helyi AI-alkalmazások fejlesztéséhez. A DIN Deploy az ONNX Runtime-ot és a TensorRT RTX végrehajtási szolgáltatót…

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható
Kutatás2026. október 1.

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi najdi és hidzsázi arab dialektusok felismerésére szabható. A vállalat…

A Vercel AI Gateway felületén elérhetők a Microsoft AI modelljei
Termékek és eszközök2026. október 1.

A Vercel AI Gateway felületén elérhetők a Microsoft AI modelljei

A Vercel és a Microsoft AI együttműködésének köszönhetően három MAI hang- és beszédfeldolgozó modell érhető el az AI Gateway-en. A kínálat beszédgenerálásra, gyors…

A Suno Speech hangot és zenét generál egyetlen hangsávban
Termékek és eszközök2026. október 1.

A Suno Speech hangot és zenét generál egyetlen hangsávban

A Suno megnyitotta minden felhasználó előtt a Speech béta hozzáférését, amely beszélt hangot és eredeti háttérzenét állít elő egyetlen, összefüggő hangsávban. A vállalat…

A Microsoft szerint az AI új kapacitásokat teremthet az egészségügyben
Termékek és eszközök2026. szeptember 30.

A Microsoft szerint az AI új kapacitásokat teremthet az egészségügyben

A Microsoft szerint a mesterséges intelligencia az egészségügyben és az élettudományokban már a mindennapi munkafolyamatok része, és az egyszerű hatékonyságnövelésnél…

Az AWS több ügynökkel épített zenei gyártási folyamatot az AgentCore-ban
Termékek és eszközök2026. szeptember 30.

Az AWS több ügynökkel épített zenei gyártási folyamatot az AgentCore-ban

Az AWS bemutatott egy három ügynökre épülő zenei gyártási folyamatot, amely ugyanazon GPU-s infrastruktúrán oszt meg fájlokat és munkamenetet. A rendszer zenét generál…

Új Fire TV Stick 4K-val és távirányítóval bővít az Amazon
Termékek és eszközök2026. szeptember 30.

Új Fire TV Stick 4K-val és távirányítóval bővít az Amazon

Az Amazon bemutatta az új Fire TV Stick 4K streamingeszközt és az áttervezett Fire TV Remote távirányítót. A vállalat szerint az új stick gyorsabban indítja el az…

Gyorsabb 4K streaming sticket és új távirányítót mutatott be az Amazon
Termékek és eszközök2026. szeptember 30.

Gyorsabb 4K streaming sticket és új távirányítót mutatott be az Amazon

Gyorsabb 4K-s streaming eszközzel és áttervezett távirányítóval bővül az Amazon Fire TV kínálata. A vállalat szerint az új Fire TV Stick 4K a bekapcsolástól a…

Nyílt ranglista indult a többnyelvű TTS-modellek mérésére
Kutatás2026. szeptember 30.

Nyílt ranglista indult a többnyelvű TTS-modellek mérésére

Az Open TTS Leaderboard nyílt értékelési platformként a többnyelvű szövegfelolvasó és hangklónozó modellek összehasonlítását teszi skálázhatóbbá. A Hugging Face blogján…

22 milliárd dollárra értékelték az ElevenLabsot
Cégek és üzlet2026. szeptember 30.

22 milliárd dollárra értékelték az ElevenLabsot

Az ElevenLabs 300 millió dolláros, dolgozói részvényeladási programot zárt le, amely 22 milliárd dollárra értékeli a hangalapú mesterséges intelligenciával foglalkozó…

Az Inworld AI felvásárolta a valós idejű hangügynököket fejlesztő Ultravoxot
Cégek és üzlet2026. szeptember 30.

Az Inworld AI felvásárolta a valós idejű hangügynököket fejlesztő Ultravoxot

Az Inworld AI felvásárolta az Ultravoxot, a valós idejű hangügynökök fejlesztésére használt platformot. Az Ultravox csapata az Inworldnél folytatja a platform…

22 milliárd dollárra értékelték az ElevenLabst
Cégek és üzlet2026. szeptember 30.

22 milliárd dollárra értékelték az ElevenLabst

Az ElevenLabs 300 millió dolláros dolgozói tenderajánlatot zárt le, amely 22 milliárd dollárra értékelte a vállalatot. Ez kétszerese a februári Series D finanszírozási…

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp
Kutatás2026. szeptember 28.

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp

A Krisp 265 valódi beszélgetésből álló tesztadatbázist készített a háttérben megszólaló hangok vizsgálatára. A felvételek irodákban, call centerekben és mozgó autókban…

Érzelmesebb beszédszintézist ígér az ElevenLabs új Eleven v4 modellje
Modellek2026. szeptember 28.

Érzelmesebb beszédszintézist ígér az ElevenLabs új Eleven v4 modellje

Az ElevenLabs új szövegfelolvasó modellje, az Eleven v4 a cég szerint pontosabban kezeli a hangnemet, az érzelmet, a tempót és a beszédhelyzetet. A modell mellé érkezett…

A Picsart már a Grok Botból is képet, videót és hangot készít
Termékek és eszközök2026. szeptember 25.

A Picsart már a Grok Botból is képet, videót és hangot készít

A Picsart plugin megérkezett a Grok Botba, így a felhasználók egyetlen csevegésből kérhetnek képet, videót, hangalámondást, zenét és szerkesztést. A vállalat szerint a…

Gemini 3.8 Flash TTS és Flash-Lite: 29 nyelv és az ár választja el őket
Modellek2026. szeptember 25.

Gemini 3.8 Flash TTS és Flash-Lite: 29 nyelv és az ár választja el őket

A Gemini 3.8 Flash TTS és a Flash-Lite TTS ugyanazokat a hangkezelési és vezérlési lehetőségeket kínálja, a legfontosabb eltérés a nyelvi lefedettség és az ár. A Flash…

Bővíti az AI-ügynökök eszköztárát a Microsoft Azure
Termékek és eszközök2026. szeptember 24.

Bővíti az AI-ügynökök eszköztárát a Microsoft Azure

Új modellekkel, hangalapú ügynökökkel és hosszú ideig futó feladatok támogatásával bővíti a Microsoft Foundry képességeit a Microsoft. A vállalat szerint a fejlesztők…

Élő avatárt kapott a Gemini 3.8 Live
Termékek és eszközök2026. szeptember 24.

Élő avatárt kapott a Gemini 3.8 Live

A Google DeepMind bemutatta a Gemini 3.8 Live with Live Avatar rendszert, amely valós idő közeli videógenerálással egészíti ki a hangalapú párbeszédet. A vállalat…

1234