hang és beszéd

A beszédre optimalizált szöveg generálását kutatja a NAVER LABS Europe
A NAVER LABS Europe olyan nagy nyelvi modellek fejlesztését vizsgálja, amelyek közvetlenül beszédszintézishez alkalmas szöveget állítanak elő. A kutatók szerint a…

A Google szeptemberi AI újdonságai: Gemini 4 Argon és WeatherNext 3
A Google szeptemberben bemutatta a Gemini 4 Argon modellt, új hangalapú AI-eszközöket és a Gemini alkalmazáshoz kapcsolható szolgáltatásokat. A vállalat tudományos…

AWS-ről CoreWeave-re költözött a Tarteel, csökkentek a költségei
A Tarteel AI a Zeet segítségével AWS-ről CoreWeave-re költöztette teljes felhőinfrastruktúráját. A vállalat közlése szerint a váltás 22 százalékos késleltetésjavulást és…

Az Apple kutatása szerint a nyelvek felismerése javítja a beszédmodelleket
Az Apple kutatói szerint a többnyelvű, önfelügyelt beszédmodellek teljesítménye javítható, ha a tanítás során erősítik a nyelvek megkülönböztetésének képességét. Egy…

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

A Microsoft új, valós idejű átírómodellt és hangmodelleket mutatott be
A Microsoft bemutatta első folyamatos átírásra készült modelljét, a MAI-Transcribe-2-Streaminget, amely a cég szerint az Artificial Analysis rangsorában az első helyen…

C++-os mintákkal gyorsítaná a helyi AI-futtatást az NVIDIA
Az NVIDIA nyílt forráskódú C++-mintákat tett közzé helyi AI-alkalmazások fejlesztéséhez. A DIN Deploy az ONNX Runtime-ot és a TensorRT RTX végrehajtási szolgáltatót…

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható
Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi najdi és hidzsázi arab dialektusok felismerésére szabható. A vállalat…

A Vercel AI Gateway felületén elérhetők a Microsoft AI modelljei
A Vercel és a Microsoft AI együttműködésének köszönhetően három MAI hang- és beszédfeldolgozó modell érhető el az AI Gateway-en. A kínálat beszédgenerálásra, gyors…

A Suno Speech hangot és zenét generál egyetlen hangsávban
A Suno megnyitotta minden felhasználó előtt a Speech béta hozzáférését, amely beszélt hangot és eredeti háttérzenét állít elő egyetlen, összefüggő hangsávban. A vállalat…

A Microsoft szerint az AI új kapacitásokat teremthet az egészségügyben
A Microsoft szerint a mesterséges intelligencia az egészségügyben és az élettudományokban már a mindennapi munkafolyamatok része, és az egyszerű hatékonyságnövelésnél…

Az AWS több ügynökkel épített zenei gyártási folyamatot az AgentCore-ban
Az AWS bemutatott egy három ügynökre épülő zenei gyártási folyamatot, amely ugyanazon GPU-s infrastruktúrán oszt meg fájlokat és munkamenetet. A rendszer zenét generál…

Új Fire TV Stick 4K-val és távirányítóval bővít az Amazon
Az Amazon bemutatta az új Fire TV Stick 4K streamingeszközt és az áttervezett Fire TV Remote távirányítót. A vállalat szerint az új stick gyorsabban indítja el az…

Gyorsabb 4K streaming sticket és új távirányítót mutatott be az Amazon
Gyorsabb 4K-s streaming eszközzel és áttervezett távirányítóval bővül az Amazon Fire TV kínálata. A vállalat szerint az új Fire TV Stick 4K a bekapcsolástól a…

Nyílt ranglista indult a többnyelvű TTS-modellek mérésére
Az Open TTS Leaderboard nyílt értékelési platformként a többnyelvű szövegfelolvasó és hangklónozó modellek összehasonlítását teszi skálázhatóbbá. A Hugging Face blogján…

22 milliárd dollárra értékelték az ElevenLabsot
Az ElevenLabs 300 millió dolláros, dolgozói részvényeladási programot zárt le, amely 22 milliárd dollárra értékeli a hangalapú mesterséges intelligenciával foglalkozó…

Az Inworld AI felvásárolta a valós idejű hangügynököket fejlesztő Ultravoxot
Az Inworld AI felvásárolta az Ultravoxot, a valós idejű hangügynökök fejlesztésére használt platformot. Az Ultravox csapata az Inworldnél folytatja a platform…

22 milliárd dollárra értékelték az ElevenLabst
Az ElevenLabs 300 millió dolláros dolgozói tenderajánlatot zárt le, amely 22 milliárd dollárra értékelte a vállalatot. Ez kétszerese a februári Series D finanszírozási…

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp
A Krisp 265 valódi beszélgetésből álló tesztadatbázist készített a háttérben megszólaló hangok vizsgálatára. A felvételek irodákban, call centerekben és mozgó autókban…

Érzelmesebb beszédszintézist ígér az ElevenLabs új Eleven v4 modellje
Az ElevenLabs új szövegfelolvasó modellje, az Eleven v4 a cég szerint pontosabban kezeli a hangnemet, az érzelmet, a tempót és a beszédhelyzetet. A modell mellé érkezett…

A Picsart már a Grok Botból is képet, videót és hangot készít
A Picsart plugin megérkezett a Grok Botba, így a felhasználók egyetlen csevegésből kérhetnek képet, videót, hangalámondást, zenét és szerkesztést. A vállalat szerint a…

Gemini 3.8 Flash TTS és Flash-Lite: 29 nyelv és az ár választja el őket
A Gemini 3.8 Flash TTS és a Flash-Lite TTS ugyanazokat a hangkezelési és vezérlési lehetőségeket kínálja, a legfontosabb eltérés a nyelvi lefedettség és az ár. A Flash…

Bővíti az AI-ügynökök eszköztárát a Microsoft Azure
Új modellekkel, hangalapú ügynökökkel és hosszú ideig futó feladatok támogatásával bővíti a Microsoft Foundry képességeit a Microsoft. A vállalat szerint a fejlesztők…
Élő avatárt kapott a Gemini 3.8 Live
A Google DeepMind bemutatta a Gemini 3.8 Live with Live Avatar rendszert, amely valós idő közeli videógenerálással egészíti ki a hangalapú párbeszédet. A vállalat…