multimodális AI

Sok javítást kapott a Midjourney alpha felülete
A Midjourney 2026. augusztus 21-én közzétett changelogban számolt be az alpha.midjourney.com felület legújabb javításairól. A cég szerint az elmúlt két hétben…

A Google szerint a mobilitási adatok jobb helyismeretet adhatnak az AI-modelleknek
A Google Research 2026. augusztus 21-én mutatta be a Mobility-Embedded POIs, röviden ME-POIs nevű keretrendszert. A megközelítés nyelvi modellek helyreprezentációit…

Képfeldolgozással bővült a DeepSeek V4 Flash a Vercel AI Gateway-en
A Vercel AI Gateway-en elérhetővé vált a DeepSeek V4 Flash Vision Experimental, amely szöveges kérések mellett képeket is fogad. A kísérleti modell képleírásra…

Augusztus 27-én új Galaxy S26 családtagot mutat be a Samsung
A Samsung Electronics 2026. augusztus 20-án jelentette be, hogy augusztus 27-én megtartja a Galaxy Event August 2026 eseményt. A vállalat a Galaxy S26 család legújabb…

Apple módszert dolgozott ki az optimális tanítási adatkeverékhez
Az Apple kutatói olyan módszert mutattak be, amely skálázási törvényekkel becsüli meg a nagy mesterségesintelligencia-modellekhez használható optimális tanítási…

Az Apple olcsóbb módszert mutatott be multimodális modellek tanítására
Az Apple kutatói bemutatták a MixAtlas nevű keretrendszert, amely kisebb proxy modellek segítségével optimalizálja a multimodális nagy nyelvi modellek tanításához…

Az NVIDIA FLARE a többhelyszínes multimodális AI-tanítást célozza
Az NVIDIA Developer 2026. augusztus 19-én ismertette, hogyan használható az NVIDIA FLARE federált multimodális AI-munkafolyamatokhoz. A cikk fő témája, hogy a különböző…

A Jetson Thoron futó Cosmos 3 Edge robotvezérlést mutatott be az NVIDIA
Az NVIDIA Developer 2026. augusztus 19-én ismertette, hogyan tanítható tovább a Cosmos 3 Edge helyben futó robotmanipulációs irányításra. A cég szerint a 4B méretű…

Az Apple és a Google korábbi kutatási vezetője a Wayve Labshez igazol
Alex Toshev, az Apple és a Google korábbi kutatási vezetője csatlakozott a Wayve Labshez. A szakember egy olyan új csapatot épít, amely általános robotikai…

A Pika egyetlen modellben egyesíti a dalszöveg, a hang és a zenei referencia használatát
A Pika bemutatta a Pika Music nevű zene-generáló modellt, amely egyetlen munkafolyamatban képes szöveges leírásból, kész dalszövegből, hangreferenciából vagy meglévő…

A Picsarton elérhető a WAN 3.0, akár 30 másodperces videókkal
Elérhetővé vált a Picsarton az Alibaba WAN AI videómodell-családjának új tagja, a WAN 3.0. A modell egyetlen, vágás nélküli, legfeljebb 30 másodperces videoklipet…

Okostelefonos fotókból becsülné az inzulinrezisztencia kockázatát a Google Research
A Google Research 2026. augusztus 17-én mutatta be a PhotoScan nevű kutatási mélytanulási keretrendszert. A módszer okostelefonos fotókból becsül testösszetételi…

A Higgsfieldre érkezett a MiniMax Hailuo 3.0 videógenerátor
Elérhetővé vált a Higgsfielden a MiniMax Hailuo 3.0, amely a szolgáltatás szerint 2K felbontású, legfeljebb 15 másodperces videókat készít natív hanggal. A modell…

Az LTX-2.5 automatikus HDR-videókonverziót ígér
Az LTX blogbejegyzése az LTX-2.5 automatikus SDR-ből HDR-videóvá alakítását mutatja be. A 2026. augusztus 16-án közzétett oldal azonban a megadott szövegben nem közöl…

A LanceDB egy táblába szervezi a multimodális adatok jellemzőit
A LanceDB új, Geneva nevű feature engineering csomagja egyetlen táblában kezeli a multimodális adatok nyers tartalmát, a belőlük számított jellemzőket és a…

Samsung: alapmodellek segíthetik a viselhető eszközök egészségügyi AI-ját
A Samsung 2026. augusztus 14-én ismertette a Samsung Research America Digital Health Team két egészségügyi alapmodelljét, az xMAE-t és a HiMAE-t. A modellek viselhető…

A Harvey már hangot, videót és képeket is elemez a jogi munkában
A Harvey mostantól hang- és videofájlokat is átír, valamint képeket, diagramokat és grafikonokat elemez. A jogi platform így a szöveges dokumentumok mellett a…

A Flux 3 egy menetben készíti el a videót és a hangot
A Black Forest Labs Flux 3 modellje egyetlen generálási menetben készíti el a videót és a hozzá tartozó hangot. A Picsartban elérhető rendszer legfeljebb 20 másodperces…

WAN 3.0 és WAN 2.7: hosszabb videó vagy nagyobb felbontás
Az Alibaba WAN videógeneráló modellcsaládjának újabb tagja, a WAN 3.0 egyetlen, folyamatos felvételben akár 30 másodpercet is létrehoz. A WAN 2.7 továbbra is a…

Londonban próbálta ki a Samsung a Galaxy Z Fold8 és Flip8 kameráit
A Samsung Electronics 2026. augusztus 13-án közölt londoni bemutatóanyagot a Galaxy Z Fold8 Ultra, a Galaxy Z Fold8 és a Galaxy Z Flip8 kameraképességeiről. A vállalat a…

15 ezer Ray-Ban Meta szemüveget adományoz a Meta a Vision Irelandnek
A Meta 2026. augusztus 13-án bejelentette, hogy 15 ezer Ray-Ban Meta szemüveget adományoz a Vision Irelandnek, Írország nemzeti látássérültügyi jótékonysági…

Az Apple kutatói olcsóbbá tennék a gépi tanulási modellek törlését
Az Apple kutatói olyan módszert mutattak be, amely a gépi tanulási modellekből eltávolítandó adatok közül először kiszűri a csekély hatású pontokat. A kutatásban…

Wan3.0: hosszabb videók és dokumentumalapú referencia az Alibaba Cloudtól
Az Alibaba Cloud Wan3.0 modellje egy generálással legfeljebb 30 másodperces videót készít, és a szöveg, kép, videó és hang mellett dokumentumokat, táblázatokat…

A Moonshot bemutatta a 2,8 billió paraméteres Kimi K3 modellt
A Moonshot AI kiadta a Kimi K3-at, amely a Firecrawl szerint 2,8 billió paraméterével 2026 augusztusában a legnagyobb nyílt súlyú modell. A rendszer szöveget, képet és…