multimodális AI

A GPT-6 Astra videókat is elemezhet, ha képkockákra bontják
A GPT-6 Astra API-ja közvetlenül nem fogad videófájlokat, a Roboflow azonban időbélyeges képkockák sorozatával tesztelte videóelemzési képességeit. A modell strukturált…
Termékek és eszközökA Devin már saját munkáját is teszteli a GPT-6 Astrával
A Cognition a GPT-6 Astrát használja arra, hogy a Devin ellenőrizze saját munkáját, és a tesztek eredményeit felvétellel, valamint jelentéssel is bemutassa. A vállalat…

Apple-kutatás segítene olcsóbban annotálni a jelnyelvi videókat
A jelnyelvi értelmezést támogató AI-rendszerek egyik fő akadálya a jó minőségű, annotált adat hiánya. Az Apple kutatói olyan eljárást dolgoztak ki, amely jelnyelvi…

Az Apple kiegyensúlyozott RL-keretet mutatott be képaláíráshoz
A BalCapRL nevű Apple-kutatás arra ad választ, hogyan lehet a multimodális nagy nyelvi modellek képaláírásait egyszerre pontosabbá, hasznosabbá és nyelvileg jobbá tenni.…

Szeptember 12-én indul az iPhone 18 Pro előrendelése
Szombaton megnyílik az iPhone 18 Pro és az iPhone 18 Pro Max előrendelése az Apple weboldalán és az Apple Store alkalmazásban. Az Apple új órákat, AirPods 5-öt, valamint…

Az Apple új módszert mutatott be szövegből hanggal kiegészített videókhoz
Az Apple kutatói olyan módszert mutattak be, amely a szövegből videót és az ahhoz szinkronizált hangot generáló rendszerek szöveges vezérlését javítja. A…

Az IVADO rövid AI- és idegtudományi projekteket finanszíroz
Az IVADO AI- és Idegtudományi Kutatási Klasztere meghirdette első részvételi felhívását. A Neuro-Sprint rövid távú kutatási projekteket támogat, amelyek mesterséges…
Termékek és eszközökA Sierra multimodális ügynökei beszélgetés közben váltanak hang, szöveg és kép között
A Sierra olyan multimodális AI-ügynököket mutatott be, amelyek egyetlen beszélgetésen belül hanggal, szöveggel és vizuális elemekkel is képesek dolgozni. A vállalat…

A Snowflake AI-rendszere a számlák feldolgozását automatizálja
A Snowflake bemutatta az InvoiceIQ nevű, belső használatra fejlesztett számlafeldolgozó rendszert. Az alkalmazás a dokumentumértelmezést vállalati adatokkal, üzleti…

A Cohere bemutatta a North Small Translate fordítómodellt
A Cohere 2026. szeptember 10-én bejelentette a North Small Translate nevű gépi fordítómodellt. A vállalat szerint a mixture-of-experts architektúrájú modell 50-nél több…

Képfeldolgozással bővült a DeepSeek V4 Flash a Novita AI-on
A Novita AI elérhetővé tette a DeepSeek V4 Flash Vision Exp modellt, amely a DeepSeek V4 Flash 0731 szöveges képességei mellé képbemenetet kínál. A kísérleti változat…

Az NVIDIA szerint akár 7-szer gyorsítható a multimodális kiszolgálás EPD-vel
Az NVIDIA Developer 2026. szeptember 9-én ismertette, mikor érdemes encode-prefill-decode, azaz EPD szétválasztást használni multimodális modellek kiszolgálásához. A cég…

Stabil lett a Lance 2.1, a Netflixszel fejleszt az LanceDB
Stabil lett a Lance File Format 2.1, miközben a LanceDB új szemantikus művészeti keresőt mutatott be, és a Netflixszel közös fejlesztésekről készül beszélni. A vállalat…

GPT Image 2.5: gyorsabb lett, pontosabban szerkeszt képeket
Az OpenAI GPT Image 2.5 két változatban érkezett, amelyek a sebesség és a képminőség között kínálnak választási lehetőséget. A fejlesztés főként a képszerkesztésben hoz…

Az NVIDIA valós idejű AI-eszközöket jelentett be médiacégeknek az IBC-n
Az NVIDIA a 2026. szeptember 11. és 14. között Amszterdamban zajló IBC konferencián jelentette be az NVIDIA AI for Media jelentős bővítését. A vállalat valós idejű…

Google DeepMind AI-val idézett fel egy sosem rögzített 70 éves emléket
A Google 2026. szeptember 9-én mutatta be, hogyan készült a Love, Rendered című rövid dokumentumfilm, amelyben AI segítségével alkották újra Burt és Ethelle Shatz egyik…

A Lyria 3.5 teljes dalokat ír, nem csak zenei loopokat
A Lyria 3.5 teljes, néhány perces dalokat készít egyetlen szöveges vagy képi prompt alapján. A Google DeepMind modellje a dalszöveget és az éneket alapértelmezés szerint…

AI-alapú szájszinkront vezet be a Prime Video a Maxton Hallhoz
A Prime Video 2026. szeptember 9-én jelentette be új szájszinkron-technológiáját, amely a szinkronizált hanghoz igazítja a szereplők szájmozgását. A funkció a Maxton…

Bemutatkozott az Apple első hajlítható iPhone-ja, az iPhone Duo
Az Apple 2026. szeptember 9-én bemutatta az iPhone Duót, a vállalat első hajlítható iPhone-ját. A készülék 7,6 hüvelykes belső és 5,4 hüvelykes külső kijelzőt kapott, az…

Bemutatkozott az AirPods 5 nyitott kialakítású aktív zajszűréssel
Az Apple 2026. szeptember 9-én bemutatta az AirPods 5-öt, amely a cég szerint kategóriaelső aktív zajszűrést kínál nyitott kialakításban. Az új fülhallgató jobb…

Bemutatkozott az iPhone 18 Pro változó rekeszű kamerával és A20 Pro chippel
Az Apple 2026. szeptember 9-én bemutatta az iPhone 18 Pro és iPhone 18 Pro Max modelleket. Az új Pro készülékek fő újdonságai a változó rekeszű 48MP Fusion Main kamera…

Képfeldolgozással érkezett a DeepSeek V4.1 Flash a Vercel AI Gatewaybe
Elérhetővé vált a DeepSeek V4.1 Flash a Vercel AI Gateway szolgáltatásában, natív képfeldolgozással és egymillió tokenes kontextusablakkal. A modell szöveget és képeket…

A Novita AI-ra érkezett a Ling-3.0-Flash-VL multimodális modell
A Novita AI szerver nélküli végpontként kínálja a Ling-3.0-Flash-VL multimodális modellt, amely egyetlen API-munkafolyamatban kezel szöveges, képi és videós bemenetet. A…
ModellekMegjelent a ChatGPT Images 2.5 gyorsabb generálással és pontosabb szerkesztéssel
Az OpenAI 2026. szeptember 8-án bemutatta a ChatGPT Images 2.5 képmodellt. A vállalat szerint az új rendszer élesebb részleteket, pontosabb szerkesztést és akár 50…