multimodális AI
A Convai AI-karaktere már tudja, melyik tárgyra néz a játékos
A Convai Object in Attention funkciója lehetővé teszi, hogy a felhasználó egy virtuális világ tárgyára nézve kérdezzen annak megnevezése nélkül. A rendszer a tekintet…

Az Apple új benchmarkkal méri a hosszú videók összefoglalását
Az Apple bemutatta az LVSum nevű benchmarkot, amely azt vizsgálja, mennyire pontosan foglalják össze a multimodális nagy nyelvi modellek a hosszú videókat. A rendszer…

Az Apple új tesztje a videós történetek megértését vizsgálja
Az Apple kutatói bemutatták a NarrativeTrack nevű benchmarkot, amely a multimodális nagy nyelvi modellek videós történetmegértését méri. A rendszer azt vizsgálja, hogy a…

A Seedance 2.5 egyetlen menetben készít 30 másodperces videókat
A ByteDance Seedance 2.5 egyetlen utasításból akár 30 másodperces, legfeljebb 4K felbontású videókat generál, natív hangszinkronnal. A modell hamarosan elérhető lesz a…

Új módszer mutatja meg, valóban érti-e a videót egy AI-modell
Az Apple kutatói olyan értékelési módszert mutattak be, amely különválasztja a videós nyelvi modellek tudásalapú, képi és valódi időbeli következtetési képességeit. A…

A Krea kínálatában elindult a ByteDance Seedream 5.0 Pro modellje
A Krea elérhetővé tette a ByteDance Seedream 5.0 Pro képgeneráló és képszerkesztő modelljét. A rendszer szövegből, egyetlen képből vagy több referenciából is képes…

RayRoPE: új pozíciókódolást mutatott be az Apple a többnézetű modellekhez
Az Apple bemutatta a RayRoPE nevű pozíciókódolási módszert, amelyet többnézetű transzformerekhez terveztek. A kutatók szerint az eljárás javította az új nézetek…

Az Apple kutatói képpel és szöveggel is vezérelhető szegmentáló modellt mutattak be
Az Apple kutatói a COSINE nevű, nyílt világú képszegmentáló modellt mutatták be, amely képeket és szöveget is használhat bemenetként. A rendszer az eltérő szegmentálási…