ECCV

Az Apple új módszert mutatott be szövegből hanggal kiegészített videókhoz
Az Apple kutatói olyan módszert mutattak be, amely a szövegből videót és az ahhoz szinkronizált hangot generáló rendszerek szöveges vezérlését javítja. A…

Adatok nélkül tanítana össze több AI-modellt a NAVER LABS Europe módszere
A NAVER LABS Europe olyan módszert mutatott be, amely több, úgynevezett tanármodell tudását egyetlen diákmodellbe sűríti valódi tanítóadatok használata nélkül. Az IDeaL…

A patchenkénti skalár gyorsabb robotnavigációt tehet lehetővé
A NAVER LABS Europe nagyszabású vizsgálatban elemezte, milyen vizuális információkra van szüksége egy gyorsan mozgó robotnak a valós környezetben végzett navigációhoz. A…

Syn4D: új szintetikus adatkészlet segítheti a dinamikus 3D-s kutatásokat
A NAVER LABS Europe bemutatta a Syn4D nevű, dinamikus jelenetekhez készült multinézetű szintetikus 4D-adatkészletet. A kutatók szerint az adatbázis a 3D-s rekonstrukció…

Új módszert javasolnak a különböző látási modellek összevonására
A NAVER LABS Europe olyan feladatalapú közelítő módszert mutatott be, amely felgyorsíthatja a több, különböző látási feladatra finomhangolt modell összehangolását. A…

Whareformer: így követi a robot szemszögéből eltűnő tárgyakat
A NAVER LABS Europe bemutatta a Whareformer nevű, transzformer-alapú modellt, amely hosszú, viselői nézőpontból rögzített videókban követi a tárgyakat akkor is, ha azok…

Diffúziós támadások fedhetik fel a védett vizuális helymeghatározás adatait
A NAVER LABS Europe kutatása szerint a vizuális helymeghatározás adatvédelmi célú reprezentációiból diffúziós modellekkel érzékeny információk rekonstruálhatók. A…

A NAVER LABS Europe új módszere képekből gyorsítja a 3D rekonstrukciót
A NAVER LABS Europe bemutatta a BLASt3R nevű módszert, amely többnézetű képegyeztetést és egyképes becsléseket használ a 3D rekonstrukció és a robotok vizuális…

SPAR3S: hiányos képekből egészíti ki a 3D jeleneteket a NAVER új modellje
A NAVER LABS Europe kutatói SPAR3S néven olyan 3D generatív modellt mutattak be, amely kevés, szabadon rögzített kameranézetből egészíti ki a hiányzó jelenetrészeket. A…

Az Apple új tesztje a videós történetek megértését vizsgálja
Az Apple kutatói bemutatták a NarrativeTrack nevű benchmarkot, amely a multimodális nagy nyelvi modellek videós történetmegértését méri. A rendszer azt vizsgálja, hogy a…

RayRoPE: új pozíciókódolást mutatott be az Apple a többnézetű modellekhez
Az Apple bemutatta a RayRoPE nevű pozíciókódolási módszert, amelyet többnézetű transzformerekhez terveztek. A kutatók szerint az eljárás javította az új nézetek…