RayRoPE: új pozíciókódolást mutatott be az Apple a többnézetű modellekhez

Az Apple bemutatta a RayRoPE nevű pozíciókódolási módszert, amelyet többnézetű transzformerekhez terveztek. A kutatók szerint az eljárás javította az új nézetek szintézisét és a sztereó mélységbecslést, a CO3D adathalmazon pedig 15 százalékos relatív LPIPS-javulást értek el.
- Az Apple RayRoPE néven új pozíciókódolást mutatott be többnézetű transzformerekhez.
- A módszer a képpontokhoz tartozó sugarak mentén előre jelzett pontokat használ.
- A RayRoPE új nézetek szintézisén és sztereó mélységbecslésen javított a vizsgálatban.
- A CO3D adathalmazon 15 százalékos relatív LPIPS-javulást közöltek.
- A megoldás RGB-D bemenetet is képes pozíciókódolással kezelni.
A többnézetű figyelem térbeli problémája
Az Apple kutatási oldalán 2026 júliusában közzétett tanulmány olyan többnézetű transzformerekkel foglalkozik, amelyek több, ismert kamerabeállításból származó képen található tokeneket dolgoznak fel. A cél egy olyan pozíciókódolás kialakítása volt, amely egyedileg azonosítja a képpontokat, lehetővé teszi a többfrekvenciás hasonlóságot használó, SE(3)-invariáns figyelmet, és képes alkalmazkodni a jelenet geometriájához.
A szerzők szerint a korábbi abszolút és relatív kódolási megoldások nem teljesítették egyszerre ezeket a követelményeket. Az SE(3) a térbeli eltolásokkal és forgatásokkal szembeni invarianciára utal, vagyis a rendszer figyelme a jelenet térbeli elhelyezkedésének változása mellett is kezelheti a kapcsolatokat.
A RayRoPE sugarakból indul ki
A RayRoPE a képpontok pozícióját a hozzájuk tartozó látósugarak alapján reprezentálja. A módszer azonban a sugár iránya helyett egy, a sugár mentén előre jelzett pontot használ a geometriai szempontokat figyelembe vevő kódoláshoz.
A kutatás szerint a többnézetű figyelem SE(3)-invarianciáját a RayRoPE úgy éri el, hogy a hasonlóság kiszámításához leképezési, vagyis projektív koordinátákat határoz meg a lekérdezési képkockában. A megoldás a többfrekvenciás hasonlóságot is kezeli, így a pozíciókódolás a térbeli információt több frekvencián építi be a modell működésébe.
A sugár mentén előre jelzett háromdimenziós pont azonban pontatlan lehet. A szerzők ezért olyan eljárást is bemutatnak, amely bizonytalanság mellett analitikusan számítja ki a várható pozíciókódolást. Ez a megközelítés a kutatás leírása szerint közvetlenül kezeli azt a helyzetet, amikor a becsült pont nem tekinthető teljesen megbízhatónak.
Két feladaton tesztelték a módszert
A kutatók a RayRoPE-t új nézetek szintézisén és sztereó mélységbecslésen értékelték. A tanulmány szerint a módszer mindkét feladaton következetesen jobb eredményeket adott más pozíciókódolási sémáknál.
A CO3D adathalmazon az Apple közlése 15 százalékos relatív javulást emel ki az LPIPS mérőszámon. A tanulmány azt is állítja, hogy a RayRoPE zökkenőmentesen képes RGB-D bemenetet, vagyis színes képet és mélységinformációt tartalmazó adatot kezelni.
Ez a képesség a kutatók szerint még nagyobb előnyt hozott azokkal az alternatív módszerekkel szemben, amelyek nem tudják ezt az információt pozíciókódolással beépíteni. A RayRoPE így a több kameranézetből dolgozó rendszerekben a képpontok térbeli kapcsolatainak leírását célozza, miközben a becslési bizonytalanságot és a mélységi adatokat is figyelembe veszi.


