Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

RayRoPE: új pozíciókódolást mutatott be az Apple a többnézetű modellekhez

2026. július 6.Forrás: Apple
RayRoPE: új pozíciókódolást mutatott be az Apple a többnézetű modellekhez
Kép: Apple

Az Apple bemutatta a RayRoPE nevű pozíciókódolási módszert, amelyet többnézetű transzformerekhez terveztek. A kutatók szerint az eljárás javította az új nézetek szintézisét és a sztereó mélységbecslést, a CO3D adathalmazon pedig 15 százalékos relatív LPIPS-javulást értek el.

A lényeg röviden
  • Az Apple RayRoPE néven új pozíciókódolást mutatott be többnézetű transzformerekhez.
  • A módszer a képpontokhoz tartozó sugarak mentén előre jelzett pontokat használ.
  • A RayRoPE új nézetek szintézisén és sztereó mélységbecslésen javított a vizsgálatban.
  • A CO3D adathalmazon 15 százalékos relatív LPIPS-javulást közöltek.
  • A megoldás RGB-D bemenetet is képes pozíciókódolással kezelni.

A többnézetű figyelem térbeli problémája

Az Apple kutatási oldalán 2026 júliusában közzétett tanulmány olyan többnézetű transzformerekkel foglalkozik, amelyek több, ismert kamerabeállításból származó képen található tokeneket dolgoznak fel. A cél egy olyan pozíciókódolás kialakítása volt, amely egyedileg azonosítja a képpontokat, lehetővé teszi a többfrekvenciás hasonlóságot használó, SE(3)-invariáns figyelmet, és képes alkalmazkodni a jelenet geometriájához.

A szerzők szerint a korábbi abszolút és relatív kódolási megoldások nem teljesítették egyszerre ezeket a követelményeket. Az SE(3) a térbeli eltolásokkal és forgatásokkal szembeni invarianciára utal, vagyis a rendszer figyelme a jelenet térbeli elhelyezkedésének változása mellett is kezelheti a kapcsolatokat.

A RayRoPE sugarakból indul ki

A RayRoPE a képpontok pozícióját a hozzájuk tartozó látósugarak alapján reprezentálja. A módszer azonban a sugár iránya helyett egy, a sugár mentén előre jelzett pontot használ a geometriai szempontokat figyelembe vevő kódoláshoz.

A kutatás szerint a többnézetű figyelem SE(3)-invarianciáját a RayRoPE úgy éri el, hogy a hasonlóság kiszámításához leképezési, vagyis projektív koordinátákat határoz meg a lekérdezési képkockában. A megoldás a többfrekvenciás hasonlóságot is kezeli, így a pozíciókódolás a térbeli információt több frekvencián építi be a modell működésébe.

A sugár mentén előre jelzett háromdimenziós pont azonban pontatlan lehet. A szerzők ezért olyan eljárást is bemutatnak, amely bizonytalanság mellett analitikusan számítja ki a várható pozíciókódolást. Ez a megközelítés a kutatás leírása szerint közvetlenül kezeli azt a helyzetet, amikor a becsült pont nem tekinthető teljesen megbízhatónak.

Két feladaton tesztelték a módszert

A kutatók a RayRoPE-t új nézetek szintézisén és sztereó mélységbecslésen értékelték. A tanulmány szerint a módszer mindkét feladaton következetesen jobb eredményeket adott más pozíciókódolási sémáknál.

A CO3D adathalmazon az Apple közlése 15 százalékos relatív javulást emel ki az LPIPS mérőszámon. A tanulmány azt is állítja, hogy a RayRoPE zökkenőmentesen képes RGB-D bemenetet, vagyis színes képet és mélységinformációt tartalmazó adatot kezelni.

Ez a képesség a kutatók szerint még nagyobb előnyt hozott azokkal az alternatív módszerekkel szemben, amelyek nem tudják ezt az információt pozíciókódolással beépíteni. A RayRoPE így a több kameranézetből dolgozó rendszerekben a képpontok térbeli kapcsolatainak leírását célozza, miközben a becslési bizonytalanságot és a mélységi adatokat is figyelembe veszi.

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség…

Az Apple új módszert mutatott be szövegből hanggal kiegészített videókhoz
Kutatás2026. szeptember 11.

Az Apple új módszert mutatott be szövegből hanggal kiegészített videókhoz

Az Apple kutatói olyan módszert mutattak be, amely a szövegből videót és az ahhoz szinkronizált hangot generáló rendszerek szöveges vezérlését javítja. A…