SPAR3S: hiányos képekből egészíti ki a 3D jeleneteket a NAVER új modellje

A NAVER LABS Europe kutatói SPAR3S néven olyan 3D generatív modellt mutattak be, amely kevés, szabadon rögzített kameranézetből egészíti ki a hiányzó jelenetrészeket. A módszerhez nincs szükség felügyelésként használt, valós 3D adatokra.
- A SPAR3S kevés, több nézetből készült képből egészíti ki a 3D jelenetek hiányzó részeit.
- A modell csak a foglalt voxelokat reprezentálja a ritka, voxelhez igazított látens térben.
- A tanítás fotometriai felügyelettel és differenciálható 3D Gaussian Splattinggal történik.
- Szintetikus beltéri jeleneteken jobb újnézeti minőséget ért el a korábbi módszereknél.
- A kutatók a RealEstate10k adathalmazon is vizsgálták az általánosíthatóságot.
A hiányos nézetekből teljes jelenet készülhet
Ritka és korlátozás nélküli kameranézetekből teljes 3D jelenetet létrehozni alapvető kihívás a térbeli számítógépes látásban. A rendszernek a képeken közvetlenül nem látható tartalomról is következtetnie kell, miközben a számítási igényt kezelhető szinten tartja.
A NAVER LABS Europe szerint a korábbi, közvetlenül működő rekonstrukciós módszerek alapvetően azokra a részletekre korlátozódnak, amelyek láthatók a bemeneti képeken. A 3D generatív modellezést közben a sűrű térfogati reprezentációk magas számítási költsége és a nagy léptékű 3D felügyeleti adatok hiánya nehezíti.
Az új megközelítés neve SPAR3S, amelynek teljes neve Sparse auto-regressive modelling for scene generation from multi-view images. A kutatók a módszert a 19. European Conference on Computer Vision konferenciához kapcsolódó publikációban ismertették. Az eseményt a svédországi Malmöben rendezik meg 2026. szeptember 8. és 12. között.
Csak a foglalt térpontokat tárolja
A SPAR3S egy ritka, voxelhez igazított 3D látens generatív modell. A voxel a 3D tér felosztásának eleme, a modell pedig csak a foglalt voxelokat reprezentálja. Ez strukturált és kompakt látens tér kialakítását teszi lehetővé.
A kutatók a több nézetből származó képek alapján, fotometriai felügyelettel tanítják meg ezt a ritka látens teret. Ehhez differenciálható 3D Gaussian Splattingot használnak. A módszer így a forrás szerint nem igényel valós, felügyeletként használt 3D adatokat.
A bemeneti nézetekből kódolt, részleges voxelhalmaz esetén a jelenet kiegészítése a hiányzó látens tokenek és azok térbeli helyének előrejelzését jelenti a voxelrácsban. Ezt egy maszkolt autoregresszív transzformer végzi, amely közösen modellezi a voxelok foglaltságát és a látens tokenek értékeit. A cél hatékony, térben következetes generálás azokon a területeken is, amelyek nem láthatók a képeken.
Beltéri jeleneteken és valós adatokon tesztelték
A publikáció szerint a SPAR3S hatékonyságát szintetikus beltéri jeleneteken vizsgálták. Ezeken a teszteken a módszer jobb új nézeti minőséget ért el a korábbi megoldásoknál. Az új nézet olyan kameraállásból származó látványt jelent, amely nem szerepelt közvetlenül a bemeneti képek között.
A kutatók a RealEstate10k adathalmazon is ellenőrizték a módszer általánosíthatóságát. A forrás ezt a valós adatokra való alkalmazhatóság jeleként emeli ki, miközben a publikáció nem közöl külön teljesítményszámokat vagy részletes összehasonlító eredményeket.
A kutatást Thomas Lucas, Maxime Pietrantoni, Wonjune Cho, Bardenius Duisterhof, Philippe Weinzaepfel, Vincent Leroy és Jérome Revaud jegyzi. Az eredmény a NAVER LABS Europe szerint a 3D jelenetkiegészítést olyan irányba viszi, ahol kevés képből is lehet következtetni a nem megfigyelt térbeli részekre. Ez a megközelítés a szervezet számítógépes látással kapcsolatos céljaihoz illeszkedik, amelyek között a robotnavigáció, a kiterjesztett valóság, valamint tárgyak, épületek és egész városok 3D rekonstrukciója is szerepel.
NAVER LABS Europe: Sparse auto-regressive modelling for scene generation from multi-view images


