Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

SPAR3S: hiányos képekből egészíti ki a 3D jeleneteket a NAVER új modellje

2026. szeptember 8. 10:36Forrás: NAVER LABS Europe
SPAR3S: hiányos képekből egészíti ki a 3D jeleneteket a NAVER új modellje
Kép: NAVER LABS Europe

A NAVER LABS Europe kutatói SPAR3S néven olyan 3D generatív modellt mutattak be, amely kevés, szabadon rögzített kameranézetből egészíti ki a hiányzó jelenetrészeket. A módszerhez nincs szükség felügyelésként használt, valós 3D adatokra.

A lényeg röviden
  • A SPAR3S kevés, több nézetből készült képből egészíti ki a 3D jelenetek hiányzó részeit.
  • A modell csak a foglalt voxelokat reprezentálja a ritka, voxelhez igazított látens térben.
  • A tanítás fotometriai felügyelettel és differenciálható 3D Gaussian Splattinggal történik.
  • Szintetikus beltéri jeleneteken jobb újnézeti minőséget ért el a korábbi módszereknél.
  • A kutatók a RealEstate10k adathalmazon is vizsgálták az általánosíthatóságot.

A hiányos nézetekből teljes jelenet készülhet

Ritka és korlátozás nélküli kameranézetekből teljes 3D jelenetet létrehozni alapvető kihívás a térbeli számítógépes látásban. A rendszernek a képeken közvetlenül nem látható tartalomról is következtetnie kell, miközben a számítási igényt kezelhető szinten tartja.

A NAVER LABS Europe szerint a korábbi, közvetlenül működő rekonstrukciós módszerek alapvetően azokra a részletekre korlátozódnak, amelyek láthatók a bemeneti képeken. A 3D generatív modellezést közben a sűrű térfogati reprezentációk magas számítási költsége és a nagy léptékű 3D felügyeleti adatok hiánya nehezíti.

Az új megközelítés neve SPAR3S, amelynek teljes neve Sparse auto-regressive modelling for scene generation from multi-view images. A kutatók a módszert a 19. European Conference on Computer Vision konferenciához kapcsolódó publikációban ismertették. Az eseményt a svédországi Malmöben rendezik meg 2026. szeptember 8. és 12. között.

Csak a foglalt térpontokat tárolja

A SPAR3S egy ritka, voxelhez igazított 3D látens generatív modell. A voxel a 3D tér felosztásának eleme, a modell pedig csak a foglalt voxelokat reprezentálja. Ez strukturált és kompakt látens tér kialakítását teszi lehetővé.

A kutatók a több nézetből származó képek alapján, fotometriai felügyelettel tanítják meg ezt a ritka látens teret. Ehhez differenciálható 3D Gaussian Splattingot használnak. A módszer így a forrás szerint nem igényel valós, felügyeletként használt 3D adatokat.

A bemeneti nézetekből kódolt, részleges voxelhalmaz esetén a jelenet kiegészítése a hiányzó látens tokenek és azok térbeli helyének előrejelzését jelenti a voxelrácsban. Ezt egy maszkolt autoregresszív transzformer végzi, amely közösen modellezi a voxelok foglaltságát és a látens tokenek értékeit. A cél hatékony, térben következetes generálás azokon a területeken is, amelyek nem láthatók a képeken.

Beltéri jeleneteken és valós adatokon tesztelték

A publikáció szerint a SPAR3S hatékonyságát szintetikus beltéri jeleneteken vizsgálták. Ezeken a teszteken a módszer jobb új nézeti minőséget ért el a korábbi megoldásoknál. Az új nézet olyan kameraállásból származó látványt jelent, amely nem szerepelt közvetlenül a bemeneti képek között.

A kutatók a RealEstate10k adathalmazon is ellenőrizték a módszer általánosíthatóságát. A forrás ezt a valós adatokra való alkalmazhatóság jeleként emeli ki, miközben a publikáció nem közöl külön teljesítményszámokat vagy részletes összehasonlító eredményeket.

A kutatást Thomas Lucas, Maxime Pietrantoni, Wonjune Cho, Bardenius Duisterhof, Philippe Weinzaepfel, Vincent Leroy és Jérome Revaud jegyzi. Az eredmény a NAVER LABS Europe szerint a 3D jelenetkiegészítést olyan irányba viszi, ahol kevés képből is lehet következtetni a nem megfigyelt térbeli részekre. Ez a megközelítés a szervezet számítógépes látással kapcsolatos céljaihoz illeszkedik, amelyek között a robotnavigáció, a kiterjesztett valóság, valamint tárgyak, épületek és egész városok 3D rekonstrukciója is szerepel.

Kapcsolódó hírek

A patchenkénti skalár gyorsabb robotnavigációt tehet lehetővé
Kutatás2026. szeptember 8. 16:42

A patchenkénti skalár gyorsabb robotnavigációt tehet lehetővé

A NAVER LABS Europe nagyszabású vizsgálatban elemezte, milyen vizuális információkra van szüksége egy gyorsan mozgó robotnak a valós környezetben végzett navigációhoz. A…

Syn4D: új szintetikus adatkészlet segítheti a dinamikus 3D-s kutatásokat
Kutatás2026. szeptember 8. 16:19

Syn4D: új szintetikus adatkészlet segítheti a dinamikus 3D-s kutatásokat

A NAVER LABS Europe bemutatta a Syn4D nevű, dinamikus jelenetekhez készült multinézetű szintetikus 4D-adatkészletet. A kutatók szerint az adatbázis a 3D-s rekonstrukció…

Whareformer: így követi a robot szemszögéből eltűnő tárgyakat
Kutatás2026. szeptember 8. 15:26

Whareformer: így követi a robot szemszögéből eltűnő tárgyakat

A NAVER LABS Europe bemutatta a Whareformer nevű, transzformer-alapú modellt, amely hosszú, viselői nézőpontból rögzített videókban követi a tárgyakat akkor is, ha azok…