A Lambda térbeli gondolkodásra tanított multimodális modellt mutatott be

A Lambda és a UC San Diego kutatói olyan multimodális modellt fejlesztettek, amely 3D környezetekben próbálja egyszerre felismerni a feladat szempontjából fontos tárgyakat és megérteni a teljes jelenet térbeli szerkezetét. A CVP öt 3D látás és nyelv benchmarkon javított a Video-3D-LLM eredményein.
- A CVP a feladathoz fontos tárgyakra és a teljes 3D jelenetre is figyel.
- A modell target-affinity tokent és allocentric gridet használ.
- A CVP mind az öt vizsgált 3D benchmarkon javított a Video-3D-LLM eredményein.
- A modellt 7 milliárd paraméterrel és 8 NVIDIA A100 GPU-val finomhangolták.
A 3D környezetek megértése több puszta felismerésnél
A Lambda szeptember 24-i beszámolója szerint a következő generációs mesterségesintelligencia-rendszereknek a digitális tartalmak mellett fizikai környezetekben is meg kell érteniük a tárgyak helyét és egymáshoz való viszonyát. Ez különösen fontos lehet robotok és összetett terekben közlekedő autonóm rendszerek esetében.
A térbeli gondolkodás egy környezet 3D szerkezetének megértését jelenti. Egy olyan utasítás végrehajtásához, mint egy asztal melletti és egy függöny előtti tárgy megtalálása, önmagában nem elég a tárgyak felismerése. A modellnek azonosítania kell a feladat szempontjából releváns objektumokat, majd következtetnie kell azok helyzetére.
A hagyományos nagy nyelvi modellek képesek nyelvi fogalmakkal, például a balra vagy mögötte kifejezésekkel dolgozni, de közvetlenül nem látják a fizikai geometriát. A látás és nyelv modellek 2D képekből építik fel reprezentációikat, amelyek az egyes kameraállásokhoz kötődnek. Ugyanaz a tárgy több nézetben eltérő helyen, méretben és irányban jelenhet meg, ezért a rendszernek egységes 3D jelenetté kell összekapcsolnia ezeket a megfigyeléseket.
A CVP a központi és a perifériás látást utánozza
A WACV 2026 konferenciára elfogadott tanulmányban bemutatott CVP, vagyis Central-Peripheral Vision-Inspired Multimodal Model két kiegészítő mechanizmust használ. A target-affinity token a feladathoz kapcsolódó tárgyakra irányítja a figyelmet. A modell a több nézetből származó vizuális jellemzőket közös 3D koordinátarendszerbe vetíti, objektumszintű reprezentációkat készít, majd kontrasztív tanítás segítségével közelebb hozza a releváns tárgyakat és eltávolítja az irrelevánsakat.
A második elem az allocentric grid, vagyis egy kompakt, madártávlati környezetreprezentáció. Ez nem egy adott kamera nézőpontjához kötődik, hanem világközéppontú módon mutatja be a tárgyakat. A rácsot tömör szöveges reprezentációvá alakítják, így a nyelvi modell közvetlenül hozzáférhet a jelenet magas szintű térbeli szerkezetéhez.
A Lambda szerint az alapértelmezett 6 x 6-os rács erős teljesítményt nyújtott, a felbontás növelése pedig nem hozott további előnyt. A CVP a LLaVA-Video-7B modellre és a Video-3D-LLM többnézetű reprezentációjára épül, és öt adathalmazon, kérdésválaszolási, vizuális leképezési és részletes képaláírási feladatokon tanították közösen.
Öt benchmarkon javított a Video-3D-LLM-hez képest
A kutatók a CVP-t a ScanQA, SQA3D, ScanRefer, Multi3DRefer és Scan2Cap benchmarkokon értékelték. A Lambda közlése szerint a modell mind az öt teszten felülmúlta a Video-3D-LLM alapértékeit.
- A ScanQA 3D kérdésválaszolási feladatán a CIDEr érték 102,1-ről 107,1-re nőtt.
- Az SQA3D-n az egzakt egyezésen alapuló pontosság 58,6-ról 62,3-ra javult.
- A ScanRefer vizuális leképezési feladatán az [email protected] érték 58,1-ről 62,0-ra emelkedett.
- A Multi3DReferen az [email protected] mutató 58,0-ról 60,2-ra javult.
- A Scan2Cap részletes képaláírási tesztjén a CIDEr 83,8-ról 90,5-re nőtt.
A komponensek különböző feladatokban bizonyultak hasznosnak. A target-affinity token nagyobb javulást hozott a vizuális leképezésben, ahol a megfelelő tárgy azonosítása a kulcs. Az allocentric grid inkább a kérdésválaszolásban és a részletes képaláírásban volt fontos, mert ezekhez a teljes jelenet szélesebb körű megértése szükséges.
A CVP 7 milliárd paraméteres multimodális modelljét öt 3D látás és nyelv adathalmazon finomhangolták, 8 NVIDIA A100 Tensor Core GPU használatával. A számítási kapacitást a Lambda biztosította. A vállalat szerint az ilyen infrastruktúra a multimodális alapmodellek tanítását és finomhangolását, valamint új architektúrák vizsgálatát támogatja, miközben a kutatás a tárgyak felismerésétől a fizikai környezetek szerkezetének megértése felé halad.
Lambda: Building multimodal models for spatial reasoning


