Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Lambda térbeli gondolkodásra tanított multimodális modellt mutatott be

2026. szeptember 24.Forrás: Lambda
A Lambda térbeli gondolkodásra tanított multimodális modellt mutatott be
Kép: Lambda

A Lambda és a UC San Diego kutatói olyan multimodális modellt fejlesztettek, amely 3D környezetekben próbálja egyszerre felismerni a feladat szempontjából fontos tárgyakat és megérteni a teljes jelenet térbeli szerkezetét. A CVP öt 3D látás és nyelv benchmarkon javított a Video-3D-LLM eredményein.

A lényeg röviden
  • A CVP a feladathoz fontos tárgyakra és a teljes 3D jelenetre is figyel.
  • A modell target-affinity tokent és allocentric gridet használ.
  • A CVP mind az öt vizsgált 3D benchmarkon javított a Video-3D-LLM eredményein.
  • A modellt 7 milliárd paraméterrel és 8 NVIDIA A100 GPU-val finomhangolták.

A 3D környezetek megértése több puszta felismerésnél

A Lambda szeptember 24-i beszámolója szerint a következő generációs mesterségesintelligencia-rendszereknek a digitális tartalmak mellett fizikai környezetekben is meg kell érteniük a tárgyak helyét és egymáshoz való viszonyát. Ez különösen fontos lehet robotok és összetett terekben közlekedő autonóm rendszerek esetében.

A térbeli gondolkodás egy környezet 3D szerkezetének megértését jelenti. Egy olyan utasítás végrehajtásához, mint egy asztal melletti és egy függöny előtti tárgy megtalálása, önmagában nem elég a tárgyak felismerése. A modellnek azonosítania kell a feladat szempontjából releváns objektumokat, majd következtetnie kell azok helyzetére.

A hagyományos nagy nyelvi modellek képesek nyelvi fogalmakkal, például a balra vagy mögötte kifejezésekkel dolgozni, de közvetlenül nem látják a fizikai geometriát. A látás és nyelv modellek 2D képekből építik fel reprezentációikat, amelyek az egyes kameraállásokhoz kötődnek. Ugyanaz a tárgy több nézetben eltérő helyen, méretben és irányban jelenhet meg, ezért a rendszernek egységes 3D jelenetté kell összekapcsolnia ezeket a megfigyeléseket.

A CVP a központi és a perifériás látást utánozza

A WACV 2026 konferenciára elfogadott tanulmányban bemutatott CVP, vagyis Central-Peripheral Vision-Inspired Multimodal Model két kiegészítő mechanizmust használ. A target-affinity token a feladathoz kapcsolódó tárgyakra irányítja a figyelmet. A modell a több nézetből származó vizuális jellemzőket közös 3D koordinátarendszerbe vetíti, objektumszintű reprezentációkat készít, majd kontrasztív tanítás segítségével közelebb hozza a releváns tárgyakat és eltávolítja az irrelevánsakat.

A második elem az allocentric grid, vagyis egy kompakt, madártávlati környezetreprezentáció. Ez nem egy adott kamera nézőpontjához kötődik, hanem világközéppontú módon mutatja be a tárgyakat. A rácsot tömör szöveges reprezentációvá alakítják, így a nyelvi modell közvetlenül hozzáférhet a jelenet magas szintű térbeli szerkezetéhez.

A Lambda szerint az alapértelmezett 6 x 6-os rács erős teljesítményt nyújtott, a felbontás növelése pedig nem hozott további előnyt. A CVP a LLaVA-Video-7B modellre és a Video-3D-LLM többnézetű reprezentációjára épül, és öt adathalmazon, kérdésválaszolási, vizuális leképezési és részletes képaláírási feladatokon tanították közösen.

Öt benchmarkon javított a Video-3D-LLM-hez képest

A kutatók a CVP-t a ScanQA, SQA3D, ScanRefer, Multi3DRefer és Scan2Cap benchmarkokon értékelték. A Lambda közlése szerint a modell mind az öt teszten felülmúlta a Video-3D-LLM alapértékeit.

  • A ScanQA 3D kérdésválaszolási feladatán a CIDEr érték 102,1-ről 107,1-re nőtt.
  • Az SQA3D-n az egzakt egyezésen alapuló pontosság 58,6-ról 62,3-ra javult.
  • A ScanRefer vizuális leképezési feladatán az [email protected] érték 58,1-ről 62,0-ra emelkedett.
  • A Multi3DReferen az [email protected] mutató 58,0-ról 60,2-ra javult.
  • A Scan2Cap részletes képaláírási tesztjén a CIDEr 83,8-ról 90,5-re nőtt.

A komponensek különböző feladatokban bizonyultak hasznosnak. A target-affinity token nagyobb javulást hozott a vizuális leképezésben, ahol a megfelelő tárgy azonosítása a kulcs. Az allocentric grid inkább a kérdésválaszolásban és a részletes képaláírásban volt fontos, mert ezekhez a teljes jelenet szélesebb körű megértése szükséges.

A CVP 7 milliárd paraméteres multimodális modelljét öt 3D látás és nyelv adathalmazon finomhangolták, 8 NVIDIA A100 Tensor Core GPU használatával. A számítási kapacitást a Lambda biztosította. A vállalat szerint az ilyen infrastruktúra a multimodális alapmodellek tanítását és finomhangolását, valamint új architektúrák vizsgálatát támogatja, miközben a kutatás a tárgyak felismerésétől a fizikai környezetek szerkezetének megértése felé halad.

Kapcsolódó hírek

A Sanctuary AI módszere felgyorsítja a robotok tanulását
Kutatás2026. október 2.

A Sanctuary AI módszere felgyorsítja a robotok tanulását

A Sanctuary AI TIGER nevű módszere sűrű jutalmazási jelet ad a robotoknak a megerősítéses tanulás során, így a rendszer a tesztelt feladatokon 20-57 százalékkal kevesebb…

A világ modellezésétől az aktív robotokig lépne a fizikai AI
Kutatás2026. október 1.

A világ modellezésétől az aktív robotokig lépne a fizikai AI

A fizikai környezetben működő mesterséges intelligenciának az élethű világmodellezés mellett azt is tudnia kell, mikor van szüksége új információra, hogyan tervezzen, és…

A fizikai MI következő lépése az aktív érzékelés lehet
Kutatás2026. október 1.

A fizikai MI következő lépése az aktív érzékelés lehet

A fizikai világban működő mesterséges intelligenciának nem elég valósághű jövőképeket generálnia. A Lambda szerint az ilyen rendszereknek fel kell ismerniük a…