Szövegből tapintható grafikát készít a CMU új AI-rendszere

A Carnegie Mellon University kutatói olyan generatív AI-rendszert fejlesztettek, amely szöveges leírásból 3D-nyomtatható, tapintható grafikát készít. A Text2TactileGraphics kiemelkedő formákat, textúrákat és Braille-leírást használ, hogy a vak és gyengénlátó emberek érintéssel fedezhessenek fel vizuális információkat.
- A Text2TactileGraphics szöveges utasításból 3D-nyomtatható tapintható grafikát készít.
- A rendszer kiemelkedő formákat, textúrákat és Braille-leírást is létrehozhat.
- A textúra szöveggel, online könyvtárból vagy tapintásérzékelővel is megadható.
- A kutatók vak és gyengénlátó résztvevőkkel tesztelték a grafikákat.
- A kutatást elfogadták a 2026-os European Conference on Computer Vision konferenciára.
Szöveges leírásból kiemelkedő formák
A Carnegie Mellon University School of Computer Science kutatói szeptember 3-án ismertették a Text2TactileGraphics nevű rendszert. A technológia a felhasználó szöveges utasításából indul ki, majd egy lapos alapból és az azon elhelyezett kiemelkedő elemekből álló, 3D-nyomtatható grafikát hoz létre.
A leírás egy tárgy alakjára és felületére is kitérhet. A felhasználó például egy macskát szőrösnek, egy sziklát pedig érdesnek írhat le. A rendszer ezeket az információkat finom barázdákká, dudorokká és más kiemelkedő mintázatokká alakítja. A grafikához Braille-leírás is társítható, így a felhasználó önállóan azonosíthatja a tárgyat, majd kitapinthatja annak egyes részeit.
A textúra többféleképpen megadható
A kutatók szerint a rendszernek a textúrák leírásának különböző módjaihoz kell alkalmazkodnia. Egy felhasználó egyszerűen megadhatja, hogy „macskaszőr”, de közvetlenebb leírást is használhat, például hullámos vagy pontozott felületet írhat elő. Emellett online textúrakönyvtárból is importálhat mintákat, vagy tapintásérzékelővel rögzítheti egy valódi tárgy felületét.
Az érzékelő gélfelületét egy tárgyhoz lehet nyomni, hogy rögzítse annak mikroszkopikus geometriai részleteit. A rendszer ezután ezeket az adatokat egy nagyobb, generált objektum felületén is képes újra létrehozni. Így a textúra reprodukálásához nincs feltétlenül szükség arra, hogy a felhasználó ismerje a technikai kifejezéseket.
Ruihan Gao, a Robotics Institute doktorandusza és a projekt egyik vezetője szerint a kutatókat az ösztönözte, hogy a generatív AI előnyeit mindenki számára elérhetővé tegyék, beleértve a vak és gyengénlátó embereket is. Ava Pun, a projekt másik vezetője azt mondta, hogy egy képernyőn valósághűnek tűnő kép önmagában nem elég. A rendszernek azt is figyelembe kell vennie, hogyan érződik majd a tárgy, amikor 3D-nyomtatás után valaki végighúzza rajta az ujjait.
Braille-lel önállóbbá válhat a felfedezés
A tapintható grafikák olyan információkhoz adhatnak hozzáférést, amelyeket rendszerint vizuálisan közölnek. Ide tartozhatnak a domború térképek és diagramok, valamint növények, állatok vagy anatómiai részletek ábrái. Ezek elkészítése azonban speciális szakértelmet igényel, ami megnehezíti a nagyobb léptékű és személyre szabott előállítást.
A CMU kutatói a VisAbility Pittsburgh és a Library of Accessible Media for Pennsylvanians vak vagy gyengénlátó résztvevőivel vizsgálták, hogyan használhatók a létrehozott grafikák. A résztvevők ismerős és ismeretlen tárgyakat is kitapintottak, majd visszajelzést adtak arról, milyen dolgokat szeretnének érintéssel megtapasztalni.
A vizsgálatok a Braille-leírások hasznát is megmutatták. A résztvevők a címkék segítségével önállóan azonosíthatták az objektumokat, majd érintéssel fedezhették fel azok különböző részeit. A Text2TactileGraphics kutatását elfogadták a 2026-os European Conference on Computer Vision konferenciára, ahol Pun mutatja be a csapat munkáját.
CMU School of Computer Science: Bringing Images to Life Through Touch


