Egyetlen látens tokennel tenné hatékonyabbá a képgenerálást az RepTok

Egyetlen folytonos látens tokennel reprezentálja a képeket a RepTok nevű generatív modellezési keretrendszer. A módszer önfelügyelt látásalapú transzformerek reprezentációira épít, és a fejlesztők szerint hatékonyabbá teheti a képgeneráló modellek tanítását.
- A RepTok egyetlen folytonos látens tokennel reprezentálja a képeket.
- A módszer előre betanított önfelügyelt látásalapú transzformerekre épít.
- Koszinusz-hasonlósági veszteséggel őrzik meg a látens tér geometriáját.
- A keretrendszer ImageNeten és MS-COCO-n is versenyképes eredményeket ért el.
- A kutatók szerint az egytokenes felépítés csökkenti a tanítási költségeket.
Egy tokenbe sűrítenék a kép reprezentációját
Az Apple gépi tanulással foglalkozó kutatási oldala a RepTokot olyan keretrendszerként mutatja be, amely egy képet egyetlen, folytonos látens tokennel ír le. A token egy önfelügyelt tanulással előállított látásalapú transzformer reprezentációjából származik.
A megközelítés egy előre betanított önfelügyelt tanulási kódolóra épül. A kutatók csak a szemantikai token beágyazását finomhangolják, majd ezt egy generatív dekóderrel kapcsolják össze. A dekódert közösen tanítják a tokennel, egy szabványos áramlásillesztési célfüggvény, vagyis flow matching objective használatával.
A finomhangolás a részleteket is visszahozza
Az Apple által közölt leírás szerint az önfelügyelt reprezentáció eredetileg elsősorban a képek értelmezését szolgálja. A RepTok finomhangolása olyan, alacsony szintű, rekonstrukcióhoz szükséges részletekkel gazdagítja a tokent, amelyek lehetővé teszik a képek hű visszaállítását.
A módszer közben igyekszik megőrizni az eredeti önfelügyelt reprezentációs tér kedvező geometriáját is. Ehhez a kutatók koszinusz-hasonlósági veszteséget adtak a tanításhoz. Ez szabályozza a módosított tokent, és a leírás szerint segít abban, hogy a látens tér sima maradjon, valamint alkalmas legyen generálásra.
A kutatók szerint az egyetlen tokenre épülő felépítés megszünteti a kétdimenziós látens terek térbeli redundanciáit. Ez jelentősen csökkenti a tanítás költségeit, miközben a rendszer egyszerű marad.
ImageNeten és szövegből képgenerálásban is tesztelték
A RepTok a szerzők beszámolója szerint versenyképes eredményeket ért el osztályfeltételes ImageNet-képgenerálásban. A keretrendszer szövegből képet előállító feladatokra is kiterjeszthető, és rendkívül korlátozott tanítási költségvetés mellett versenyképes nulla lövéses eredményt ért el az MS-COCO adathalmazon.
A kutatás címe Adapting Self-Supervised Representations as a Latent Space for Efficient Generation. A tanulmányt az ICLR konferenciához kapcsolódóan, 2025 novemberében publikálták. Szerzői Ming Gui, Johannes Schusterbauer, Timy Phan, Felix Krause, Josh Susskind, Miguel Angel Bautista és Björn Ommer. A szerzők a CompVis, valamint a Munich Center for Machine Learning kutatói, Ming Gui, Johannes Schusterbauer, Timy Phan és Felix Krause pedig egyenlő hozzájárulású szerzőként szerepelnek.
A bemutatott eredmény a generatív modellezésben használt látens terek kialakítására kínál egy tömör megoldást. A forrás szerint a kutatás azt szemlélteti, hogy a finomhangolt önfelügyelt reprezentációk kompakt és hatékony látens térként használhatók, különösen korlátozott tanítási erőforrások mellett.


