Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Egyetlen látens tokennel tenné hatékonyabbá a képgenerálást az RepTok

2026. július 15.Forrás: Apple
Egyetlen látens tokennel tenné hatékonyabbá a képgenerálást az RepTok
Kép: Apple

Egyetlen folytonos látens tokennel reprezentálja a képeket a RepTok nevű generatív modellezési keretrendszer. A módszer önfelügyelt látásalapú transzformerek reprezentációira épít, és a fejlesztők szerint hatékonyabbá teheti a képgeneráló modellek tanítását.

A lényeg röviden
  • A RepTok egyetlen folytonos látens tokennel reprezentálja a képeket.
  • A módszer előre betanított önfelügyelt látásalapú transzformerekre épít.
  • Koszinusz-hasonlósági veszteséggel őrzik meg a látens tér geometriáját.
  • A keretrendszer ImageNeten és MS-COCO-n is versenyképes eredményeket ért el.
  • A kutatók szerint az egytokenes felépítés csökkenti a tanítási költségeket.

Egy tokenbe sűrítenék a kép reprezentációját

Az Apple gépi tanulással foglalkozó kutatási oldala a RepTokot olyan keretrendszerként mutatja be, amely egy képet egyetlen, folytonos látens tokennel ír le. A token egy önfelügyelt tanulással előállított látásalapú transzformer reprezentációjából származik.

A megközelítés egy előre betanított önfelügyelt tanulási kódolóra épül. A kutatók csak a szemantikai token beágyazását finomhangolják, majd ezt egy generatív dekóderrel kapcsolják össze. A dekódert közösen tanítják a tokennel, egy szabványos áramlásillesztési célfüggvény, vagyis flow matching objective használatával.

A finomhangolás a részleteket is visszahozza

Az Apple által közölt leírás szerint az önfelügyelt reprezentáció eredetileg elsősorban a képek értelmezését szolgálja. A RepTok finomhangolása olyan, alacsony szintű, rekonstrukcióhoz szükséges részletekkel gazdagítja a tokent, amelyek lehetővé teszik a képek hű visszaállítását.

A módszer közben igyekszik megőrizni az eredeti önfelügyelt reprezentációs tér kedvező geometriáját is. Ehhez a kutatók koszinusz-hasonlósági veszteséget adtak a tanításhoz. Ez szabályozza a módosított tokent, és a leírás szerint segít abban, hogy a látens tér sima maradjon, valamint alkalmas legyen generálásra.

A kutatók szerint az egyetlen tokenre épülő felépítés megszünteti a kétdimenziós látens terek térbeli redundanciáit. Ez jelentősen csökkenti a tanítás költségeit, miközben a rendszer egyszerű marad.

ImageNeten és szövegből képgenerálásban is tesztelték

A RepTok a szerzők beszámolója szerint versenyképes eredményeket ért el osztályfeltételes ImageNet-képgenerálásban. A keretrendszer szövegből képet előállító feladatokra is kiterjeszthető, és rendkívül korlátozott tanítási költségvetés mellett versenyképes nulla lövéses eredményt ért el az MS-COCO adathalmazon.

A kutatás címe Adapting Self-Supervised Representations as a Latent Space for Efficient Generation. A tanulmányt az ICLR konferenciához kapcsolódóan, 2025 novemberében publikálták. Szerzői Ming Gui, Johannes Schusterbauer, Timy Phan, Felix Krause, Josh Susskind, Miguel Angel Bautista és Björn Ommer. A szerzők a CompVis, valamint a Munich Center for Machine Learning kutatói, Ming Gui, Johannes Schusterbauer, Timy Phan és Felix Krause pedig egyenlő hozzájárulású szerzőként szerepelnek.

A bemutatott eredmény a generatív modellezésben használt látens terek kialakítására kínál egy tömör megoldást. A forrás szerint a kutatás azt szemlélteti, hogy a finomhangolt önfelügyelt reprezentációk kompakt és hatékony látens térként használhatók, különösen korlátozott tanítási erőforrások mellett.

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség…

Az Apple bemutatta a Manzano egységes multimodális modellt
Kutatás2026. augusztus 25.

Az Apple bemutatta a Manzano egységes multimodális modellt

Az Apple kutatói bemutatták a Manzano nevű multimodális modellt, amely ugyanabban a rendszerben képes vizuális tartalmak megértésére és létrehozására. A kutatók szerint…