Az Apple bemutatta a Manzano egységes multimodális modellt

Az Apple kutatói bemutatták a Manzano nevű multimodális modellt, amely ugyanabban a rendszerben képes vizuális tartalmak megértésére és létrehozására. A kutatók szerint a megközelítés csökkenti a két képesség közötti teljesítménykülönbséget.
- A Manzano egyesíti a képek megértését és generálását.
- Hibrid képtokenizálót és közös látási kódolót használ.
- A képi tokeneket egy diffúziós dekóder alakítja képpontokká.
- A kutatók szerint a modell az egységes rendszerek között élmezőnyben teljesít.
- A vizsgálatok minimális feladatkonfliktust és skálázással javuló eredményeket mutattak.
Egy modell a képek megértésére és létrehozására
A Manzano egy egységes multimodális modell, vagyis olyan rendszer, amely szöveges és képi tartalmakat is kezel. Az Apple kutatási oldala szerint az ilyen modellek jelentős lehetőségeket rejtenek, a nyílt forrású megoldásoknál azonban gyakran kompromisszum alakul ki a vizuális tartalmak megértése és generálása között.
A januárban publikált, az ICLR konferenciához kapcsolódó tanulmány ezt a feszültséget egy hibrid képtokenizálóval és gondosan összeállított betanítási eljárással igyekszik csökkenteni. A Manzano célja, hogy a két feladatot közös keretrendszerben tanulja meg.
Kétféle képi reprezentáció közös szemantikai térben
A rendszer központi eleme egy közös látási kódoló, amely két könnyű adaptert szolgál ki. Az egyik folyamatos beágyazásokat állít elő a képek szöveges értelmezéséhez, a másik diszkrét tokeneket készít a szövegből történő képgeneráláshoz. A kutatók szerint a két reprezentáció közös szemantikai térben működik.
A Manzano egységes autoregresszív nagy nyelvi modellje magas szintű jelentéseket jósol szöveges és képi tokenek formájában. A képi tokeneket ezt követően egy kiegészítő diffúziós dekóder alakítja át képpontokká. Így az autoregresszív modell a rendszer szerkezeti és szemantikai előrejelzéseit végzi, a dekóder pedig a képi kimenet létrehozásában vesz részt.
A tanítás során a modell a képek megértésére és generálására vonatkozó adatokat egyesített eljárással dolgozza fel. Az Apple szerint ez lehetővé teszi a két képesség közös, skálázható tanulását.
A kutatók szerint skálázással is javulnak az eredmények
A tanulmány szerint a Manzano az egységes multimodális modellek között a legjobb eredmények közé tartozik, és különösen a szöveggazdag értékeléseken versenyképes a specializált modellekkel. Ez a megállapítás a kutatók saját értékelésére épül.
A vizsgálatok a feladatok közötti minimális konfliktust mutatták ki. A kutatók emellett következetes javulást tapasztaltak a modellméret növelésével, ami szerintük alátámasztja a hibrid tokenizáló használatát. A megközelítés jelentősége abban áll, hogy a képértelmezést és a képgenerálást egyetlen architektúrában, közös tanítási recepttel kezeli.
Az Apple kutatási oldala a Manzanót számítógépes látással foglalkozó munkaként sorolja fel. A bemutatott eredmények alapján a rendszer olyan multimodális modellek fejlesztéséhez adhat mintát, amelyeknek egyszerre kell interleaved, vagyis egymással váltakozó szöveges és képi tartalmakat értelmezniük és előállítaniuk.


