Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple bemutatta a Manzano egységes multimodális modellt

2026. augusztus 25.Forrás: Apple
Az Apple bemutatta a Manzano egységes multimodális modellt
Kép: Apple

Az Apple kutatói bemutatták a Manzano nevű multimodális modellt, amely ugyanabban a rendszerben képes vizuális tartalmak megértésére és létrehozására. A kutatók szerint a megközelítés csökkenti a két képesség közötti teljesítménykülönbséget.

A lényeg röviden
  • A Manzano egyesíti a képek megértését és generálását.
  • Hibrid képtokenizálót és közös látási kódolót használ.
  • A képi tokeneket egy diffúziós dekóder alakítja képpontokká.
  • A kutatók szerint a modell az egységes rendszerek között élmezőnyben teljesít.
  • A vizsgálatok minimális feladatkonfliktust és skálázással javuló eredményeket mutattak.

Egy modell a képek megértésére és létrehozására

A Manzano egy egységes multimodális modell, vagyis olyan rendszer, amely szöveges és képi tartalmakat is kezel. Az Apple kutatási oldala szerint az ilyen modellek jelentős lehetőségeket rejtenek, a nyílt forrású megoldásoknál azonban gyakran kompromisszum alakul ki a vizuális tartalmak megértése és generálása között.

A januárban publikált, az ICLR konferenciához kapcsolódó tanulmány ezt a feszültséget egy hibrid képtokenizálóval és gondosan összeállított betanítási eljárással igyekszik csökkenteni. A Manzano célja, hogy a két feladatot közös keretrendszerben tanulja meg.

Kétféle képi reprezentáció közös szemantikai térben

A rendszer központi eleme egy közös látási kódoló, amely két könnyű adaptert szolgál ki. Az egyik folyamatos beágyazásokat állít elő a képek szöveges értelmezéséhez, a másik diszkrét tokeneket készít a szövegből történő képgeneráláshoz. A kutatók szerint a két reprezentáció közös szemantikai térben működik.

A Manzano egységes autoregresszív nagy nyelvi modellje magas szintű jelentéseket jósol szöveges és képi tokenek formájában. A képi tokeneket ezt követően egy kiegészítő diffúziós dekóder alakítja át képpontokká. Így az autoregresszív modell a rendszer szerkezeti és szemantikai előrejelzéseit végzi, a dekóder pedig a képi kimenet létrehozásában vesz részt.

A tanítás során a modell a képek megértésére és generálására vonatkozó adatokat egyesített eljárással dolgozza fel. Az Apple szerint ez lehetővé teszi a két képesség közös, skálázható tanulását.

A kutatók szerint skálázással is javulnak az eredmények

A tanulmány szerint a Manzano az egységes multimodális modellek között a legjobb eredmények közé tartozik, és különösen a szöveggazdag értékeléseken versenyképes a specializált modellekkel. Ez a megállapítás a kutatók saját értékelésére épül.

A vizsgálatok a feladatok közötti minimális konfliktust mutatták ki. A kutatók emellett következetes javulást tapasztaltak a modellméret növelésével, ami szerintük alátámasztja a hibrid tokenizáló használatát. A megközelítés jelentősége abban áll, hogy a képértelmezést és a képgenerálást egyetlen architektúrában, közös tanítási recepttel kezeli.

Az Apple kutatási oldala a Manzanót számítógépes látással foglalkozó munkaként sorolja fel. A bemutatott eredmények alapján a rendszer olyan multimodális modellek fejlesztéséhez adhat mintát, amelyeknek egyszerre kell interleaved, vagyis egymással váltakozó szöveges és képi tartalmakat értelmezniük és előállítaniuk.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple LinEAS módszere kevés adattal irányítja a generatív modelleket
Kutatás2026. szeptember 18.

Az Apple LinEAS módszere kevés adattal irányítja a generatív modelleket

Az Apple kutatói a LinEAS nevű módszert mutatták be, amely a generatív modellek aktivációinak módosításával igyekszik biztonságosabbá és jobban irányíthatóvá tenni a…