Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple olcsóbb módszert mutatott be multimodális modellek tanítására

2026. augusztus 20.Forrás: Apple
Az Apple olcsóbb módszert mutatott be multimodális modellek tanítására
Kép: Apple

Az Apple kutatói bemutatták a MixAtlas nevű keretrendszert, amely kisebb proxy modellek segítségével optimalizálja a multimodális nagy nyelvi modellek tanításához használt adatkeverékeket. A vállalat szerint a módszer a teljes méretű tanításhoz képest a költség egy századából képes feltérképezni a lehetséges adatarányokat.

A lényeg röviden
  • A MixAtlas két tengely, a képi fogalmak és a feladattípushoz kapcsolódó felügyelet alapján bontja fel az adatokat.
  • A módszer kisebb proxy modellekkel és Gauss-folyamaton alapuló helyettesítő modellel keres optimális adatkeverékeket.
  • Az Apple szerint a keresés a teljes méretű tanítás költségének 1/100-ából elvégezhető.
  • A kutatás akár háromszor gyorsabb konvergenciát és 2 és 5 százalékpont közötti javulást mutatott.
  • A ChartQA teszten 10, a TextVQA teszten 13 százalékos javulást jelentettek.

Két szempont szerint bontja fel a tanítási adatokat

A multimodális modellek, vagyis az MLLM-ek, képekkel és szöveggel kapcsolatos feladatokat is kezelnek. Az ilyen modellek köztes tanításánál fontos kérdés, hogy a különböző adatforrások milyen arányban szerepeljenek. Az Apple kutatói szerint ezt a területet eddig kevéssé vizsgálták rendszeresen, a jelenlegi tanítási receptek pedig gyakran egyetlen szempont alapján állítják össze az adatkeveréket, például az adatformátum vagy a feladattípus szerint.

A MixAtlas két értelmezhető tengely mentén rendezi el a tanítási adatokat. Az egyik a képekhez kapcsolódó fogalmakat, a másik a feladatokhoz tartozó felügyeletet, vagyis a tanítás során használt jelzéseket írja le. Ez lehetővé teszi az adatkeverék részletesebb szabályozását, és azt is, hogy a kutatók egy-egy tengelyen belül konkrét területekhez kapcsolják a későbbi teljesítményt.

Kisebb modellekkel keresik meg a megfelelő arányokat

A keretrendszer kisebb proxy modelleket használ az adatkeverékek vizsgálatára. A keresést egy Gauss-folyamaton alapuló helyettesítő modell, vagyis surrogate model, segíti. Ennek célja, hogy a lehetséges keverékek terét a teljes méretű modellek ismételt tanítása nélkül lehessen feltérképezni.

Az Apple közleménye szerint így az optimalizálás a teljes méretű tanítás költségének 1/100-ából elvégezhető. A kutatók azt is vizsgálták, hogy a kisebb proxy modellekkel megtalált adatkeverékek működnek-e nagyobb modellek esetében. Eredményeik alapján ezek a keverékek átvihetők nagyobb léptékű tanításra, miközben a hatékonysági és pontossági előnyök is megmaradnak.

Gyorsabb konvergencia és erősebb eredmények több teszten

Az Apple szerint a MixAtlas által előállított adatkeverékek a korábbi megközelítésekhez képest akár háromszor gyorsabb konvergenciát eredményeztek. A különböző tesztkészleteken 2 és 5 százalékpont közötti javulást mértek. Különösen erős eredményeket kaptak a sok szöveget tartalmazó feladatoknál.

A ChartQA teszten 10 százalékos, a TextVQA teszten pedig 13 százalékos javulást jelentettek. A forrás szerint ezek az eredmények azt mutatják, hogy az adatkeverék tudatos optimalizálása a multimodális modellek tanításának hatékonyságát és a későbbi feladatokon elért általánosítást is javíthatja.

A kutatást az ICLR 2026 workshopján fogadták el

A MixAtlasról szóló tanulmányt a Workshop on Navigating and Addressing Data Problems for Foundation Models, vagyis a NADPFM workshop fogadta el, amelyet az ICLR 2026 részeként rendeztek meg. A tanulmány szerzői Bingbing Wen, Sirajul Salekin, Feiyang Kang, Lucy Lu Wang, Bill Howe, Javier Movellan és Manjot Bilkhu.

A szerzők között a Virginia Tech és a University of Washington kutatói is szerepelnek. A forrás szerint Bingbing Wen a munka elkészítésekor az Apple-nél dolgozott. A módszer a fejlesztők számára olyan adatkeverékek kialakítását teheti gyakorlatiasabbá, amelyek kisebb számítási költséggel vizsgálhatók, és azt is megmutatják, hogy az egyes adatdomének milyen szerepet játszanak a multimodális modellek teljesítményében.

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség…