Az Apple olcsóbb módszert mutatott be multimodális modellek tanítására

Az Apple kutatói bemutatták a MixAtlas nevű keretrendszert, amely kisebb proxy modellek segítségével optimalizálja a multimodális nagy nyelvi modellek tanításához használt adatkeverékeket. A vállalat szerint a módszer a teljes méretű tanításhoz képest a költség egy századából képes feltérképezni a lehetséges adatarányokat.
- A MixAtlas két tengely, a képi fogalmak és a feladattípushoz kapcsolódó felügyelet alapján bontja fel az adatokat.
- A módszer kisebb proxy modellekkel és Gauss-folyamaton alapuló helyettesítő modellel keres optimális adatkeverékeket.
- Az Apple szerint a keresés a teljes méretű tanítás költségének 1/100-ából elvégezhető.
- A kutatás akár háromszor gyorsabb konvergenciát és 2 és 5 százalékpont közötti javulást mutatott.
- A ChartQA teszten 10, a TextVQA teszten 13 százalékos javulást jelentettek.
Két szempont szerint bontja fel a tanítási adatokat
A multimodális modellek, vagyis az MLLM-ek, képekkel és szöveggel kapcsolatos feladatokat is kezelnek. Az ilyen modellek köztes tanításánál fontos kérdés, hogy a különböző adatforrások milyen arányban szerepeljenek. Az Apple kutatói szerint ezt a területet eddig kevéssé vizsgálták rendszeresen, a jelenlegi tanítási receptek pedig gyakran egyetlen szempont alapján állítják össze az adatkeveréket, például az adatformátum vagy a feladattípus szerint.
A MixAtlas két értelmezhető tengely mentén rendezi el a tanítási adatokat. Az egyik a képekhez kapcsolódó fogalmakat, a másik a feladatokhoz tartozó felügyeletet, vagyis a tanítás során használt jelzéseket írja le. Ez lehetővé teszi az adatkeverék részletesebb szabályozását, és azt is, hogy a kutatók egy-egy tengelyen belül konkrét területekhez kapcsolják a későbbi teljesítményt.
Kisebb modellekkel keresik meg a megfelelő arányokat
A keretrendszer kisebb proxy modelleket használ az adatkeverékek vizsgálatára. A keresést egy Gauss-folyamaton alapuló helyettesítő modell, vagyis surrogate model, segíti. Ennek célja, hogy a lehetséges keverékek terét a teljes méretű modellek ismételt tanítása nélkül lehessen feltérképezni.
Az Apple közleménye szerint így az optimalizálás a teljes méretű tanítás költségének 1/100-ából elvégezhető. A kutatók azt is vizsgálták, hogy a kisebb proxy modellekkel megtalált adatkeverékek működnek-e nagyobb modellek esetében. Eredményeik alapján ezek a keverékek átvihetők nagyobb léptékű tanításra, miközben a hatékonysági és pontossági előnyök is megmaradnak.
Gyorsabb konvergencia és erősebb eredmények több teszten
Az Apple szerint a MixAtlas által előállított adatkeverékek a korábbi megközelítésekhez képest akár háromszor gyorsabb konvergenciát eredményeztek. A különböző tesztkészleteken 2 és 5 százalékpont közötti javulást mértek. Különösen erős eredményeket kaptak a sok szöveget tartalmazó feladatoknál.
A ChartQA teszten 10 százalékos, a TextVQA teszten pedig 13 százalékos javulást jelentettek. A forrás szerint ezek az eredmények azt mutatják, hogy az adatkeverék tudatos optimalizálása a multimodális modellek tanításának hatékonyságát és a későbbi feladatokon elért általánosítást is javíthatja.
A kutatást az ICLR 2026 workshopján fogadták el
A MixAtlasról szóló tanulmányt a Workshop on Navigating and Addressing Data Problems for Foundation Models, vagyis a NADPFM workshop fogadta el, amelyet az ICLR 2026 részeként rendeztek meg. A tanulmány szerzői Bingbing Wen, Sirajul Salekin, Feiyang Kang, Lucy Lu Wang, Bill Howe, Javier Movellan és Manjot Bilkhu.
A szerzők között a Virginia Tech és a University of Washington kutatói is szerepelnek. A forrás szerint Bingbing Wen a munka elkészítésekor az Apple-nél dolgozott. A módszer a fejlesztők számára olyan adatkeverékek kialakítását teheti gyakorlatiasabbá, amelyek kisebb számítási költséggel vizsgálhatók, és azt is megmutatják, hogy az egyes adatdomének milyen szerepet játszanak a multimodális modellek teljesítményében.


