Apple módszert dolgozott ki az optimális tanítási adatkeverékhez

Az Apple kutatói olyan módszert mutattak be, amely skálázási törvényekkel becsüli meg a nagy mesterségesintelligencia-modellekhez használható optimális tanítási adatkeveréket. A megközelítés néhány kisebb léptékű kísérletből próbál következtetni a nagyobb modellek teljesítményére és a különböző adatforrások ideális arányára.
- Az Apple kutatói skálázási törvényekkel választanák ki az optimális adatkeveréket.
- A módszer kisebb léptékű tanításokból becsüli meg a nagyobb modellek teljesítményét.
- A vizsgálat nyelvi, multimodális és látásmodellekre is kiterjedt.
- Az eljárás célja a költséges próbálgatás csökkentése.
- A tanulmány a forrás szerint 2025 szeptemberében jelent meg a NeurIPS-hez kapcsolódva.
A tanítási adatok aránya kulcsfontosságú
A nagy alapmodelleket jellemzően több tartományból származó adatokkal tanítják. Ezek aránya, vagyis az adatkeverék, jelentősen befolyásolja a modell teljesítményét. Az Apple szerint az optimális arányok meghatározása ma gyakran próbálgatással történik, ez azonban nagyszabású előtanításnál költséges és nehezen kezelhető.
A kutatók ezért olyan rendszert javasolnak, amely egy célterülethez tartozó modell teljesítményét a modell mérete, a tanításhoz használt tokenek száma és az egyes tartományok súlya alapján becsüli meg. A tanulmány címe Scaling Laws for Optimal Data Mixtures, szerzői Mustafa Shukor, Louis Bethune, Dan Busbridge, David Grangier, Enrico Fini, Alaaeldin El-Nouby és Pierre Ablin. Shukor lábjegyzetben feltüntetett kötődése a Sorbonne University.
Kisebb kísérletekből nagyobb modellekre következtetnek
A módszer alapja, hogy a skálázási törvényeket különböző adatkeverékekkel végzett, kisebb léptékű tanítások eredményeire illesztik. Ezekből a kutatók megbecsülik, hogyan alakulna a veszteség, vagyis a modell hibáját jelző érték, eltérő modellméret, tokenmennyiség és tartományi súlyok mellett.
Az Apple kutatói szerint a módszer új, korábban nem vizsgált adatkeverékekre és más léptékekre is kiterjeszthető. A paraméterek néhány kisebb tanítási futtatásból meghatározhatók, majd felhasználhatók nagyobb modellek teljesítményének becslésére. A forrás példaként egy 1 milliárd paraméter alatti kísérleti méretet és egy 8 milliárd paraméteres modellt említ.
A kutatás kétféle skálázási törvényt vizsgál, az additív és a közös törvényt. Az Apple ábraleírása szerint ezek hasonló teljesítményt adtak, és jobbnak bizonyultak más adatkeverékeknél.
Három modellcsaládon vizsgálták az eljárást
A kutatók a skálázási törvények általánosíthatóságát három különböző, nagyléptékű előtanítási környezetben ellenőrizték. Ezek a nagy nyelvi modellek, a natív multimodális modellek és a nagy látásmodellek.
A cél egy olyan eljárás kialakítása volt, amely egy adott tanítási keret, vagyis a modellméret és a rendelkezésre álló tokenek száma mellett kiszámítható módon választja ki a tartományok súlyait. A módszer így alternatívát kínálhat a költséges próbálgatással szemben, és előre jelezheti, mely adatkeverék mellett érhető el kedvezőbb teljesítmény.
Az Apple kutatása a NeurIPS konferenciához kapcsolódó tanulmányként szerepel, a forrás szerint 2025 szeptemberében jelent meg. A vállalat 2026. augusztus 20-án kapcsolódó olvasmányként hivatkozott a témára, amely a korlátozott adatmennyiségű célterületek és a nagyobb mennyiségben elérhető általános adatok keverésének problémáját is érinti.
Apple: Scaling Laws for Optimal Data Mixtures


