Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Apple módszert dolgozott ki az optimális tanítási adatkeverékhez

2026. augusztus 20.Forrás: Apple
Apple módszert dolgozott ki az optimális tanítási adatkeverékhez
Kép: Apple

Az Apple kutatói olyan módszert mutattak be, amely skálázási törvényekkel becsüli meg a nagy mesterségesintelligencia-modellekhez használható optimális tanítási adatkeveréket. A megközelítés néhány kisebb léptékű kísérletből próbál következtetni a nagyobb modellek teljesítményére és a különböző adatforrások ideális arányára.

A lényeg röviden
  • Az Apple kutatói skálázási törvényekkel választanák ki az optimális adatkeveréket.
  • A módszer kisebb léptékű tanításokból becsüli meg a nagyobb modellek teljesítményét.
  • A vizsgálat nyelvi, multimodális és látásmodellekre is kiterjedt.
  • Az eljárás célja a költséges próbálgatás csökkentése.
  • A tanulmány a forrás szerint 2025 szeptemberében jelent meg a NeurIPS-hez kapcsolódva.

A tanítási adatok aránya kulcsfontosságú

A nagy alapmodelleket jellemzően több tartományból származó adatokkal tanítják. Ezek aránya, vagyis az adatkeverék, jelentősen befolyásolja a modell teljesítményét. Az Apple szerint az optimális arányok meghatározása ma gyakran próbálgatással történik, ez azonban nagyszabású előtanításnál költséges és nehezen kezelhető.

A kutatók ezért olyan rendszert javasolnak, amely egy célterülethez tartozó modell teljesítményét a modell mérete, a tanításhoz használt tokenek száma és az egyes tartományok súlya alapján becsüli meg. A tanulmány címe Scaling Laws for Optimal Data Mixtures, szerzői Mustafa Shukor, Louis Bethune, Dan Busbridge, David Grangier, Enrico Fini, Alaaeldin El-Nouby és Pierre Ablin. Shukor lábjegyzetben feltüntetett kötődése a Sorbonne University.

Kisebb kísérletekből nagyobb modellekre következtetnek

A módszer alapja, hogy a skálázási törvényeket különböző adatkeverékekkel végzett, kisebb léptékű tanítások eredményeire illesztik. Ezekből a kutatók megbecsülik, hogyan alakulna a veszteség, vagyis a modell hibáját jelző érték, eltérő modellméret, tokenmennyiség és tartományi súlyok mellett.

Az Apple kutatói szerint a módszer új, korábban nem vizsgált adatkeverékekre és más léptékekre is kiterjeszthető. A paraméterek néhány kisebb tanítási futtatásból meghatározhatók, majd felhasználhatók nagyobb modellek teljesítményének becslésére. A forrás példaként egy 1 milliárd paraméter alatti kísérleti méretet és egy 8 milliárd paraméteres modellt említ.

A kutatás kétféle skálázási törvényt vizsgál, az additív és a közös törvényt. Az Apple ábraleírása szerint ezek hasonló teljesítményt adtak, és jobbnak bizonyultak más adatkeverékeknél.

Három modellcsaládon vizsgálták az eljárást

A kutatók a skálázási törvények általánosíthatóságát három különböző, nagyléptékű előtanítási környezetben ellenőrizték. Ezek a nagy nyelvi modellek, a natív multimodális modellek és a nagy látásmodellek.

A cél egy olyan eljárás kialakítása volt, amely egy adott tanítási keret, vagyis a modellméret és a rendelkezésre álló tokenek száma mellett kiszámítható módon választja ki a tartományok súlyait. A módszer így alternatívát kínálhat a költséges próbálgatással szemben, és előre jelezheti, mely adatkeverék mellett érhető el kedvezőbb teljesítmény.

Az Apple kutatása a NeurIPS konferenciához kapcsolódó tanulmányként szerepel, a forrás szerint 2025 szeptemberében jelent meg. A vállalat 2026. augusztus 20-án kapcsolódó olvasmányként hivatkozott a témára, amely a korlátozott adatmennyiségű célterületek és a nagyobb mennyiségben elérhető általános adatok keverésének problémáját is érinti.

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket
Kutatás2026. október 1.

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket

Saját, rövid tanulságok megfogalmazásával javítaná az AI-ügynökök tanulását az Apple új kutatása. Az RLTL;DR nevű módszer olyan feladatokra céloz, ahol a modell…