Az Apple új módszert mutatott be a diffúziós nyelvi modellek tanítására

Az Apple kutatói a DACA-GRPO nevű módszert javasolják a diffúziós nyelvi modellek megerősítéses tanulásához. A megoldás a szöveg előállításának egyes zajtalanítási lépéseit súlyozza, és az Apple szerint többek között matematikai, programozási és strukturált szöveggenerálási feladatokon javította az eredményeket.
- Az Apple kutatói bemutatták a DACA-GRPO módszert.
- Az eljárás a diffúziós modellek zajtalanítási lépéseit súlyozza.
- A módszer két eleme a Denoising Progress Scores és a Stratified Masking Likelihood.
- A kutatás hét benchmarkon mért javulást három GRPO-alapmódszer mellett.
- A legnagyobb közölt javulás a korlátozott feltételek teljesítésénél 36,3 százalékpont volt.
A diffúziós modellek tanításának két problémája
Az Apple kutatási oldalán szeptember 2026-ra datált tanulmány a diffúziós nagy nyelvi modelleket az autoregresszív modellek egyik alternatívájaként mutatja be. Ezek a modellek a szöveget egy zajtalanítási pályán állítják elő, az Apple kutatói szerint azonban a jelenlegi megerősítéses tanulási módszerek ennek minden lépését azonos fontosságúnak kezelik.
A kutatás két alapvető hiányosságot azonosít. Az egyik, hogy nincs időbeli hozzárendelés a zajtalanítási folyamat egyes lépései között, ezért a tanítás nem különíti el megfelelően az eltérő jelentőségű lépéseket. A másik a szakirodalomban használt, úgynevezett mean-field valószínűségi becslések szisztematikus torzítása. A szerzők szerint ezek a becslések nagy szórással járnak, és ez megnehezíti a szabályzat optimalizálását.
Két mechanizmus egy GRPO-tréner kiegészítésére
A tanulmány a Denoising-Aware Credit Assignment for GRPO, röviden DACA-GRPO nevű eljárást javasolja. A GRPO, vagyis a Group Relative Policy Optimization, a megerősítéses tanulás egyik csoportalapú optimalizálási módszere. A DACA-GRPO-t a szerzők könnyen beilleszthető, bármely GRPO-alapú trénerrel használható kiegészítésként írják le.
Az első elem a Denoising Progress Scores. Ez a köztes előrejelzésekből tokenenkénti fontossági súlyokat állít elő, és a kutatók szerint ehhez nincs szükség további előreirányú számításra. A második elem a Stratified Masking Likelihood. Ez a tokenpozíciókat rétegekre osztja, hogy minden tokent a szekvencia lehető legnagyobb részének kontextusában jelezzen előre. A cél a mean-field becslések torzításának csökkentése.
Javulás hét különböző mérési területen
A kutatók három GRPO-alapmódszerre építve vizsgálták a DACA-GRPO-t. A tanulmány szerint az eljárás mind a hét vizsgált benchmarkon következetes javulást hozott. A tesztek matematikai következtetést, kódgenerálást, korlátozott feltételek teljesítését és korlátozott szöveggenerálást is lefedtek.
- Matematikai következtetésben legfeljebb 5,6 százalékpontos javulást mértek.
- Kódgenerálásban a legnagyobb növekedés 7,4 százalékpont volt.
- Korlátozott feltételek teljesítésénél legfeljebb 36,3 százalékpontos javulást értek el.
- JSON-sémák követésében a javulás elérte az 5,9 százalékpontot.
A tanulmány szerzői Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Lokesh Boominathan, Manuel R. Ciosici, Yizhe Zhang és Irina Belousova. A forrás szerint Amin Karimi Monsefi az Ohio State University kutatója, a munka pedig részben az Apple-nél készült.
Mit jelenthet ez a fejlesztőknek?
Az Apple által közölt eredmények alapján a DACA-GRPO olyan fejlesztőknek lehet releváns, akik diffúziós nyelvi modelleket GRPO-alapú megerősítéses tanulással optimalizálnak. A módszer a meglévő tréningfolyamat kiegészítéseként készült, miközben a zajtalanítási pálya eltérő lépéseinek fontosságát és a tokenek valószínűségének becslését is kezeli.
A forrás ugyanakkor kutatási eredményeket és benchmarkokon elért javulásokat ismertet. A közlemény nem ad meg külön termékmegjelenést, felhasználói hozzáférést vagy kereskedelmi bevezetést a DACA-GRPO-hoz.
Apple: DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models


