Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple új módszert mutatott be a diffúziós nyelvi modellek tanítására

2026. augusztus 18.Forrás: Apple
Az Apple új módszert mutatott be a diffúziós nyelvi modellek tanítására
Kép: Apple

Az Apple kutatói a DACA-GRPO nevű módszert javasolják a diffúziós nyelvi modellek megerősítéses tanulásához. A megoldás a szöveg előállításának egyes zajtalanítási lépéseit súlyozza, és az Apple szerint többek között matematikai, programozási és strukturált szöveggenerálási feladatokon javította az eredményeket.

A lényeg röviden
  • Az Apple kutatói bemutatták a DACA-GRPO módszert.
  • Az eljárás a diffúziós modellek zajtalanítási lépéseit súlyozza.
  • A módszer két eleme a Denoising Progress Scores és a Stratified Masking Likelihood.
  • A kutatás hét benchmarkon mért javulást három GRPO-alapmódszer mellett.
  • A legnagyobb közölt javulás a korlátozott feltételek teljesítésénél 36,3 százalékpont volt.

A diffúziós modellek tanításának két problémája

Az Apple kutatási oldalán szeptember 2026-ra datált tanulmány a diffúziós nagy nyelvi modelleket az autoregresszív modellek egyik alternatívájaként mutatja be. Ezek a modellek a szöveget egy zajtalanítási pályán állítják elő, az Apple kutatói szerint azonban a jelenlegi megerősítéses tanulási módszerek ennek minden lépését azonos fontosságúnak kezelik.

A kutatás két alapvető hiányosságot azonosít. Az egyik, hogy nincs időbeli hozzárendelés a zajtalanítási folyamat egyes lépései között, ezért a tanítás nem különíti el megfelelően az eltérő jelentőségű lépéseket. A másik a szakirodalomban használt, úgynevezett mean-field valószínűségi becslések szisztematikus torzítása. A szerzők szerint ezek a becslések nagy szórással járnak, és ez megnehezíti a szabályzat optimalizálását.

Két mechanizmus egy GRPO-tréner kiegészítésére

A tanulmány a Denoising-Aware Credit Assignment for GRPO, röviden DACA-GRPO nevű eljárást javasolja. A GRPO, vagyis a Group Relative Policy Optimization, a megerősítéses tanulás egyik csoportalapú optimalizálási módszere. A DACA-GRPO-t a szerzők könnyen beilleszthető, bármely GRPO-alapú trénerrel használható kiegészítésként írják le.

Az első elem a Denoising Progress Scores. Ez a köztes előrejelzésekből tokenenkénti fontossági súlyokat állít elő, és a kutatók szerint ehhez nincs szükség további előreirányú számításra. A második elem a Stratified Masking Likelihood. Ez a tokenpozíciókat rétegekre osztja, hogy minden tokent a szekvencia lehető legnagyobb részének kontextusában jelezzen előre. A cél a mean-field becslések torzításának csökkentése.

Javulás hét különböző mérési területen

A kutatók három GRPO-alapmódszerre építve vizsgálták a DACA-GRPO-t. A tanulmány szerint az eljárás mind a hét vizsgált benchmarkon következetes javulást hozott. A tesztek matematikai következtetést, kódgenerálást, korlátozott feltételek teljesítését és korlátozott szöveggenerálást is lefedtek.

  • Matematikai következtetésben legfeljebb 5,6 százalékpontos javulást mértek.
  • Kódgenerálásban a legnagyobb növekedés 7,4 százalékpont volt.
  • Korlátozott feltételek teljesítésénél legfeljebb 36,3 százalékpontos javulást értek el.
  • JSON-sémák követésében a javulás elérte az 5,9 százalékpontot.

A tanulmány szerzői Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Lokesh Boominathan, Manuel R. Ciosici, Yizhe Zhang és Irina Belousova. A forrás szerint Amin Karimi Monsefi az Ohio State University kutatója, a munka pedig részben az Apple-nél készült.

Mit jelenthet ez a fejlesztőknek?

Az Apple által közölt eredmények alapján a DACA-GRPO olyan fejlesztőknek lehet releváns, akik diffúziós nyelvi modelleket GRPO-alapú megerősítéses tanulással optimalizálnak. A módszer a meglévő tréningfolyamat kiegészítéseként készült, miközben a zajtalanítási pálya eltérő lépéseinek fontosságát és a tokenek valószínűségének becslését is kezeli.

A forrás ugyanakkor kutatási eredményeket és benchmarkokon elért javulásokat ismertet. A közlemény nem ad meg külön termékmegjelenést, felhasználói hozzáférést vagy kereskedelmi bevezetést a DACA-GRPO-hoz.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói képzés nélküli, ABX-alapú feladatokat mutattak be a többnyelvű nyelvi modellek vizsgálatára. Az XLM-R elemzése szerint a nyelvazonosításhoz kapcsolódó…

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket
Kutatás2026. október 1.

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket

Saját, rövid tanulságok megfogalmazásával javítaná az AI-ügynökök tanulását az Apple új kutatása. Az RLTL;DR nevű módszer olyan feladatokra céloz, ahol a modell…