Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Google-kutatás: matematikailag magyarázható a diffúziós modellek kreativitása

2026. július 15.Forrás: Google Research
Google-kutatás: matematikailag magyarázható a diffúziós modellek kreativitása
Kép: Google Research

A diffúziós modellek azért képesek a tanítóadatoktól eltérő, mégis valószerű képeket és más adatokat létrehozni, mert a neurális hálózatok a tanult pontszámfüggvény egy simított változatát sajátítják el. A Google Research matematikai elemzése szerint ez az úgynevezett score smoothing, vagyis pontszámfüggvény-simítás, az adatok közötti interpolációhoz vezet.

A lényeg röviden
  • A diffúziós modellek kreativitása a Google Research szerint matematikailag magyarázható.
  • A neurális hálózatok a pontszámfüggvény simított változatát tanulják meg.
  • A simítás a tanítóadatok közötti interpolációhoz vezet.
  • Többdimenziós adatoknál a folyamat segíti a rejtett adatsokaság feltárását.
  • A kutatás az ICLR 2026 konferencián bemutatott tanulmányra épül.

A zajból fokozatosan lesz értelmes adat

A diffúziós modellek tanítása során valódi adatokat, például macskafotókat, zajjal rontanak el addig, amíg azok felismerhetetlenné válnak. A modellnek ezután lépésről lépésre meg kell tanulnia visszafordítani ezt a folyamatot, hogy tiszta zajból valószerű képet állítson elő. Ezt a folyamatot zajtalanításnak nevezik.

Ha a modell tökéletesen tanulná meg a zajtalanítást, kizárólag a tanítóadatokból kiindulva, azok pontos másolatait állítaná elő. Ez memorizálás lenne, amelyben a rendszer inkább visszakereső eszközként működne. A gyakorlatban a diffúziós modellek ennél többre képesek, és új adatminta létrehozásával általánosítanak.

A zajtalanítást a Google Research egy erőtérhez hasonlítja. Ebben az egyes adatpontok a zajból indulnak, a score function, vagyis pontszámfüggvény pedig megadja, hogy az adott pillanatban merre kell továbbhaladniuk.

A simítás új adatpontokat hoz létre

A kutatás szerint a modellek kreativitása abból fakad, hogy a neurális hálózatok jellemzően nem tanulják meg tökéletes pontossággal a pontszámfüggvényt. A regularizáció, vagyis a tanulást korlátozó eljárások hatására a hálózat a függvény éles változásait kisimítja. A Google ezt score smoothingnak nevezi.

A kutatók egy egydimenziós példán mutatták be a jelenséget, amelyben mindössze két tanítóadat szerepelt, a +1 és a -1 pont. A tökéletes pontszámfüggvény a zajból érkező adatokat végül valamelyik eredeti pontra húzná, így memorizálás történne. A simított függvény viszont lassítja az adatpontok mozgását a két pont közötti térségben. Emiatt egyes pontok az úgynevezett interpolációs zónában, a tanítóadatok közötti tartományban nyugszanak meg.

A kutatók két rétegű, ReLU-alapú neurális hálózatokat tanítottak a pontszámfüggvény közelítésére. A paramétereket az AdamW algoritmussal optimalizálták, különböző súlycsökkentési, weight decay értékek mellett. Az eredmény szerint az erősebb súlycsökkentés simább függvényt eredményezett a középső tartományban. A tanulmány azt is megállapítja, hogy hasonló simítás explicit súlycsökkentés nélkül, a gradiensalapú tanítás implicit regularizációja miatt is kialakulhat.

A folyamat a rejtett adatsokaság feltárását segíti

A nagy felbontású képek és más összetett adatok magas dimenziószámú pixelterekben helyezkednek el. Ezeknek a tereknek a nagy része az ember számára értelmetlen véletlen zaj, a felismerhető képek viszont egy kisebb, rejtett adatsokaságon, az úgynevezett data manifoldon találhatók.

A Google Research szerint a képgenerálás egyik feladata ennek a rejtett sokaságnak a helyreállítása. A modellnek a véges számú tanítóadat alapján kell következtetnie annak alakjára, majd új pontokat kell létrehoznia rajta. Többdimenziós esetben a pontszámfüggvény simítása irányfüggően működik.

A sokasággal párhuzamos irányokban lassítja az adatpontok tanítóadatok felé történő összeomlását. A sokaság felé mutató irányokban viszont a tökéletes pontszámfüggvény eleve viszonylag sima, ezért a további simítás kevésbé változtat rajta. Így a folyamat nem áll meg a zajos, üres térben, és a modell egyszerre hozhat létre valószerű és új adatokat.

Miért fontos ez a generatív modellek számára?

A Google Research, a 2026. július 15-én közzétett bejegyzésben, az ICLR 2026 konferencián bemutatott tanulmányra hivatkozva azt állítja, hogy a diffúziós modellek kreativitása kiszámítható matematikai következmény lehet. A kutatás szerint a neurális hálózatok tökéletlen, simított függvényeket tanulnak, ezek pedig hidat képeznek az ismert adatok között.

A szerzők szerint ez segít megmagyarázni, miként tudnak a diffúziós modellek képgenerálásban és molekulafelfedezésben új, valószerű mintákat létrehozni a tanítóadatok egyszerű megjegyzése helyett. A Google Research következtetése szerint a mechanizmus az adatok minősége és az újdonság közötti egyensúly kialakításában játszik szerepet.

Google ResearchICLR 2026On the Interpolation Effect of Score Smoothing in Diffusion Modelskutatási eredményképgenerálás

Kapcsolódó hírek

MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI
Kutatás2026. október 2.

MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI

A MedPAIR adatbázis azt méri, hogy az orvosok és a nagy nyelvi modellek ugyanazokat a mondatokat tartják-e fontosnak egy klinikai kérdés megválaszolásához. A kutatásban…

A Google új rendszerrel teszi ellenőrizhetőbbé a szövetségi tanulás védelmét
Kutatás2026. október 2.

A Google új rendszerrel teszi ellenőrizhetőbbé a szövetségi tanulás védelmét

A Google Research új, Trusted Execution Environmentekre épülő szövetségi tanulási rendszert jelentett be. A megoldás külső felek számára is ellenőrizhető adatvédelmi…

A Google új módszere pontosabban irányítaná az AI-képgenerálást
Kutatás2026. szeptember 29.

A Google új módszere pontosabban irányítaná az AI-képgenerálást

A Diffusion Controller nevű Google Research keretrendszer azt célozza, hogy a szövegből képet készítő modellek jobban kövessék a felhasználói utasításokat, miközben…