A Google új módszere pontosabban irányítaná az AI-képgenerálást

A Diffusion Controller nevű Google Research keretrendszer azt célozza, hogy a szövegből képet készítő modellek jobban kövessék a felhasználói utasításokat, miközben megőrzik a képminőséget. A megoldás egy könnyű kiegészítő hálózatként kapcsolódik a meglévő modellekhez, akár korlátozott hozzáférésű, zárt rendszerekhez is.
- A Google Research 2026. szeptember 29-én mutatta be a Diffusion Controller keretrendszert.
- A módszer könnyű kiegészítő hálózatként tereli a képgenerálási folyamatot a felhasználói célok felé.
- A tesztek Stable Diffusion v1.4 alapmodellen, SFT, RWL és PPO rezsimekben futottak.
- A Google szerint a gray-box Diffusion Controller az SFT és RWL pályákon HPS-v2 win rate alapján felülmúlta a LoRA-t.
- A white-box változat a forrás szerint 90% win rate-et ért el az alapmodellhez képest.
Könnyű vezérlőréteg a képgeneráló modellek mellé
A Google Research 2026. szeptember 29-én ismertette a Diffusion Controller nevű keretrendszert, amelyet Chih-wei Hsu és Moonkyung Ryu, a Google Research szoftvermérnökei mutattak be. A cég leírása szerint a módszer egy könnyű, „steering damper” jellegű hálózat, amely a képgenerálási folyamatot pontosabban tereli a felhasználói szándék felé.
A kiinduló probléma az, hogy a szövegből képet készítő modellek, például a forrásban említett Nano Banana, Stable Diffusion és Flux, látványos, nagy hűségű képek előállítására képesek, de nehezen irányíthatók, ha a felhasználó pontos vizuális feltételeket vár el. A Google példája szerint egy „napszemüveget viselő gyík” promptnál a modell előállíthat valósághű gyíkot napszemüveg nélkül, vagy a napszemüveg erőltetése eltorzíthatja a gyík arcát.
A Diffusion Controller erre a feszültségre kínál keretrendszert. A képgenerálást nem különálló lépések merev sorozataként kezeli, hanem folyamatos vezérlési problémaként. A Google hasonlata szerint az alapmodell olyan, mint egy nagy teljesítményű motorkerékpár, amelynek a motorját nem kell átépíteni: a Diffusion Controller ehhez képest egy könnyű kormánycsillapítóként kapcsolódik hozzá, miközben az alapmodell változatlan marad.
A cél: jobb promptkövetés torzítás nélkül
A keretrendszer lényege, hogy a kép előállítása közben apró korrekciókkal módosítja a generálás pályáját. A Google szerint ezzel nagyobb súlyt kaphatnak azok az irányok, amelyek egy felhasználó által meghatározott célt szolgálnak, például egy művészi stílust vagy kontextuális illeszkedést.
A módszer a leírás szerint visszacsatolás alapján optimalizálja ezeket az eltolásokat, így a modell az új felhasználói preferenciák felé terelhető, miközben megőrzi az alapmodell vizuális képminőségét és stabilitását. A Google a gyíkos példánál azt írja, hogy a vezérlés segíthet a napszemüveg megjelenítésében, míg egy büntető védőkorlát megakadályozza, hogy a rendszer emiatt eltorzítsa a gyík természetes pikkelyeit és arányait.
A kutatók két gyakorlati finomhangolási módszert is bemutatnak, amelyek végső jutalompontszámra épülnek. Az egyik a policy gradient és PPO megközelítés, amely fokozatos korrekciókkal dolgozik, és beépített „clipping rule” korlátozással igyekszik stabilan tartani a tanítást. A másik a reward-weighted loss, amely közvetlenebb optimalizálási utat kínál, és erősen jutalmazza a jó minőségű eredményt adó generálási folyamatokat.
Zárt modelleknél is működhet a Google szerint
A Diffusion Controller egyik hangsúlyos állítása, hogy nem csak teljesen hozzáférhető, úgynevezett white-box környezetben használható. A Google szerint a kiegészítő hálózat zárt vagy részben zárt, black box, illetve gray box modellekhez is illeszthető, anélkül hogy a mérnököknek hozzá kellene nyúlniuk az alapmodell belső kódjához.
A forrás szerint a hálózat a képet a zajtalanítás közben figyeli, és pontos, kis léptékű irányítási korrekciókat fecskendez a folyamatba. Ez azért fontos a Google érvelése szerint, mert a legerősebb képgeneráló modellek gyakran vállalati titokként működnek, így a belső súlyok és beállítások módosítása nem mindig lehetséges.
A kutatók Stable Diffusion v1.4 alapmodellen vizsgálták a keretrendszert három finomhangolási rezsimben: supervised fine-tuning, reward-weighted loss és PPO. A teljesítményt a Human Preference Score, HPS-v2 szabványosított mérőszámmal értékelték, amely azt méri, mennyire illeszkednek a generált képek a felhasználói promptokhoz és esztétikai választásokhoz.
A Google négy hálózati struktúrát valósított meg a Diffusion Controller keretrendszerben: Diffusion Controller, Diffusion Controller-Naive, Diffusion Controller-J és Diffusion Controller-S. A cég szerint a gray-box Diffusion Controller az SFT és RWL pályákon HPS-v2 win rate alapján felülmúlta a LoRA-t, amelyet a forrás korszerű, paraméterhatékony white-box megközelítésként ír le. A teljesen feloldott, white-box változat a Google szerint 90% win rate-et ért el az alapmodellhez képest.
Mit jelenthet ez a felhasználóknak és a piacnak?
A Google Research szerint a Diffusion Controller gyakorlati előnye az lehet, hogy a képgeneráló rendszerek finomabban hangolhatók a kívánt eredmény felé, miközben kisebb kockázattal romlik a kép stabilitása. A forrás alapján ez különösen olyan helyzetekben lehet fontos, ahol a felhasználó összetett, több tulajdonságot tartalmazó promptot ad meg, és egyszerre vár el pontos illeszkedést, valamint jó vizuális minőséget.
A keretrendszer futás közbeni rugalmasságot is kínál: a Google szerint egyetlen inference-time guidance strength paraméter állításával a felhasználók növelhetik vagy csökkenthetik a vezérlési korlátok intenzitását. Ez a leírás alapján lehetővé teszi a promptkövetés fokozatos szabályozását anélkül, hogy az alapmodell stabilitása sérülne, vagy a régebbi irányítási módszerekre jellemző vizuális torzítások jelennének meg.
A piaci jelentőség a forrásból levezethetően abban áll, hogy a módszer nem igényel minden esetben teljes hozzáférést az alapmodellhez. Ha a Google állításai a gyakorlatban is érvényesülnek, a Diffusion Controller olyan környezetekben is használható lehet a képgenerálás testreszabására, ahol a modell belső működése korlátozottan hozzáférhető.
Google Research: How Diffusion Controller unifies and simplifies AI image generation


