Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Google új módszere pontosabban irányítaná az AI-képgenerálást

2026. szeptember 29.Forrás: Google Research
A Google új módszere pontosabban irányítaná az AI-képgenerálást
Kép: Google Research

A Diffusion Controller nevű Google Research keretrendszer azt célozza, hogy a szövegből képet készítő modellek jobban kövessék a felhasználói utasításokat, miközben megőrzik a képminőséget. A megoldás egy könnyű kiegészítő hálózatként kapcsolódik a meglévő modellekhez, akár korlátozott hozzáférésű, zárt rendszerekhez is.

A lényeg röviden
  • A Google Research 2026. szeptember 29-én mutatta be a Diffusion Controller keretrendszert.
  • A módszer könnyű kiegészítő hálózatként tereli a képgenerálási folyamatot a felhasználói célok felé.
  • A tesztek Stable Diffusion v1.4 alapmodellen, SFT, RWL és PPO rezsimekben futottak.
  • A Google szerint a gray-box Diffusion Controller az SFT és RWL pályákon HPS-v2 win rate alapján felülmúlta a LoRA-t.
  • A white-box változat a forrás szerint 90% win rate-et ért el az alapmodellhez képest.

Könnyű vezérlőréteg a képgeneráló modellek mellé

A Google Research 2026. szeptember 29-én ismertette a Diffusion Controller nevű keretrendszert, amelyet Chih-wei Hsu és Moonkyung Ryu, a Google Research szoftvermérnökei mutattak be. A cég leírása szerint a módszer egy könnyű, „steering damper” jellegű hálózat, amely a képgenerálási folyamatot pontosabban tereli a felhasználói szándék felé.

A kiinduló probléma az, hogy a szövegből képet készítő modellek, például a forrásban említett Nano Banana, Stable Diffusion és Flux, látványos, nagy hűségű képek előállítására képesek, de nehezen irányíthatók, ha a felhasználó pontos vizuális feltételeket vár el. A Google példája szerint egy „napszemüveget viselő gyík” promptnál a modell előállíthat valósághű gyíkot napszemüveg nélkül, vagy a napszemüveg erőltetése eltorzíthatja a gyík arcát.

A Diffusion Controller erre a feszültségre kínál keretrendszert. A képgenerálást nem különálló lépések merev sorozataként kezeli, hanem folyamatos vezérlési problémaként. A Google hasonlata szerint az alapmodell olyan, mint egy nagy teljesítményű motorkerékpár, amelynek a motorját nem kell átépíteni: a Diffusion Controller ehhez képest egy könnyű kormánycsillapítóként kapcsolódik hozzá, miközben az alapmodell változatlan marad.

A cél: jobb promptkövetés torzítás nélkül

A keretrendszer lényege, hogy a kép előállítása közben apró korrekciókkal módosítja a generálás pályáját. A Google szerint ezzel nagyobb súlyt kaphatnak azok az irányok, amelyek egy felhasználó által meghatározott célt szolgálnak, például egy művészi stílust vagy kontextuális illeszkedést.

A módszer a leírás szerint visszacsatolás alapján optimalizálja ezeket az eltolásokat, így a modell az új felhasználói preferenciák felé terelhető, miközben megőrzi az alapmodell vizuális képminőségét és stabilitását. A Google a gyíkos példánál azt írja, hogy a vezérlés segíthet a napszemüveg megjelenítésében, míg egy büntető védőkorlát megakadályozza, hogy a rendszer emiatt eltorzítsa a gyík természetes pikkelyeit és arányait.

A kutatók két gyakorlati finomhangolási módszert is bemutatnak, amelyek végső jutalompontszámra épülnek. Az egyik a policy gradient és PPO megközelítés, amely fokozatos korrekciókkal dolgozik, és beépített „clipping rule” korlátozással igyekszik stabilan tartani a tanítást. A másik a reward-weighted loss, amely közvetlenebb optimalizálási utat kínál, és erősen jutalmazza a jó minőségű eredményt adó generálási folyamatokat.

Zárt modelleknél is működhet a Google szerint

A Diffusion Controller egyik hangsúlyos állítása, hogy nem csak teljesen hozzáférhető, úgynevezett white-box környezetben használható. A Google szerint a kiegészítő hálózat zárt vagy részben zárt, black box, illetve gray box modellekhez is illeszthető, anélkül hogy a mérnököknek hozzá kellene nyúlniuk az alapmodell belső kódjához.

A forrás szerint a hálózat a képet a zajtalanítás közben figyeli, és pontos, kis léptékű irányítási korrekciókat fecskendez a folyamatba. Ez azért fontos a Google érvelése szerint, mert a legerősebb képgeneráló modellek gyakran vállalati titokként működnek, így a belső súlyok és beállítások módosítása nem mindig lehetséges.

A kutatók Stable Diffusion v1.4 alapmodellen vizsgálták a keretrendszert három finomhangolási rezsimben: supervised fine-tuning, reward-weighted loss és PPO. A teljesítményt a Human Preference Score, HPS-v2 szabványosított mérőszámmal értékelték, amely azt méri, mennyire illeszkednek a generált képek a felhasználói promptokhoz és esztétikai választásokhoz.

A Google négy hálózati struktúrát valósított meg a Diffusion Controller keretrendszerben: Diffusion Controller, Diffusion Controller-Naive, Diffusion Controller-J és Diffusion Controller-S. A cég szerint a gray-box Diffusion Controller az SFT és RWL pályákon HPS-v2 win rate alapján felülmúlta a LoRA-t, amelyet a forrás korszerű, paraméterhatékony white-box megközelítésként ír le. A teljesen feloldott, white-box változat a Google szerint 90% win rate-et ért el az alapmodellhez képest.

Mit jelenthet ez a felhasználóknak és a piacnak?

A Google Research szerint a Diffusion Controller gyakorlati előnye az lehet, hogy a képgeneráló rendszerek finomabban hangolhatók a kívánt eredmény felé, miközben kisebb kockázattal romlik a kép stabilitása. A forrás alapján ez különösen olyan helyzetekben lehet fontos, ahol a felhasználó összetett, több tulajdonságot tartalmazó promptot ad meg, és egyszerre vár el pontos illeszkedést, valamint jó vizuális minőséget.

A keretrendszer futás közbeni rugalmasságot is kínál: a Google szerint egyetlen inference-time guidance strength paraméter állításával a felhasználók növelhetik vagy csökkenthetik a vezérlési korlátok intenzitását. Ez a leírás alapján lehetővé teszi a promptkövetés fokozatos szabályozását anélkül, hogy az alapmodell stabilitása sérülne, vagy a régebbi irányítási módszerekre jellemző vizuális torzítások jelennének meg.

A piaci jelentőség a forrásból levezethetően abban áll, hogy a módszer nem igényel minden esetben teljes hozzáférést az alapmodellhez. Ha a Google állításai a gyakorlatban is érvényesülnek, a Diffusion Controller olyan környezetekben is használható lehet a képgenerálás testreszabására, ahol a modell belső működése korlátozottan hozzáférhető.

Kapcsolódó hírek

A Google mélytanulással térképezné fel a metáncsóvákat az űrből
Kutatás2026. szeptember 1.

A Google mélytanulással térképezné fel a metáncsóvákat az űrből

A Google Research 2026. szeptember 1-jén ismertette a MAPL-EMIT nevű mélytanulási keretrendszert, amely EMIT műholdas mérésekből automatikusan azonosít metáncsóvákat. A…

Virtuális kézmozdulatokkal segítené az XR-asszisztenseket a Google
Kutatás2026. augusztus 25.

Virtuális kézmozdulatokkal segítené az XR-asszisztenseket a Google

A Google Research 2026. augusztus 25-én mutatta be az AgentHands nevű XR-kutatási prototípust. A rendszer nagy nyelvi modellre épül, és beszéddel szinkronizált, kifejező…

A Google szerint a mobilitási adatok jobb helyismeretet adhatnak az AI-modelleknek
Kutatás2026. augusztus 21.

A Google szerint a mobilitási adatok jobb helyismeretet adhatnak az AI-modelleknek

A Google Research 2026. augusztus 21-én mutatta be a Mobility-Embedded POIs, röviden ME-POIs nevű keretrendszert. A megközelítés nyelvi modellek helyreprezentációit…