A Google Cloud útmutatót adott ki a Gemini megerősítéses tanításához

A Google Cloud új útmutatóban mutatja be, hogyan szabhatók testre a Gemini modellek menedzselt megerősítéses tanulási szolgáltatással. A módszer akkor lehet hasznos, ha egy válasz eredménye könnyen pontozható, de a helyes megoldásokat nehéz előre összeállítani.
- A Google Cloud menedzselt RLFT szolgáltatással teszi lehetővé a Gemini testreszabását.
- A fejlesztő promptokat és jutalmazási függvényt ad, az infrastruktúrát a szolgáltatás kezeli.
- Az RLFT mérhető eredményű, de nehezen példázható feladatokra alkalmas.
- A bemutatott területek között szerepel a kód, a moderálás és a strukturált adatkinyerés.
- A Google Cloud szerint a jutalmazási függvény minősége meghatározza a végeredményt.
A fejlesztő adja a jutalmazást, a Google Cloud az infrastruktúrát
A Google Cloud 2026. szeptember 26-án közzétett útmutatója a Reinforcement Learning Fine-Tuning, röviden RLFT használatát ismerteti Gemini modellek testreszabására. A szolgáltatás célja, hogy a külső ügyfeleknek ne kelljen nagy számítási klasztereket működtetniük, illetve hozzáférést szerezniük a zárt modellek belső működéséhez.
Az ügyfél promptokat és egy jutalmazási függvényt ad meg, a szolgáltatás pedig kezeli az infrastruktúrát és a modell belső részleteit. A rendszer egy tanítási lépésben több lehetséges választ generál, ezeket a megadott jutalmazás alapján értékeli, majd úgy módosítja a modellt, hogy a magasabb pontszámú válaszok valószínűbbé váljanak.
Az RLFT nem előre megírt, úgynevezett aranyválaszokból tanul. A Google Cloud példája szerint egy adott adatbázissémához nehéz lenne minden ideális SQL-lekérdezést kézzel elkészíteni, a lekérdezés eredményét viszont futtatással ellenőrizni lehet.
Mikor érdemes az RLFT-t választani?
Az útmutató szerint a fejlesztőknek először a promptolást és a felügyelt finomhangolást, vagyis az SFT-t érdemes kimeríteniük. Az RLFT akkor lehet indokolt, ha egy választ meg lehet mérni, de annak helyes változatát nem lehet gazdaságosan előállítani, vagy ha az SFT teljesítménye egy fontos mutatóban, például a hűségben, a séma érvényességében vagy a hangnemben, már nem javul.
A módszer olyan feladatokra is illik, amelyeknél többféle helyes megoldás létezik. Az RLFT a modell saját kimeneteiből indul ki, az eredményt jutalmazza, és a Google Cloud szerint elsősorban a Gemini már meglévő képességeit erősíti fel. Emiatt nem alkalmas olyan készség megtanítására, amelyet a modell egyáltalán nem képes bemutatni.
A Google két használati mintát javasol. Ha az alapmodell már időnként sikeres, közvetlenül is alkalmazható az RLFT. Ha túl alacsony a kezdeti sikerarány, előbb rövid, könnyű SFT-szakasz jöhet, majd az RL folytatható a Continuous Tuning segítségével. Az útmutató figyelmeztet arra is, hogy a bemutatási példák túlzott megtanulása csökkentheti az RL későbbi javítási lehetőségét.
Játékoktól a kódvégrehajtásig
A Google Cloud több olyan felhasználási területet sorol fel, ahol az eredmény ellenőrizhető, a helyes válaszok teljes felsorolása viszont nehéz lenne. Játékokban az RLFT hosszú, többnyelvű párbeszédekben segíthet megtartani a szereplő személyiségét, a játékállapot szintaxisát és a beszélgetés folyamatosságát. A bemutatott esetben megszűntek a hurkok és a nyelvi elcsúszások.
Strukturált entitáskinyerésnél a rendszer számlákból és szállítólevelekből emelhet ki adatokat. A szabályalapú pontozás egyszerre jutalmazza a szükséges mezők megtalálását és bünteti a forrásban nem szereplő adatok kitalálását.
Tartalommoderálásnál a formátum-ellenőrzés és a determinisztikus értékelő összetett szabályokat és kivételeket kezelhet. A Google Cloud szerint ez csökkentette a téves pozitív jelzéseket és a hibás formátummal végrehajtott jutalommanipulációt.
További példa a futtatással mért kód, például SQL vagy API-hívás. A biztonságos környezetben futó jutalmazás csak akkor ad pontot, ha a kód lefordul, végrehajtható, és a helyes eredményt adja. Az útmutató HTML és CSS alapú prezentációk generálását is említi, ahol a renderelt diák vizuális minősége, elrendezése és szerkezeti teljessége alapján történik az értékelés.
A jutalmazási függvény a legfontosabb kiindulópont
Az első próbához a Google Cloud szerint elegendő egy változatos promptkészlet és egy elkülönített validációs rész. A tanítási és értékelési adatok szigorú szétválasztása segít elkerülni, hogy az értékelésben rejtett átfedés elfedje a túlillesztést.
A jutalmazási függvény minősége meghatározó. A dokumentáció olyan megoldást javasol, amely összefügg az emberi preferenciákkal, kezeli a hibás formátumú kimeneteket, és ellenáll a jutalom kijátszásának. Ilyen védelem lehet több értékelő együttes használata, a túl hosszú válaszok büntetése és a használhatatlan kimenetek alsó pontszámának rögzítése.
A Google Cloud azt tanácsolja, hogy a jutalmazást még az éles indítás előtt, offline környezetben ellenőrizzék. A szolgáltatás alapbeállításokkal elindítható, a fejlesztők pedig a konzolon követhetik a jutalmazási és validációs görbéket. A kiválasztandó ellenőrzőpont az útmutató szerint az, amelynél a validációs jutalom telítődik, nem feltétlenül az utolsó tanítási lépés.


