Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Google Cloud útmutatót adott ki a Gemini megerősítéses tanításához

2026. szeptember 25.Forrás: Google Cloud
A Google Cloud útmutatót adott ki a Gemini megerősítéses tanításához
Kép: Google Cloud

A Google Cloud új útmutatóban mutatja be, hogyan szabhatók testre a Gemini modellek menedzselt megerősítéses tanulási szolgáltatással. A módszer akkor lehet hasznos, ha egy válasz eredménye könnyen pontozható, de a helyes megoldásokat nehéz előre összeállítani.

A lényeg röviden
  • A Google Cloud menedzselt RLFT szolgáltatással teszi lehetővé a Gemini testreszabását.
  • A fejlesztő promptokat és jutalmazási függvényt ad, az infrastruktúrát a szolgáltatás kezeli.
  • Az RLFT mérhető eredményű, de nehezen példázható feladatokra alkalmas.
  • A bemutatott területek között szerepel a kód, a moderálás és a strukturált adatkinyerés.
  • A Google Cloud szerint a jutalmazási függvény minősége meghatározza a végeredményt.

A fejlesztő adja a jutalmazást, a Google Cloud az infrastruktúrát

A Google Cloud 2026. szeptember 26-án közzétett útmutatója a Reinforcement Learning Fine-Tuning, röviden RLFT használatát ismerteti Gemini modellek testreszabására. A szolgáltatás célja, hogy a külső ügyfeleknek ne kelljen nagy számítási klasztereket működtetniük, illetve hozzáférést szerezniük a zárt modellek belső működéséhez.

Az ügyfél promptokat és egy jutalmazási függvényt ad meg, a szolgáltatás pedig kezeli az infrastruktúrát és a modell belső részleteit. A rendszer egy tanítási lépésben több lehetséges választ generál, ezeket a megadott jutalmazás alapján értékeli, majd úgy módosítja a modellt, hogy a magasabb pontszámú válaszok valószínűbbé váljanak.

Az RLFT nem előre megírt, úgynevezett aranyválaszokból tanul. A Google Cloud példája szerint egy adott adatbázissémához nehéz lenne minden ideális SQL-lekérdezést kézzel elkészíteni, a lekérdezés eredményét viszont futtatással ellenőrizni lehet.

Mikor érdemes az RLFT-t választani?

Az útmutató szerint a fejlesztőknek először a promptolást és a felügyelt finomhangolást, vagyis az SFT-t érdemes kimeríteniük. Az RLFT akkor lehet indokolt, ha egy választ meg lehet mérni, de annak helyes változatát nem lehet gazdaságosan előállítani, vagy ha az SFT teljesítménye egy fontos mutatóban, például a hűségben, a séma érvényességében vagy a hangnemben, már nem javul.

A módszer olyan feladatokra is illik, amelyeknél többféle helyes megoldás létezik. Az RLFT a modell saját kimeneteiből indul ki, az eredményt jutalmazza, és a Google Cloud szerint elsősorban a Gemini már meglévő képességeit erősíti fel. Emiatt nem alkalmas olyan készség megtanítására, amelyet a modell egyáltalán nem képes bemutatni.

A Google két használati mintát javasol. Ha az alapmodell már időnként sikeres, közvetlenül is alkalmazható az RLFT. Ha túl alacsony a kezdeti sikerarány, előbb rövid, könnyű SFT-szakasz jöhet, majd az RL folytatható a Continuous Tuning segítségével. Az útmutató figyelmeztet arra is, hogy a bemutatási példák túlzott megtanulása csökkentheti az RL későbbi javítási lehetőségét.

Játékoktól a kódvégrehajtásig

A Google Cloud több olyan felhasználási területet sorol fel, ahol az eredmény ellenőrizhető, a helyes válaszok teljes felsorolása viszont nehéz lenne. Játékokban az RLFT hosszú, többnyelvű párbeszédekben segíthet megtartani a szereplő személyiségét, a játékállapot szintaxisát és a beszélgetés folyamatosságát. A bemutatott esetben megszűntek a hurkok és a nyelvi elcsúszások.

Strukturált entitáskinyerésnél a rendszer számlákból és szállítólevelekből emelhet ki adatokat. A szabályalapú pontozás egyszerre jutalmazza a szükséges mezők megtalálását és bünteti a forrásban nem szereplő adatok kitalálását.

Tartalommoderálásnál a formátum-ellenőrzés és a determinisztikus értékelő összetett szabályokat és kivételeket kezelhet. A Google Cloud szerint ez csökkentette a téves pozitív jelzéseket és a hibás formátummal végrehajtott jutalommanipulációt.

További példa a futtatással mért kód, például SQL vagy API-hívás. A biztonságos környezetben futó jutalmazás csak akkor ad pontot, ha a kód lefordul, végrehajtható, és a helyes eredményt adja. Az útmutató HTML és CSS alapú prezentációk generálását is említi, ahol a renderelt diák vizuális minősége, elrendezése és szerkezeti teljessége alapján történik az értékelés.

A jutalmazási függvény a legfontosabb kiindulópont

Az első próbához a Google Cloud szerint elegendő egy változatos promptkészlet és egy elkülönített validációs rész. A tanítási és értékelési adatok szigorú szétválasztása segít elkerülni, hogy az értékelésben rejtett átfedés elfedje a túlillesztést.

A jutalmazási függvény minősége meghatározó. A dokumentáció olyan megoldást javasol, amely összefügg az emberi preferenciákkal, kezeli a hibás formátumú kimeneteket, és ellenáll a jutalom kijátszásának. Ilyen védelem lehet több értékelő együttes használata, a túl hosszú válaszok büntetése és a használhatatlan kimenetek alsó pontszámának rögzítése.

A Google Cloud azt tanácsolja, hogy a jutalmazást még az éles indítás előtt, offline környezetben ellenőrizzék. A szolgáltatás alapbeállításokkal elindítható, a fejlesztők pedig a konzolon követhetik a jutalmazási és validációs görbéket. A kiválasztandó ellenőrzőpont az útmutató szerint az, amelynél a validációs jutalom telítődik, nem feltétlenül az utolsó tanítási lépés.

Kapcsolódó hírek

Így osztja meg az AI21 a közel 10 ezer GPU-t a csapatai között
Chipek és infrastruktúra2026. október 4.

Így osztja meg az AI21 a közel 10 ezer GPU-t a csapatai között

Az AI21 egy mintegy 10 ezer GPU-t kezelő, több csapat által használt GKE-fürtön váltott kézi erőforrás-egyeztetésről automatizált feladatütemezésre. A rendszer központi…

Az Everlaw ügyvédi bizonyítékokat köt a Google Gemini Enterprise-hoz
Termékek és eszközök2026. október 3.

Az Everlaw ügyvédi bizonyítékokat köt a Google Gemini Enterprise-hoz

Az Everlaw és a Google Cloud MCP-integrációval kapcsolta össze az Everlaw jogi bizonyítékkezelő platformját a Gemini Enterprise vállalati asszisztenssel. A jogi…

Az NVIDIA szabványosítaná a GPU-k közvetlen tárhelyelérését
Fejlesztőknek2026. szeptember 30.

Az NVIDIA szabványosítaná a GPU-k közvetlen tárhelyelérését

Az NVIDIA általánosan elérhetővé tette a cuObject kliens- és szerveroldali könyvtárait, amelyek RDMA-protokollon keresztül gyorsítják az objektumtárhely elérését. A…