Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Google AI-ügynökkel automatizálja az LLM-ek finomhangolását

2026. szeptember 11.Forrás: Google for Developers
A Google AI-ügynökkel automatizálja az LLM-ek finomhangolását
Kép: Google for Developers

A Google olyan rendszert mutatott be, amely AI-ügynökökkel automatizálja a nagy nyelvi modellek utólagos tanítását TPU-kon. Az autofinetune a Tunix, a Gemma, a Cloud TPU-k, az Antigravity CLI és a Gemini Flash 3.7 eszközeire épül.

A lényeg röviden
  • Az autofinetune AI-ügynökkel automatizálja az LLM-ek utólagos tanítását.
  • A FunctionGemma kísérletben 20 próbafuttatás készült néhány óra alatt.
  • A Gemma 3 1B GRPO-kísérlete 40 futást végzett két-három nap alatt.
  • A Google szerint a GRPO-példa teljes jutalma körülbelül 10 százalékkal javult.
  • A projekt kódja és mintafuttatásai az autofinetune GitHub-tárolójában érhetők el.

Az ügynök maga futtatja és értékeli a kísérleteket

A Google Developers Blog szeptember 11-i bejegyzése szerint az autofinetune az autoresearch projekt ötletét viszi tovább a nagy nyelvi modellek utólagos tanítására. A cél, hogy a fejlesztő egy Markdown-formátumú specifikációban meghatározza a kutatási ciklust, az értékelési feltételeket és a korlátokat, az AI-ügynök pedig ezek alapján egymás után futtassa a finomhangolási kísérleteket.

A hagyományos munkafolyamatban a fejlesztő hipotéziseket állít fel, módosítja a tanítási kódot és a hiperparamétereket, elindít egy gyorsítón futó feladatot, majd figyeli a veszteségértékeket és a mérési eredményeket. A sikertelen próbálkozásokat kézzel kell visszavonni, a javulásokat pedig rögzíteni kell. Az autofinetune ezt a ciklust automatizálja.

A folyamatban a program.md fájl határozza meg az arénát, vagyis a szabályokat, a run.py pedig az önálló, finomhangolási kódot tartalmazza. Az ügynök módosítja a futtatási fájlt, elindítja a tanítást, megméri a célmetrikát, megtartja a javulást hozó Git-commitokat, a visszaeséseket pedig visszavonja. Az eredményeket a results.tsv fájlban naplózza.

FunctionGemma: 20 kísérlet néhány óra alatt

Az első esettanulmányban a Google a google/functiongemma-270m-it modellt finomhangolta a google/mobile-actions adathalmazon. A felügyelt finomhangolás, vagyis SFT során a cél a függvényhívások generálási pontosságának javítása volt.

A kísérlet Cloud TPU v5e-1 hardveren futott, egy próbafuttatás néhány percig tartott. Az ügynök két óra alatt 20 automatizált kísérletet végzett el. A szabályok megengedték többek között a LoRA-rang és az alfa, a célzott projekciós rétegek, a tanulási ráta, a bemelegítési és lecsengési ütemezés, az optimalizálók, a gradienskorlátozás, a kötegméret és a véletlen magok módosítását.

A dataset, az epochok száma és a modell architektúrája nem változhatott. A Google által bemutatott mintafolyamat szerint az ügynök fokozatosan módosította a LoRA-beállításokat, az optimalizálót és a tanulási rátát, miközben a helyes függvényhívások arányát használta mérceként.

Gemma és GRPO: összetettebb megerősítéses tanítás

A második példa a megerősítéses tanulást használta GRPO-val. A Google a Tunix tárolójában szereplő hivatalos példát alakította át autonóm finomhangolási feladattá. Ebben a Gemma 3 1B modellt tanítják matematikai következtetésre a GSM8K adathalmazon. A bejegyzés szerint a tanított modell javulást mutat a numerikus és a formátumbeli pontosságban.

A feladat nehezebb volt az SFT-kísérletnél, mivel a megerősítéses tanulás érzékenyebb a hiperparaméterekre, instabilabb lehet, és hosszabb futási időt igényel. A kísérletek Cloud TPU v6e-1 hardveren futottak, egy-egy futás néhány óráig tartott. Az ügynök 40 kísérletet végzett el két-három nap alatt.

A külső optimalizálási ciklus egyszerűsítésére a Google egy mesterséges mérőszámot használt, amely a numerikus pontosság és a formátumbeli pontosság összege. A mintafolyamatban az ügynök jobb LoRA-konfigurációkat, rollout-hőmérsékletet, KL-penalizációt és rendszerpromptot azonosított, és a teljes jutalmat a Google szerint körülbelül 10 százalékkal javította.

Kód és mintafuttatások is elérhetők

A Google szerint az autofinetune azt mutatja meg, hogyan használhatók AI-ügynökök az LLM-ek utólagos tanítási munkafolyamatainak automatizálására. A projekt kódját, a mintafuttatásokat és a program.md-sablonokat az autofinetune GitHub-tárolójában tették közzé. A bejegyzés a Tunix könyvtár felfedezésére is ösztönöz, így a fejlesztők saját, TPU-kon futó autonóm utólagos tanítási laborokat építhetnek.

A bemutatott megközelítés a felügyelt finomhangolástól a megerősítéses tanulásig ugyanarra az elvre épít: a fejlesztő kijelöli a kísérletezés kereteit és a mérőszámot, az ügynök pedig önállóan módosítja, futtatja és értékeli a próbálkozásokat. A Google példái alapján ez órák vagy napok alatt több tucat konfiguráció vizsgálatát teszi lehetővé, miközben a változtatások és az eredmények Gitben, illetve táblázatos naplóban követhetők.

Kapcsolódó hírek

A tapasztalatokból tanuló LLM-ügynökök módszerét mutatta be a NAVER
Kutatás2026. október 4. 13:41

A tapasztalatokból tanuló LLM-ügynökök módszerét mutatta be a NAVER

A NAVER LABS Europe kutatói olyan nagy nyelvi modellekre épülő ügynökök betanítási módszerét mutatták be, amely a korábbi tapasztalatok visszakeresését és a felügyelt…

A Google szeptemberi AI újdonságai: Gemini 4 Argon és WeatherNext 3
Modellek2026. október 2. 17:00

A Google szeptemberi AI újdonságai: Gemini 4 Argon és WeatherNext 3

A Google szeptemberben bemutatta a Gemini 4 Argon modellt, új hangalapú AI-eszközöket és a Gemini alkalmazáshoz kapcsolható szolgáltatásokat. A vállalat tudományos…

A CNCF Sandboxba kerül az llm-d, az AI-inferencia nyílt infrastruktúrája
Fejlesztőknek2026. október 2. 16:12

A CNCF Sandboxba kerül az llm-d, az AI-inferencia nyílt infrastruktúrája

A Cloud Native Computing Foundation Sandbox projektjei közé kerül az llm-d, a több gyorsítós infrastruktúrán futó, elosztott következtetés összehangolására és…