A Google AI-ügynökkel automatizálja az LLM-ek finomhangolását

A Google olyan rendszert mutatott be, amely AI-ügynökökkel automatizálja a nagy nyelvi modellek utólagos tanítását TPU-kon. Az autofinetune a Tunix, a Gemma, a Cloud TPU-k, az Antigravity CLI és a Gemini Flash 3.7 eszközeire épül.
- Az autofinetune AI-ügynökkel automatizálja az LLM-ek utólagos tanítását.
- A FunctionGemma kísérletben 20 próbafuttatás készült néhány óra alatt.
- A Gemma 3 1B GRPO-kísérlete 40 futást végzett két-három nap alatt.
- A Google szerint a GRPO-példa teljes jutalma körülbelül 10 százalékkal javult.
- A projekt kódja és mintafuttatásai az autofinetune GitHub-tárolójában érhetők el.
Az ügynök maga futtatja és értékeli a kísérleteket
A Google Developers Blog szeptember 11-i bejegyzése szerint az autofinetune az autoresearch projekt ötletét viszi tovább a nagy nyelvi modellek utólagos tanítására. A cél, hogy a fejlesztő egy Markdown-formátumú specifikációban meghatározza a kutatási ciklust, az értékelési feltételeket és a korlátokat, az AI-ügynök pedig ezek alapján egymás után futtassa a finomhangolási kísérleteket.
A hagyományos munkafolyamatban a fejlesztő hipotéziseket állít fel, módosítja a tanítási kódot és a hiperparamétereket, elindít egy gyorsítón futó feladatot, majd figyeli a veszteségértékeket és a mérési eredményeket. A sikertelen próbálkozásokat kézzel kell visszavonni, a javulásokat pedig rögzíteni kell. Az autofinetune ezt a ciklust automatizálja.
A folyamatban a program.md fájl határozza meg az arénát, vagyis a szabályokat, a run.py pedig az önálló, finomhangolási kódot tartalmazza. Az ügynök módosítja a futtatási fájlt, elindítja a tanítást, megméri a célmetrikát, megtartja a javulást hozó Git-commitokat, a visszaeséseket pedig visszavonja. Az eredményeket a results.tsv fájlban naplózza.
FunctionGemma: 20 kísérlet néhány óra alatt
Az első esettanulmányban a Google a google/functiongemma-270m-it modellt finomhangolta a google/mobile-actions adathalmazon. A felügyelt finomhangolás, vagyis SFT során a cél a függvényhívások generálási pontosságának javítása volt.
A kísérlet Cloud TPU v5e-1 hardveren futott, egy próbafuttatás néhány percig tartott. Az ügynök két óra alatt 20 automatizált kísérletet végzett el. A szabályok megengedték többek között a LoRA-rang és az alfa, a célzott projekciós rétegek, a tanulási ráta, a bemelegítési és lecsengési ütemezés, az optimalizálók, a gradienskorlátozás, a kötegméret és a véletlen magok módosítását.
A dataset, az epochok száma és a modell architektúrája nem változhatott. A Google által bemutatott mintafolyamat szerint az ügynök fokozatosan módosította a LoRA-beállításokat, az optimalizálót és a tanulási rátát, miközben a helyes függvényhívások arányát használta mérceként.
Gemma és GRPO: összetettebb megerősítéses tanítás
A második példa a megerősítéses tanulást használta GRPO-val. A Google a Tunix tárolójában szereplő hivatalos példát alakította át autonóm finomhangolási feladattá. Ebben a Gemma 3 1B modellt tanítják matematikai következtetésre a GSM8K adathalmazon. A bejegyzés szerint a tanított modell javulást mutat a numerikus és a formátumbeli pontosságban.
A feladat nehezebb volt az SFT-kísérletnél, mivel a megerősítéses tanulás érzékenyebb a hiperparaméterekre, instabilabb lehet, és hosszabb futási időt igényel. A kísérletek Cloud TPU v6e-1 hardveren futottak, egy-egy futás néhány óráig tartott. Az ügynök 40 kísérletet végzett el két-három nap alatt.
A külső optimalizálási ciklus egyszerűsítésére a Google egy mesterséges mérőszámot használt, amely a numerikus pontosság és a formátumbeli pontosság összege. A mintafolyamatban az ügynök jobb LoRA-konfigurációkat, rollout-hőmérsékletet, KL-penalizációt és rendszerpromptot azonosított, és a teljes jutalmat a Google szerint körülbelül 10 százalékkal javította.
Kód és mintafuttatások is elérhetők
A Google szerint az autofinetune azt mutatja meg, hogyan használhatók AI-ügynökök az LLM-ek utólagos tanítási munkafolyamatainak automatizálására. A projekt kódját, a mintafuttatásokat és a program.md-sablonokat az autofinetune GitHub-tárolójában tették közzé. A bejegyzés a Tunix könyvtár felfedezésére is ösztönöz, így a fejlesztők saját, TPU-kon futó autonóm utólagos tanítási laborokat építhetnek.
A bemutatott megközelítés a felügyelt finomhangolástól a megerősítéses tanulásig ugyanarra az elvre épít: a fejlesztő kijelöli a kísérletezés kereteit és a mérőszámot, az ügynök pedig önállóan módosítja, futtatja és értékeli a próbálkozásokat. A Google példái alapján ez órák vagy napok alatt több tucat konfiguráció vizsgálatát teszi lehetővé, miközben a változtatások és az eredmények Gitben, illetve táblázatos naplóban követhetők.
Google for Developers: Autonomous LLM post-training with Tunix on TPUs- Google Developers Blog


