A Microsoft bemutatta az Agent Lightning v1.0 agentképzési keretrendszert

A Microsoft Research Asia bemutatta és nyílt forráskódúvá tette az Agent Lightning v1.0-t, amely lehetővé teszi, hogy az agenteket a bevetésben használt saját vezérlőrétegükön keresztül tanítsák megerősítéses tanulással. A keretrendszer nagyjából 3500 sor kódból áll, és közvetlen Kubernetes-támogatást kínál.
- Az Agent Lightning v1.0 a bevetésben használt agentharnessön keresztül tanít.
- A teljes keretrendszer nagyjából 3500 sor kódból áll.
- Az agentek szabványos Kubernetes-feladatként is futtathatók.
- A Qwen3.5-9B SWE-bench Verified Pass@1 eredménye 41,8 százalékról 56,4 százalékra nőtt.
- A bemutatott eredményhez körülbelül 6000 tanítási mintát használtak.
A telepített agent kerül a tanítás középpontjába
Az AI-agentek ma már összetett rendszerek, amelyekben a modell mellett eszközök, végrehajtási környezetek és egy úgynevezett agentharness is részt vesz. Ez a külső vezérlőréteg kezeli többek között a kontextust, az eszközprotokollokat és a végrehajtási logikát.
A megerősítéses tanulás során a rendszer próbálkozásokon, valamint a cselekvésekhez rendelt jutalmakon és büntetéseken keresztül tanul. A Microsoft Research szerint a hagyományos agentképzési megoldások gyakran megkövetelik, hogy a fejlesztők újraépítsék az agent működési ciklusát a tanítási keretrendszeren belül. Emiatt a tanított változat eltérhet attól, amelyet később éles környezetben használnak.
Az Agent Lightning v1.0 ezt a problémát a Harnessed Agentic RL nevű megközelítéssel kezeli. A bevetésben használt harness közvetlenül részt vesz a megerősítéses tanulásban. A keretrendszerben egy nagy nyelvi modellhez kapcsolódó proxy kerül az agent és a modell közé. Így az agent meglévő kódja változatlanul futhat, miközben a proxy rögzíti a modellhívásokat, a válaszokat és a tanításhoz szükséges logaritmikus valószínűségeket.
Körülbelül 3500 sorból áll a teljes vezérlősík
A Microsoft Research Asia közlése szerint az Agent Lightning v1.0 teljes kódja nagyjából 3500 sor. A rendszer három fő elemből épül fel: az API Gatewayből, a Rollout Controllerből és a Customized Trainerből.
Az API Gateway tárolja a futásokat, a modelleket és az eseményeket, valamint OpenAI-kompatibilis LLM-proxyként működik. A Rollout Controller indítja és kezeli az agentek végrehajtását. Ezek helyi folyamatként vagy szabványos Kubernetes-feladatként is futhatnak, miközben a végrehajtás elkülönül a tanítótól. A Customized Trainer a verlre épül, futásokat hoz létre, megvárja azok befejezését, majd egy mintaillesztő segítségével összeállítja a tanítási adatokat.
A megoldás része a Collocated Async RL is. Ennél a módszernél a futtatás és a modellfrissítés ugyanazokat a GPU-kat használja. A Microsoft Research kísérleteiben ez a megközelítés körülbelül kétszeres teljes folyamatbeli gyorsulást ért el a szinkronizált megerősítéses tanuláshoz képest, miközben kevesebb GPU-t használt a hagyományos aszinkron megoldásnál.
Kubernetesen és nyílt infrastruktúrán is futtatható
Az agentek nagy számú párhuzamos futtatása jelentős processzor-, memória- és számítási kapacitást igényel. Az Agent Lightning v1.0 ezért szabványos Kubernetes-feladatként futtatja őket. A Microsoft Research szerint a rendszer használható saját kezelésű fürtökön, felhős Kubernetes-környezetben vagy helyi infrastruktúrán is.
A keretrendszer így nem függ fizetős, kereskedelmi sandboxszolgáltatásoktól. A közlemény szerint a meglévő számítási erőforrások hatékonyabban használhatók, a nagy futtatások költsége alacsonyabb lehet, a teljes folyamat pedig nyílt forráskódú és reprodukálható marad.
A valódi harnessök használata ugyanakkor technikai feladatokat is felvet. A harnessök szövegként kezelik a kontextust, miközben a megerősítéses tanulás tokenazonosítókkal dolgozik, ezért az újratokenizálás megváltoztathatja a tokenhatárokat. A részfutások száma és hossza is csak a harness befejezése után ismert. A rendszernek emiatt az előnyök kiszámítását, a veszteség normalizálását és a változó munkaterhelés erőforrásokhoz rendelését is kezelnie kell.
A Qwen3.5-9B mérhető javulást ért el
A Microsoft Research egy teljes kódolóagent-példát is bemutatott. A Qwen3.5-9B modell SWE-bench Verified feladatsoron mért Pass@1 eredménye 41,8 százalékról 56,4 százalékra emelkedett. Ez 14,6 százalékpontos javulás, amelyet a közlemény szerint körülbelül 6000, nyílt forrású adatkészleten alapuló tanítási minta felhasználásával értek el.
Az Agent Lightning v1.0 azoknak a fejlesztőknek lehet fontos, akik meglévő agentrendszerüket szeretnék megerősítéses tanulással fejleszteni anélkül, hogy újra kellene építeniük annak működési ciklusát. A modellvégpont Agent Lightning proxyjára irányítása általában elegendő a gyors csatlakoztatáshoz, miközben maga az agent a korábbi harnessével működik tovább.
Microsoft Research: Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Training Agents with Real Harnesses


