Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Microsoft bemutatta az Agent Lightning v1.0 agentképzési keretrendszert

2026. október 7. 18:00Forrás: Microsoft Research
A Microsoft bemutatta az Agent Lightning v1.0 agentképzési keretrendszert
Kép: Microsoft Research

A Microsoft Research Asia bemutatta és nyílt forráskódúvá tette az Agent Lightning v1.0-t, amely lehetővé teszi, hogy az agenteket a bevetésben használt saját vezérlőrétegükön keresztül tanítsák megerősítéses tanulással. A keretrendszer nagyjából 3500 sor kódból áll, és közvetlen Kubernetes-támogatást kínál.

A lényeg röviden
  • Az Agent Lightning v1.0 a bevetésben használt agentharnessön keresztül tanít.
  • A teljes keretrendszer nagyjából 3500 sor kódból áll.
  • Az agentek szabványos Kubernetes-feladatként is futtathatók.
  • A Qwen3.5-9B SWE-bench Verified Pass@1 eredménye 41,8 százalékról 56,4 százalékra nőtt.
  • A bemutatott eredményhez körülbelül 6000 tanítási mintát használtak.

A telepített agent kerül a tanítás középpontjába

Az AI-agentek ma már összetett rendszerek, amelyekben a modell mellett eszközök, végrehajtási környezetek és egy úgynevezett agentharness is részt vesz. Ez a külső vezérlőréteg kezeli többek között a kontextust, az eszközprotokollokat és a végrehajtási logikát.

A megerősítéses tanulás során a rendszer próbálkozásokon, valamint a cselekvésekhez rendelt jutalmakon és büntetéseken keresztül tanul. A Microsoft Research szerint a hagyományos agentképzési megoldások gyakran megkövetelik, hogy a fejlesztők újraépítsék az agent működési ciklusát a tanítási keretrendszeren belül. Emiatt a tanított változat eltérhet attól, amelyet később éles környezetben használnak.

Az Agent Lightning v1.0 ezt a problémát a Harnessed Agentic RL nevű megközelítéssel kezeli. A bevetésben használt harness közvetlenül részt vesz a megerősítéses tanulásban. A keretrendszerben egy nagy nyelvi modellhez kapcsolódó proxy kerül az agent és a modell közé. Így az agent meglévő kódja változatlanul futhat, miközben a proxy rögzíti a modellhívásokat, a válaszokat és a tanításhoz szükséges logaritmikus valószínűségeket.

Körülbelül 3500 sorból áll a teljes vezérlősík

A Microsoft Research Asia közlése szerint az Agent Lightning v1.0 teljes kódja nagyjából 3500 sor. A rendszer három fő elemből épül fel: az API Gatewayből, a Rollout Controllerből és a Customized Trainerből.

Az API Gateway tárolja a futásokat, a modelleket és az eseményeket, valamint OpenAI-kompatibilis LLM-proxyként működik. A Rollout Controller indítja és kezeli az agentek végrehajtását. Ezek helyi folyamatként vagy szabványos Kubernetes-feladatként is futhatnak, miközben a végrehajtás elkülönül a tanítótól. A Customized Trainer a verlre épül, futásokat hoz létre, megvárja azok befejezését, majd egy mintaillesztő segítségével összeállítja a tanítási adatokat.

A megoldás része a Collocated Async RL is. Ennél a módszernél a futtatás és a modellfrissítés ugyanazokat a GPU-kat használja. A Microsoft Research kísérleteiben ez a megközelítés körülbelül kétszeres teljes folyamatbeli gyorsulást ért el a szinkronizált megerősítéses tanuláshoz képest, miközben kevesebb GPU-t használt a hagyományos aszinkron megoldásnál.

Kubernetesen és nyílt infrastruktúrán is futtatható

Az agentek nagy számú párhuzamos futtatása jelentős processzor-, memória- és számítási kapacitást igényel. Az Agent Lightning v1.0 ezért szabványos Kubernetes-feladatként futtatja őket. A Microsoft Research szerint a rendszer használható saját kezelésű fürtökön, felhős Kubernetes-környezetben vagy helyi infrastruktúrán is.

A keretrendszer így nem függ fizetős, kereskedelmi sandboxszolgáltatásoktól. A közlemény szerint a meglévő számítási erőforrások hatékonyabban használhatók, a nagy futtatások költsége alacsonyabb lehet, a teljes folyamat pedig nyílt forráskódú és reprodukálható marad.

A valódi harnessök használata ugyanakkor technikai feladatokat is felvet. A harnessök szövegként kezelik a kontextust, miközben a megerősítéses tanulás tokenazonosítókkal dolgozik, ezért az újratokenizálás megváltoztathatja a tokenhatárokat. A részfutások száma és hossza is csak a harness befejezése után ismert. A rendszernek emiatt az előnyök kiszámítását, a veszteség normalizálását és a változó munkaterhelés erőforrásokhoz rendelését is kezelnie kell.

A Qwen3.5-9B mérhető javulást ért el

A Microsoft Research egy teljes kódolóagent-példát is bemutatott. A Qwen3.5-9B modell SWE-bench Verified feladatsoron mért Pass@1 eredménye 41,8 százalékról 56,4 százalékra emelkedett. Ez 14,6 százalékpontos javulás, amelyet a közlemény szerint körülbelül 6000, nyílt forrású adatkészleten alapuló tanítási minta felhasználásával értek el.

Az Agent Lightning v1.0 azoknak a fejlesztőknek lehet fontos, akik meglévő agentrendszerüket szeretnék megerősítéses tanulással fejleszteni anélkül, hogy újra kellene építeniük annak működési ciklusát. A modellvégpont Agent Lightning proxyjára irányítása általában elegendő a gyors csatlakoztatáshoz, miközben maga az agent a korábbi harnessével működik tovább.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Natív Anaconda-támogatást kapott a Surface Laptop Ultra Windows ARM-en
Fejlesztőknek2026. október 7. 17:06

Natív Anaconda-támogatást kapott a Surface Laptop Ultra Windows ARM-en

Az Anaconda natív Windows on ARM támogatást biztosít a Microsoft új Surface Laptop Ultra eszközeihez. A Python, a conda és az ellenőrzött csomagok közvetlenül ARM64…

Az Open Jarvis helyi modellekből épít megbízható AI-ügynököket
Fejlesztőknek2026. szeptember 30. 16:49

Az Open Jarvis helyi modellekből épít megbízható AI-ügynököket

A Lambda bemutatta az Open Jarvist, amely a helyben futó nyelvi modellekhez igazítja az AI-ügynökök működési keretét. A vállalat szerint a megfelelően hangolt…

A Fireworks AI elindította a valós munkát mérő modellindexet
Kutatás2026. szeptember 22.

A Fireworks AI elindította a valós munkát mérő modellindexet

A Fireworks AI elindította a Specialized Intelligence Indexet, amely iparág-specifikus, gyakorlati feladatokon méri a nyílt, zárt és specializált AI-modellek…