A Microsoft Research bemutatta az Orchard nyílt agentikus AI-keretrendszert

A Microsoft Research 2026. augusztus 3-án bemutatta az Orchard nevű nyílt forrású keretrendszert, amely skálázható és költséghatékony agentikus AI-kutatást céloz. A projekt központi eleme az Orchard Env, egy újrahasználható környezeti szolgáltatás ügynökök tanításához és értékeléséhez több feladattípuson.
- Az Orchard nyílt forrású keretrendszer skálázható agentikus AI-kutatáshoz.
- Központi eleme az Orchard Env, egy Kubernetes-alapú, újrahasználható környezeti szolgáltatás.
- Az Orchard-SWE 69,7 százalékot ért el SWE-bench Verifieden, értékmodell-újrarangsorolással 73 százalékot.
- Az Orchard-GUI 68,4 százalékos átlagot ért el három webes benchmarkon.
- Az Orchard-Claw a Claw-Eval feladatain 59,6 százalékot teljesített legfeljebb három próbálkozással.
Nyílt infrastruktúra ügynökök tanításához
A Microsoft Research szerint az AI egyre inkább az olyan autonóm ügynökök felé mozdul, amelyek tervezni, érvelni és cselekedni tudnak összetett, több lépésből álló környezetekben. A forrás példaként említi a hibajavítást összetett kódbázisokban, a webes navigációt a felhasználó nevében, valamint a naptárakat és e-maileket érintő munkafolyamatok kezelését.
A kutatási közösség számára a Microsoft Research szerint továbbra is gondot jelent, hogy a legfejlettebb agentikus rendszerek építése gyakran zárt infrastruktúrát igényel. Ide tartozhatnak az egyedi homokozók, zárt tanítási folyamatok és saját adatkészletek, amelyeket sok kutató és gyakorlati fejlesztő nem tud elérni vagy reprodukálni.
Erre válaszként készült az Orchard, egy nyílt forrású keretrendszer skálázható agentikus modellezéshez. A központi komponens az Orchard Env, amely a közlemény szerint könnyűsúlyú, Kubernetes-alapú környezetként újrahasználható, izolált komponenseket biztosít ügynökök nagy léptékű futtatásához és építéséhez. Ez lefedi a tanítóadatok gyűjtését, a megerősítéses tanulási futtatásokat és az értékelést is.
Az Orchard Env több feladattípushoz és harnesshez készült
Az Orchard alapötlete, hogy a futtatási környezet önálló, újrahasználható szolgáltatás legyen, ne egy adott tanítási keretrendszerbe ágyazott infrastruktúra. A Microsoft Research leírása alapján az Orchard Env Kubernetes-alapja lehetővé teszi, hogy több ezer izolált komponenst hozzon létre, kezeljen és távolítson el párhuzamosan.
A rendszer különböző feladatokhoz készült, például kódoláshoz, webböngészéshez és eszközhasználathoz. Ugyanaz a szolgáltatás a forrás szerint szoftvermérnöki ügynököket, webes ügynököket és személyi asszisztens ügynököket is támogathat több területen.
A Microsoft Research külön kiemeli, hogy az Orchard ügynököket képes közvetlenül abban a harnessben tanítani, amelyben később futnak. A forrás példái között szerepel a Claude Code, a Codex, az OpenClaw és a ZeroClaw. A probléma az, hogy a mai fejlett ügynökök gyakran állapottartó, több folyamatból álló harnessen keresztül működnek, miközben a nyílt tanítóeszközök ezt sokszor nem tudják kezelni.
Az Orchard ezt egy könnyűsúlyú proxyval oldja meg: a proxy rögzíti a harness saját modellhívásait tanítóadatként, miközben minden futtatás külön konténerben zajlik. Így a forrás szerint az ügynök végig abban a környezetben tanítható, amelyben telepítéskor is működni fog.
Orchard-SWE: szoftverfejlesztési ügynökök nyílt modellekkel
Az Orchard-SWE a Microsoft Research szoftvermérnöki tanítási munkafolyamata. A rendszer a Mini-SWE-Agent keretrendszerre épül, amelyet szoftvermérnöki feladatok autonóm megoldására terveztek. Az értékelés a SWE-bench Verified benchmarkon történt, amely valós kódbázisokban vizsgálja a navigálást, diagnosztizálást és javítást.
A tanításhoz 107 000 ügynökinterakciót desztilláltak két fejlett nyílt súlyú modellből, a MiniMax-M2.5-ből és a Qwen3.5-397B-ből, sokféle GitHub Issue alapján. A folyamat kredit-hozzárendeléses felügyelt finomhangolást használ: a rendszer a részben sikertelen próbálkozások hasznos szakaszaiból is tanul, így több értékes tanítóadatot tud felhasználni.
A következő lépés a megerősítéses tanulás, ahol a visszajelzés ritka, mert az ügynök jellemzően csak azt tudja meg, hogy a végső javítás átment-e a rejtett teszteken. A Microsoft Research a Balanced Adaptive Rollout módszerrel kezd, majd két sűrű jutalmazási technikát ad hozzá: az on-policy desztillációt, amelyben egy erősebb tanítómodell lépésről lépésre pontozza az ügynök döntéseit, valamint egy folyamatjutalmazó modellt, amely a jó problémamegoldási folyamatot díjazza.
Az Orchard-SWE eredménye a SWE-bench Verified teszten 61,4 százalékos alapértékről 69,1 százalékra nőtt Balanced Adaptive Rollouttal, majd 69,7 százalékra a sűrű jutalmazási technikákkal. A Microsoft Research szerint ez új state of the art az összevethető méretű nyílt forrású modellek között, nagyjából 3 milliárd aktív paraméterrel. Egy 4 milliárd paraméteres értékmodell, amely 20 korábbi kísérlet futtatásaiból tanult, újrarangsorolással 73 százalékra emelte az eredményt.
Orchard-GUI és Orchard-Claw: webes és személyi asszisztens feladatok
Az Orchard-GUI a webes navigációra fókuszál, ahol az ügynököknek vizuális elrendezéseket kell értelmezniük, dinamikus felületekkel kell interakcióba lépniük, és természetes nyelven megadott, nyílt végű feladatokat kell teljesíteniük. A Microsoft Research egy 4 milliárd paraméteres látás-nyelvi modellt tanított böngészőügynökként, 400 desztillált demonstrációval és 2200 nyílt végű tanítási feladattal.
Az eredmény a forrás szerint 74,1 százalék a WebVoyageren, 67,0 százalék az Online-Mind2Weben és 64,0 százalék a DeepShopon, ami 68,4 százalékos átlagot jelent. A Microsoft Research szerint ezek az eredmények az Orchard-GUI-t a legerősebb nyílt forrású webes ügynökök közé helyezik, miközben versenyképes marad nagyobb zárt modellekkel is.
Az Orchard-Claw a személyi asszisztens feladatokra készült. A forrás ide sorolja az e-mailek olvasását és megírását, a naptárak kezelését, az információkeresést és az eszközök közötti koordinációt. Az ügynököt mindössze 200 szintetikus feladaton tanították.
A Claw-Eval benchmarkon, amely valószerű produktivitási munkafolyamatokat fed le, az Orchard-Claw legfeljebb három próbálkozással a feladatok 59,6 százalékát teljesítette sikeresen. A ZeroClaw ügynökrendszerrel párosítva ez az arány 73,9 százalékra nőtt.
Mit jelent ez a kutatóknak és fejlesztőknek
Az Orchard jelentősége a Microsoft Research közlése alapján abban áll, hogy az agentikus AI-kutatás több eddig külön kezelt elemét közös infrastruktúrába rendezi. Ugyanaz az Orchard Env használható tanítóadatok gyűjtéséhez, megerősítéses tanulási futtatásokhoz és értékeléshez, több feladattípuson és több ügynökrendszerrel.
A projekt a modellek és munkafolyamatok mellett tanítóadatokat és értékelési módszereket is kiad. A cél a forrás szerint az, hogy a szélesebb kutatói közösség nyílt agentikus rendszereket tudjon építeni és vizsgálni.
A bemutatott eredmények arra utalnak, hogy viszonylag kis, nyílt súlyú modellek is erős teljesítményt érhetnek el összetett, valós feladatokon, ha megfelelő tanítási eljárást és futtatási környezetet kapnak. Az Orchard-SWE esetében a Microsoft Research kifejezetten azt állítja, hogy a nagyjából 3 milliárd aktív paraméteres modell megközelíti a több mint 10-szer nagyobb frontier rendszereket.
Microsoft Research: Orchard: An open framework for scalable agentic AI

