Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Microsoft Research bemutatta az Orchard nyílt agentikus AI-keretrendszert

2026. augusztus 3.Forrás: Microsoft Research
A Microsoft Research bemutatta az Orchard nyílt agentikus AI-keretrendszert
Kép: Microsoft Research

A Microsoft Research 2026. augusztus 3-án bemutatta az Orchard nevű nyílt forrású keretrendszert, amely skálázható és költséghatékony agentikus AI-kutatást céloz. A projekt központi eleme az Orchard Env, egy újrahasználható környezeti szolgáltatás ügynökök tanításához és értékeléséhez több feladattípuson.

A lényeg röviden
  • Az Orchard nyílt forrású keretrendszer skálázható agentikus AI-kutatáshoz.
  • Központi eleme az Orchard Env, egy Kubernetes-alapú, újrahasználható környezeti szolgáltatás.
  • Az Orchard-SWE 69,7 százalékot ért el SWE-bench Verifieden, értékmodell-újrarangsorolással 73 százalékot.
  • Az Orchard-GUI 68,4 százalékos átlagot ért el három webes benchmarkon.
  • Az Orchard-Claw a Claw-Eval feladatain 59,6 százalékot teljesített legfeljebb három próbálkozással.

Nyílt infrastruktúra ügynökök tanításához

A Microsoft Research szerint az AI egyre inkább az olyan autonóm ügynökök felé mozdul, amelyek tervezni, érvelni és cselekedni tudnak összetett, több lépésből álló környezetekben. A forrás példaként említi a hibajavítást összetett kódbázisokban, a webes navigációt a felhasználó nevében, valamint a naptárakat és e-maileket érintő munkafolyamatok kezelését.

A kutatási közösség számára a Microsoft Research szerint továbbra is gondot jelent, hogy a legfejlettebb agentikus rendszerek építése gyakran zárt infrastruktúrát igényel. Ide tartozhatnak az egyedi homokozók, zárt tanítási folyamatok és saját adatkészletek, amelyeket sok kutató és gyakorlati fejlesztő nem tud elérni vagy reprodukálni.

Erre válaszként készült az Orchard, egy nyílt forrású keretrendszer skálázható agentikus modellezéshez. A központi komponens az Orchard Env, amely a közlemény szerint könnyűsúlyú, Kubernetes-alapú környezetként újrahasználható, izolált komponenseket biztosít ügynökök nagy léptékű futtatásához és építéséhez. Ez lefedi a tanítóadatok gyűjtését, a megerősítéses tanulási futtatásokat és az értékelést is.

Az Orchard Env több feladattípushoz és harnesshez készült

Az Orchard alapötlete, hogy a futtatási környezet önálló, újrahasználható szolgáltatás legyen, ne egy adott tanítási keretrendszerbe ágyazott infrastruktúra. A Microsoft Research leírása alapján az Orchard Env Kubernetes-alapja lehetővé teszi, hogy több ezer izolált komponenst hozzon létre, kezeljen és távolítson el párhuzamosan.

A rendszer különböző feladatokhoz készült, például kódoláshoz, webböngészéshez és eszközhasználathoz. Ugyanaz a szolgáltatás a forrás szerint szoftvermérnöki ügynököket, webes ügynököket és személyi asszisztens ügynököket is támogathat több területen.

A Microsoft Research külön kiemeli, hogy az Orchard ügynököket képes közvetlenül abban a harnessben tanítani, amelyben később futnak. A forrás példái között szerepel a Claude Code, a Codex, az OpenClaw és a ZeroClaw. A probléma az, hogy a mai fejlett ügynökök gyakran állapottartó, több folyamatból álló harnessen keresztül működnek, miközben a nyílt tanítóeszközök ezt sokszor nem tudják kezelni.

Az Orchard ezt egy könnyűsúlyú proxyval oldja meg: a proxy rögzíti a harness saját modellhívásait tanítóadatként, miközben minden futtatás külön konténerben zajlik. Így a forrás szerint az ügynök végig abban a környezetben tanítható, amelyben telepítéskor is működni fog.

Orchard-SWE: szoftverfejlesztési ügynökök nyílt modellekkel

Az Orchard-SWE a Microsoft Research szoftvermérnöki tanítási munkafolyamata. A rendszer a Mini-SWE-Agent keretrendszerre épül, amelyet szoftvermérnöki feladatok autonóm megoldására terveztek. Az értékelés a SWE-bench Verified benchmarkon történt, amely valós kódbázisokban vizsgálja a navigálást, diagnosztizálást és javítást.

A tanításhoz 107 000 ügynökinterakciót desztilláltak két fejlett nyílt súlyú modellből, a MiniMax-M2.5-ből és a Qwen3.5-397B-ből, sokféle GitHub Issue alapján. A folyamat kredit-hozzárendeléses felügyelt finomhangolást használ: a rendszer a részben sikertelen próbálkozások hasznos szakaszaiból is tanul, így több értékes tanítóadatot tud felhasználni.

A következő lépés a megerősítéses tanulás, ahol a visszajelzés ritka, mert az ügynök jellemzően csak azt tudja meg, hogy a végső javítás átment-e a rejtett teszteken. A Microsoft Research a Balanced Adaptive Rollout módszerrel kezd, majd két sűrű jutalmazási technikát ad hozzá: az on-policy desztillációt, amelyben egy erősebb tanítómodell lépésről lépésre pontozza az ügynök döntéseit, valamint egy folyamatjutalmazó modellt, amely a jó problémamegoldási folyamatot díjazza.

Az Orchard-SWE eredménye a SWE-bench Verified teszten 61,4 százalékos alapértékről 69,1 százalékra nőtt Balanced Adaptive Rollouttal, majd 69,7 százalékra a sűrű jutalmazási technikákkal. A Microsoft Research szerint ez új state of the art az összevethető méretű nyílt forrású modellek között, nagyjából 3 milliárd aktív paraméterrel. Egy 4 milliárd paraméteres értékmodell, amely 20 korábbi kísérlet futtatásaiból tanult, újrarangsorolással 73 százalékra emelte az eredményt.

Orchard-GUI és Orchard-Claw: webes és személyi asszisztens feladatok

Az Orchard-GUI a webes navigációra fókuszál, ahol az ügynököknek vizuális elrendezéseket kell értelmezniük, dinamikus felületekkel kell interakcióba lépniük, és természetes nyelven megadott, nyílt végű feladatokat kell teljesíteniük. A Microsoft Research egy 4 milliárd paraméteres látás-nyelvi modellt tanított böngészőügynökként, 400 desztillált demonstrációval és 2200 nyílt végű tanítási feladattal.

Az eredmény a forrás szerint 74,1 százalék a WebVoyageren, 67,0 százalék az Online-Mind2Weben és 64,0 százalék a DeepShopon, ami 68,4 százalékos átlagot jelent. A Microsoft Research szerint ezek az eredmények az Orchard-GUI-t a legerősebb nyílt forrású webes ügynökök közé helyezik, miközben versenyképes marad nagyobb zárt modellekkel is.

Az Orchard-Claw a személyi asszisztens feladatokra készült. A forrás ide sorolja az e-mailek olvasását és megírását, a naptárak kezelését, az információkeresést és az eszközök közötti koordinációt. Az ügynököt mindössze 200 szintetikus feladaton tanították.

A Claw-Eval benchmarkon, amely valószerű produktivitási munkafolyamatokat fed le, az Orchard-Claw legfeljebb három próbálkozással a feladatok 59,6 százalékát teljesítette sikeresen. A ZeroClaw ügynökrendszerrel párosítva ez az arány 73,9 százalékra nőtt.

Mit jelent ez a kutatóknak és fejlesztőknek

Az Orchard jelentősége a Microsoft Research közlése alapján abban áll, hogy az agentikus AI-kutatás több eddig külön kezelt elemét közös infrastruktúrába rendezi. Ugyanaz az Orchard Env használható tanítóadatok gyűjtéséhez, megerősítéses tanulási futtatásokhoz és értékeléshez, több feladattípuson és több ügynökrendszerrel.

A projekt a modellek és munkafolyamatok mellett tanítóadatokat és értékelési módszereket is kiad. A cél a forrás szerint az, hogy a szélesebb kutatói közösség nyílt agentikus rendszereket tudjon építeni és vizsgálni.

A bemutatott eredmények arra utalnak, hogy viszonylag kis, nyílt súlyú modellek is erős teljesítményt érhetnek el összetett, valós feladatokon, ha megfelelő tanítási eljárást és futtatási környezetet kapnak. Az Orchard-SWE esetében a Microsoft Research kifejezetten azt állítja, hogy a nagyjából 3 milliárd aktív paraméteres modell megközelíti a több mint 10-szer nagyobb frontier rendszereket.

Kapcsolódó hírek

A CoreWeave bemutatta az ARIA kutatási és iterációs ügynököt
Termékek és eszközök2026. október 2.

A CoreWeave bemutatta az ARIA kutatási és iterációs ügynököt

Általánosan elérhetővé vált a CoreWeave ARIA, egy kutatási és iterációs AI-ügynök, amely a CoreWeave Forge részeként segít modellek és AI-ügynökök fejlesztésében. Az…

Az Anaconda MCP ellenőrzi a csomagokat a kódoló ügynökök helyett
Termékek és eszközök2026. október 2.

Az Anaconda MCP ellenőrzi a csomagokat a kódoló ügynökök helyett

Általánosan elérhetővé vált az Anaconda MCP, amely csomagadatokkal, sérülékenységi információkkal és szervezeti házirendekkel segíti a kódoló ügynököket. A távoli…

Modellek
Modellek2026. október 2.

Az OpenAI útmutatót adott ki a GPT-6 modellek használatához

Az OpenAI gyakorlati útmutatóban mutatja be, hogyan érdemes kiválasztani és használni a GPT-6 család modelljeit. A dokumentum a fejlesztési feladatoktól a több napon át…