Az Ataraxos rekorddal győzte le a Stratego élmezőnyét

Az Ataraxos nevű mesterségesintelligencia-rendszer nagy különbséggel legyőzte a Stratego legjobb emberi játékosait. A kutatók szerint a modell a korábbi rendszereknél hatékonyabban kezelheti azokat a döntési helyzeteket, amelyekben fontos információk rejtve maradnak.
- Az Ataraxos rekorddal győzte le a Stratego legjobb emberi játékosait.
- A rendszer kevesebb mint a korábbi betanítási példák egy századát használta a DeepNashhoz képest.
- A modell rejtett bábuk valószínűségeit becsüli, majd az adott állásra tervez.
- Barrage Strategóban, Hanabiban és Dou dizhuban is szuperemberi teljesítményt ért el.
- A kutatók később érthetőbbé és ellenőrizhetőbbé tennék a döntéseit.
A Stratego az információhiány miatt különösen nehéz
Az MIT, a Carnegie Mellon University, a New York University és a Stanford University kutatói olyan mesterségesintelligencia-rendszert fejlesztettek, amely a Stratego társasjátékban szuperemberi teljesítményt ért el. A kutatásról szóló tanulmány a Nature folyóiratban jelent meg, az MIT Schwarzman College of Computing beszámolója szerint 2026. szeptember 30-án.
A Stratego kétjátékos, tökéletlen információjú játék. A játékosok 40 bábut helyeznek el a saját oldalukon, majd a pályán mozgatva próbálják elfogni az ellenfél zászlóját. A bábuk kiléte az összecsapásig rejtve marad, az ütközés után pedig az alacsonyabb rangú bábu kiesik.
A lehetséges bábuelrendezések száma meghaladja a 1066-ot, ami a sakkéhoz képest exponenciálisan nagyobb keresési teret jelent. A korábbi rendszerek, köztük a Google DeepMind megoldásai, nagy számítási igényű műveletekre támaszkodtak, és az MIT szerint még több millió dolláros betanítási költség mellett sem tudták legyőzni a legjobb emberi Stratego-játékosokat.
Önjátékkal tanult, játék közben is tervez
Az Ataraxost önmagával játszatott megerősítéses tanulással képezték. A rendszer sok mérkőzésen keresztül alakított ki egy alapstratégiát, amelyből később kiindulhat. A kutatók hatékonyabb algoritmusokat terveztek hozzá, így a modell gyorsabban tanulhatott, miközben nem kellett minden lehetséges lépést megjósolnia.
Az MIT szerint az Ataraxos a DeepMind DeepNash rendszerénél nagyobb játékerőt ért el, kevesebb mint a korábbi betanítási példák egy századának és az önjátékok egy harmincadának felhasználásával. A mérkőzés közben a rendszer egy generatív modell segítségével valószínűségeket rendel az ellenfél rejtett bábuihoz. Ezután döntési idejű tervezéssel, vagyis az adott állásra szabott számítással értékeli a lehetséges folytatásokat.
„Ahelyett, hogy vakon tippelnénk, a döntési idejű tervezést használjuk a tábla legvalószínűbb állapotának megtalálására”, mondta Gabriele Farina, az MIT professzora és a tanulmány vezető szerzője a kutatóintézet beszámolója szerint.
Rekord a világbajnokságon, más játékokban is működött
Az Ataraxos 15 győzelem, 1 vereség és 4 döntetlen arányban múlta felül a világ legerősebb Stratego-játékosát. A Stratego-világbajnokság legjobb emberi játékosaival szemben 39 győzelmet és 2 vereséget ért el.
A kutatók a rendszert más, rejtett információkra épülő játékokra is átültették. A Barrage Stratego gyorsabb, kevesebb bábuval játszott változatában, a többjátékos kooperatív kártyajáték Hanabiban, valamint a Dou dizhu nevű játékban is szuperemberi teljesítményt értek el vele. Ez a kutatók szerint azt mutatja, hogy a módszer különböző szabályrendszerekre is általánosítható.
A megközelítés a jövőben olyan területeken is alkalmazható lehet, ahol a döntéshozók nem ismernek minden fontos körülményt, például katonai manőverekben, üzleti tárgyalásokon vagy kiberbiztonsági helyzetekben. Farina szerint az Ataraxosnak még magyaráznia is kell majd a döntéseit, mielőtt ilyen ajánlások használatba kerülhetnének. A kutatók értelmezhetőségi mérőszámokat szeretnének beépíteni a rendszerbe, és hangsúlyozzák, hogy az embereknek kell meghozniuk a végső döntést arról, követik-e az AI javaslatát.
MIT Schwarzman College of Computing: This game-playing AI is the new champ at Stratego


