Az Ataraxos legyőzte a Stratego világbajnokait

Az Ataraxos nevű mesterséges intelligencia rekordkülönbséggel győzte le a Stratego legerősebb emberi játékosát, és a kutatók szerint más, rejtett információkra épülő helyzetekben is használható lehet. A rendszer az eddigi modelleknél nagyobb teljesítményt ért el, miközben kevesebb számítási erőforrást igényelt a betanítása.
- Az Ataraxos 15-1-4 arányban győzte le a világ legerősebb Stratego-játékosát.
- A világbajnokság legjobb játékosai ellen 39-2-es mérleget ért el.
- A rendszer a DeepNashnél nagyobb játékerőt ért el kevesebb betanítási erőforrással.
- Az Ataraxos más hiányos információjú játékokban is emberfeletti teljesítményt mutatott.
- A kutatók katonai, üzleti és kiberbiztonsági döntési helyzetekben látják a módszer lehetséges alkalmazását.
Rejtett információkkal teli játékban ért el áttörést
Az MIT, a Carnegie Mellon University, a New York University és a Stanford University kutatói az Ataraxost a Stratego társasjátékhoz fejlesztették. A kétfős, hiányos információjú játékban a játékosok 40 bábut helyeznek el a tábla saját oldalukon, majd megpróbálják elfoglalni az ellenfél zászlaját. A bábuk kiléte egészen addig rejtve marad, amíg össze nem ütköznek.
A Stratego azért jelent komoly próbatételt a mesterséges intelligenciák számára, mert a lehetséges bábuállások száma meghaladja a 1066-ot. Ez exponenciálisan több lehetőség, mint a sakkban. A játékot gyakran használják a stratégiai gondolkodás és a rejtett információk kezelésének tesztelésére.
Az MIT News szeptember 30-i beszámolója szerint az Ataraxos 15 győzelemmel, 1 vereséggel és 4 döntetlennel zárt a világ legerősebb Stratego-játékosa ellen. A világbajnokság legjobb emberi játékosai ellen 39 győzelem és 2 vereség volt a mérlege.
Kevesebb betanítással teljesített jobban
A kutatók önjátszó megerősítéses tanulást alkalmaztak. A modell sok alkalommal önmaga ellen játszott, így alakította ki azt az alapstratégiát, amelyből később kiindulhatott. A fejlesztők hatékonyabb algoritmusokat készítettek, hogy a rendszer gyorsabban tanuljon, és ne kelljen minden lehetséges lépést teljes körűen előre kiszámítania.
Az Ataraxos játék közben egy úgynevezett döntési idejű tervezést is használ. Egy generatív modell valószínűségek alapján megbecsüli, hogy milyen bábu lehet az ellenfél rejtett figurái mögött, majd értékeli a lehetséges folytatásokat. Így a rendszer az adott táblaálláshoz és ellenfélhez igazítja a következő lépését.
Gabriele Farina, az MIT villamosmérnöki és informatikai tanszékének adjunktusa, a kutatás vezető szerzője szerint az Ataraxos szigorúan magasabb játékerőt ért el a DeepMind DeepNash rendszerénél. Ehhez a DeepNash által használt betanítási példák kevesebb mint egy századára, az önjátszó mérkőzéseknek pedig kevesebb mint egy harmincadára volt szüksége.
Más játékokban is működött a módszer
A kutatók az Ataraxost más, hiányos információjú játékokra is adaptálták. A Barrage Stratego gyorsabb, kevesebb bábuval játszott változatában, a több résztvevős, együttműködésen alapuló Hanabiban, valamint a két játékos és egy harmadik játékos elleni együttműködésére épülő Dou dizhuban is emberfeletti teljesítményt ért el.
Farina szerint a valós döntési helyzetekben gyakran nincs lehetőség az összes lehetséges forgatókönyv felsorolására, mert túl sok van belőlük. A kutatók ezért olyan problémákban látják a módszer lehetséges hasznát, ahol egyes szereplők olyan információkkal rendelkeznek, amelyek mások előtt rejtve maradnak. Példaként katonai műveleteket, üzleti tárgyalásokat és kiberbiztonsági helyzeteket említenek.
A kutatás következő célja, hogy az Ataraxos olyan értelmezhetőségi eszközöket kapjon, amelyekkel ember számára is meg tudja magyarázni a döntéseit. Farina szerint az embereknek kell kimondaniuk a végső szót arról, hogy követik-e a rendszer ajánlását, ezért a gyakorlati bevezetés előtt szükség van a modell döntéseinek ellenőrzésére.
MIT News: This game-playing AI is the new champ at Stratego


