Az Ataraxos legyőzte a világ legjobb Stratego-játékosait

Az Ataraxos nevű mesterségesintelligencia-rendszer rekordkülönbséggel győzte le a világ legerősebb Stratego-játékosát, és a kutatók szerint jóval hatékonyabban tanítható a korábbi modelleknél. A technológiát később katonai manőverek, üzleti tárgyalások vagy kiberbiztonsági döntések támogatására is felhasználhatják.
- Az Ataraxos 15-1-4 arányban győzte le a világ legerősebb Stratego-játékosát.
- A rendszer a világbajnokság legjobb emberi játékosai ellen 39-2-es eredményt ért el.
- A DeepNashnél magasabb játékerőt ért el kevesebb mint egy századnyi tanítási példával.
- A módszer más hiányos információjú játékokban is emberfeletti teljesítményt nyújtott.
- A kutatók később érthetőbbé és ellenőrizhetőbbé tennék az AI döntéseit.
Rejtett információkkal is megbirkózik
Az MIT, a Carnegie Mellon University, a New York University és a Stanford University kutatói olyan mesterségesintelligencia-rendszert fejlesztettek, amely a hiányos információjú stratégiai játékokban is erős teljesítményt nyújt. Az eredményeket bemutató tanulmány a Nature folyóiratban jelent meg.
A Strategóban a játékosok 40 bábut helyeznek el a tábla saját térfelén, majd ezekkel próbálják elfogni az ellenfél zászlóját. A bábuk azonossága mindaddig rejtve marad, amíg össze nem ütköznek. Ekkor az alacsonyabb rangú bábu kiesik. A lehetséges bábuelrendezések száma meghaladja a 1066-ot, ami a sakkéhoz képest exponenciálisan nagyobb keresési teret jelent.
A kutatók szerint a rejtett információ azért nehezíti meg a döntést, mert a játékosok által megtett és elmulasztott lépések is összefonódnak. Gabriele Farina, az MIT villamosmérnöki és informatikai tanszékének adjunktusa úgy fogalmazott, hogy a valós problémákban gyakran nincs lehetőség az összes lehetséges forgatókönyv végigvizsgálására.
Kevesebb erőforrással lett erősebb
Az Ataraxost önmagával játszatva, megerősítéses tanulással képezték. A rendszer így egy olyan alapstratégiát tanult meg, amelyből kiindulva hatékonyan játszhat Strategót. A kutatók ehhez olyan algoritmusokat terveztek, amelyek felgyorsították a tanulást, és megakadályozták, hogy a modell minden lehetséges lépést megpróbáljon előre kiszámítani.
A rendszer a játék közben egy generatív modellt is használ. Ez valószínűségek alapján megbecsüli, hogy milyen bábu lehet az ellenfél rejtett egységei mögött, majd a következő lépés kiválasztása előtt értékeli a lehetséges folytatásokat. A kutatók ezt döntési idejű tervezésnek nevezik.
Az MIT közlése szerint az Ataraxos magasabb játékerőt ért el, mint a DeepMind DeepNash rendszere, miközben a tanításához a korábbi módszer példáinak kevesebb mint egy századát, az önmagával játszott mérkőzésekből pedig kevesebb mint egy harmincadát használta fel.
Rekord a Stratego-világbajnokságon
Az Ataraxos 15-1-4 arányban győzte le a világ legerősebb Stratego-játékosát. A Stratego-világbajnokságon a legjobb emberi játékosok ellen 39-2-es eredményt ért el. A kutatók szerint a rendszer a kockázatokat olyan módon számítja ki, amelyre az emberek nem képesek ugyanilyen következetességgel, és nem reagál túl egy veszélyesnek tűnő helyzetre.
A módszert más, hiányos információjú játékokra is alkalmazták. A Barrage Strategóban, a kevesebb bábuval játszott gyorsabb változatban, a több résztvevős kooperatív kártyajátékban, a Hanabiban, valamint a két játékos együttműködésére épülő Dou dizhuban is emberfeletti teljesítményt ért el.
A kutatók ember által ellenőrizhető döntéseket szeretnének
Az eredmény azért lehet fontos a játékokon túl is, mert a pénzügyi piacokon, katonai helyzetekben, üzleti tárgyalásokon és kiberbiztonsági feladatokban sem áll rendelkezésre minden információ. A kutatók szerint az Ataraxos módszere ilyen döntési helyzetekben is támogathatja az ideális stratégiák kiválasztását.
A következő lépésként értelmezhetőségi megoldásokat építenének a rendszerbe, hogy az Ataraxos ember számára érthetően magyarázza el a döntéseit. Farina szerint az embereknek kell meghozniuk a végső döntést arról, hogy követik-e a rendszer ajánlását, ezért annak bevezetése előtt ellenőrizhetővé kell tenni a modell döntéseit.
MIT Schwarzman College of Computing: This game-playing AI is the new champ at Stratego


