Új AI győzte le nagy fölénnyel a Stratego élvonalbeli játékosait

Az Ataraxos nevű mesterséges intelligencia nagy fölénnyel győzte le a Stratego legmagasabban rangsorolt játékosait. A kutatók szerint a rendszer a rejtett információkkal járó döntési helyzetekben, például üzleti tárgyalásokban vagy katonai műveletekben is segítséget nyújthat.
- Az Ataraxos 15 győzelemmel, 1 vereséggel és 4 döntetlennel verte a legerősebb Stratego-játékost.
- A Stratego több mint 10 a 66. hatványon lehetséges bábuelrendezést tartalmaz.
- A rendszer a DeepNashnél magasabb játékerőt ért el, kevesebb erőforrással.
- Az Ataraxos más hiányos információjú játékokban is emberfeletti teljesítményt nyújtott.
- A kutatók üzleti tárgyalásokban, katonai műveletekben és kiberbiztonságban is vizsgálnák a módszer lehetőségeit.
A Stratego a rejtett információk próbája
Az MIT, a Carnegie Mellon Egyetem, a New York-i Egyetem és a Stanford Egyetem kutatói által fejlesztett rendszer a Stratego nevű társasjátékban ért el kiemelkedő eredményt. A kutatásról szeptember 30-án számoltak be a Nature folyóiratban.
A kétjátékos Strategóban mindkét fél 40 bábut helyez el a saját térfelén, majd a célzászló elfoglalására törekszik. A bábuk kiléte azonban a találkozásukig rejtve marad, ezért a játékosoknak hiányos információk alapján kell dönteniük. A lehetséges bábuelrendezések száma meghaladja a 10 a 66. hatványon értéket, ami a forrás szerint exponenciálisan nagyobb a sakk lehetőségeinél.
Ez különösen nehéz feladat a mesterséges intelligencia számára. A korábbi próbálkozások, köztük a Google DeepMind rendszere, jelentős számítási kapacitást és költséges betanítást igényeltek, mégsem tudták legyőzni a legjobb emberi Stratego-játékosokat.
Az Ataraxos kevesebb erőforrással lett erősebb
A kutatók az Ataraxost önmagával játszatott megerősítéses tanulással tanították. A rendszer így egy alapstratégiát alakított ki, amelyből minden játszma során kiindul. A fejlesztők hatékonyabb algoritmusokat készítettek, hogy az AI gyorsabban tanuljon, és ne kelljen minden lehetséges lépést előre végigszámolnia.
A döntő újítás a játék közbeni tervezés. Az Ataraxos egy generatív modell segítségével valószínűségeket rendel az ellenfél rejtett bábuihoz, majd a következő lépés előtt felméri a lehetséges állásokat. Így az adott táblára és ellenfélre összpontosít, ahelyett hogy vakon tippelne.
Gabriele Farina, az MIT kutatója és a tanulmány vezető szerzője szerint a rendszer a DeepNashnél, a DeepMind Stratego-rendszerénél magasabb játékerőt ért el, miközben a betanítás során kevesebb mint a századannyi tanítási példát és kevesebb mint a harmincadannyi önjátszmát használta.
Az Ataraxos 15 győzelemmel, 1 vereséggel és 4 döntetlennel nyert a világ legerősebb Stratego-játékosa ellen. A Stratego-világbajnokság élvonalbeli játékosaival szemben 39 győzelmet és 2 vereséget ért el.
Más játékokban is működött a módszer
A kutatók az Ataraxost más, hiányos információkra épülő játékokra is átültették. A rendszer emberfeletti teljesítményt ért el a gyorsabb, kevesebb bábut használó Barrage Strategóban, a több résztvevős, együttműködésen alapuló Hanabiban, valamint a Dou dizhu nevű játékban is, amelyben két játékos egy harmadik ellen dolgozik együtt.
A kutatás szerint ez arra utal, hogy a módszer többféle szabályrendszerben és feladattípusban is alkalmazható. A rejtett információval járó valós helyzetek között a kutatók a pénzügyi piacok kereskedőinek döntéseit, az ellenséges katonai erők ismeretlen pozícióit, az üzleti tárgyalásokat és a kiberbiztonságot említik.
A fejlesztők a jövőben olyan értelmezhetőségi eszközöket szeretnének beépíteni a rendszerbe, amelyekkel az Ataraxos ember számára is érthetően meg tudja indokolni a döntéseit. Farina szerint az embereknek kell kimondaniuk a végső szót arról, hogy követik-e az AI ajánlását, ezért a gyakorlati alkalmazás előtt szükség van a modell döntéseinek ellenőrzésére.
MIT News: This game-playing AI is the new champ at Stratego


