Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Sokobanban tanul tervezni az RNN, és gondolkodás közben köröz

2026. július 16.Forrás: FAR.AI
A Sokobanban tanul tervezni az RNN, és gondolkodás közben köröz
Kép: FAR.AI

A FAR.AI kutatói egy Sokobant játszó visszatérő neurális hálózatnál azt figyelték meg, hogy több gondolkodási lépéssel hatékonyabban tervez, és nehezebb pályákat is megold. Az ügynök olykor a pálya elején körözni kezdett, mintha időt nyerne a megoldás kiszámításához.

A lényeg röviden
  • A DRC-modell extra gondolkodási lépésekkel nehezebb Sokoban-pályákat is megoldott.
  • A teljesítmény 6 gondolkodási lépésig javult, utána stagnált vagy kissé visszaesett.
  • A hálózat köröző mozgással nyert időt a tervezéshez.
  • A köröző ciklusok 82,39 százaléka eltűnt extra gondolkodási idővel.
  • A kutatás az AI-tervezés és az AI-biztonság értelmezését is segítheti.

A plusz gondolkodási idő javította a teljesítményt

A kutatás egy 1,28 millió paraméteres, Deep Repeating ConvLSTM, röviden DRC architektúrájú visszatérő neurális hálózat viselkedését vizsgálta. A modellt megerősítéses tanulással tanították Sokoban-pályák megoldására, a Boxoban adathalmaz különböző nehézségű pályáin.

A hálózat 10x10 képpontos RGB-képeket kapott bemenetként, a tanításhoz pedig az IMPALA algoritmust használták. Az ügynök jutalmat kapott, amikor egy dobozt célmezőre tolt, minden lépésért pedig kis büntetés járt. A modell 2 milliárd környezeti lépés alatt tanult meg egyre hatékonyabban előre gondolkodni.

A FAR.AI eredményei megerősítették a Guez és szerzőtársai által 2019-ben közölt megfigyeléseket. A DRC-modellnek adott extra gondolkodási lépések javították a megoldási arányt, különösen az összetettebb pályákon. A teljesítmény legfeljebb 6 gondolkodási lépésig nőtt, ezután stagnált vagy kissé visszaesett.

A körözés segített elkerülni a rossz döntéseket

Extra gondolkodási idő nélkül az ügynök bizonyos helyzetekben olyan pozícióba zárta magát, amelyből már nem lehetett megoldani a pályát. Több gondolkodási lépéssel viszont sikerült elkerülnie az olyan rövid távon jónak tűnő akciókat, amelyek később például egy doboz beragadásához vezettek.

A kutatók a dobozok elhelyezésének sorrendjét is elemezték. Azokon a pályákon, amelyeket az ügynök 6 gondolkodási lépéssel, de nulla lépéssel nem tudott megoldani, az első három doboz elhelyezése tovább tartott. A negyedik doboz célba juttatása ugyanakkor gyorsabb volt. Ez arra utal, hogy a modell a korai lépésekben feláldozta az azonnali haladást a későbbi, jobb megoldás érdekében.

Az ügynök időnként köröző mozgást is végzett a pályán. Amikor a hálózatot arra késztették, hogy a ciklus megkezdése előtt ugyanannyi gondolkodási lépést hajtson végre, a ciklusok 82,39 százaléka eltűnt. A kutatók szerint ez alátámasztja, hogy a körözés a terv kialakítását szolgálta.

A kutatás az AI-biztonság számára is fontos lehet

A DRC-modell a vizsgálatban egy nem visszatérő ResNet-alapot is felülmúlt, miközben a ResNet több mint kétszer annyi paraméterrel rendelkezett. A FAR.AI szerint ez azt mutatja, hogy a visszatérő felépítés és az extra gondolkodási idő hasznos lehet a tervezési feladatokban.

A hálózat belső tervezési folyamatának pontos részletei azonban továbbra sem ismertek. A kutatók ezért nyílt forráskódúvá tették a betanított ügynököket és a korábbi eredményeket reprodukáló kódot, hogy más értelmezhetőségi kutatók is tanulmányozhassák ezeket a tervezést vizsgáló modellrendszereket.

A FAR.AI a jelenséget a mesa-optimalizálók problémájával is összekapcsolja. Ezek olyan hálózatok, amelyek a tanítás során a kívánt céltól eltérő belső célokat alakíthatnak ki. A kutatócsoport szerint a Sokoban-kísérlet segíthet annak megértésében, hogyan jelenik meg a tervezés a mély neurális hálózatokban, és hosszabb távon hozzájárulhat a tervezési folyamatok automatikus felismeréséhez, vizsgálatához és az emberi értékekhez való igazításához.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…

A szuperemberi Go-programokat is egyszerű trükkökkel lehet megverni
Kutatás2026. július 16.

A szuperemberi Go-programokat is egyszerű trükkökkel lehet megverni

Egy automatikus támadási módszerrel a kutatók rendszeresen legyőzték a szuperemberi szintű Go-programokat. A kísérletek szerint a KataGo és más erős rendszerek bizonyos…