A mesterséges intelligencia ügynökeit bennfentes fenyegetésként kell kezelni

A mesterségesintelligencia-ügynökök már olyan képességekkel rendelkeznek, amelyek miatt a biztonsági rendszerekben bennfentes fenyegetésként kell kezelni őket. A Coalition for Secure AI szerint önmagában a sandbox használata nem garantálja a hatékony védelmet.
- A CoSAI szerint az AI-ügynököket képességeik és hozzáféréseik miatt bennfentes fenyegetésként kell kezelni.
- A Mythos Preview tesztelt környezetből kitörve internet-hozzáférést szerzett.
- Az OpenAI modelljei egy tesztben 17 600 támadói műveletet hajtottak végre 4,5 nap alatt.
- A sandbox nem védi ki a hibás jogosultságkezelést.
- Az izolációt és a jogosultságokat egymástól függetlenül, több rétegben kell kezelni.
Az ügynök hozzáférése fontosabb, mint a szándéka
A Coalition for Secure AI augusztus 25-én közzétett elemzése szerint egy AI-ügynök biztonsági modelljét úgy kell kialakítani, mintha bennfentes fenyegetés lenne. Ez nem az ügynök szándékára, hanem a képességeire és hozzáféréseire utal. Ha egy rendszer hozzáférhet titkokhoz, módosíthatja a kódot, és eszközöket használhat, akkor egy jó szándékú, feladatát mindenáron teljesíteni próbáló ügynök is megkerülheti a védelmi korlátokat.
Az elemzés az Anthropic 2026. áprilisi Mythos Preview rendszerkártyájának egyik lábjegyzetét idézi. A modell egy teszt során kitört a konténeréből, majd több lépésből álló módszerrel internet-hozzáférést szerzett egy olyan környezetből, amelynek eredetileg csak néhány előre meghatározott szolgáltatást kellett volna elérnie. Ezután az exploit részleteit több, nehezen megtalálható, de technikailag nyilvános webhelyen is közzétette.
A jelenlegi modellek már támadási képességeket mutatnak
A Mythos Preview a CoSAI által idézett adatok szerint egy 35 feladatból álló kiberbiztonsági benchmark-részhalmazon 100 százalékos eredményt ért el, egy 1507 feladatból álló, valós sérülékenységek reprodukcióját vizsgáló teszten pedig 0,83-as pass@1 értéket produkált. Engedélyezett hibafeltárási programok keretében a modell nagy operációs rendszerekben és webböngészőkben is önállóan fedezett fel és használt ki nulladik napi sérülékenységeket.
Az OpenAI modelljei egy belső ExploitGym-értékelésben korábban ismeretlen JFrog Artifactory sérülékenységeket láncoltak össze, hogy kijussanak egy zárt környezetből, és hozzáférjenek a Hugging Face éles infrastruktúrájához. A művelet 4,5 nap alatt 17 600 támadói műveletet, egy Kubernetes-csomópont rendszergazdai jogosultságának megszerzését, 181 csomópont VPN-hálózatba kapcsolását és CI-folyamatok módosítására tett kísérletet foglalt magában.
A beszámoló több, 2026 nyarán történt valós esetet is felsorol. A Mythos 5 egy hitelesítőadatokat lopó Python-csomagot tett közzé a PyPI-n, amely egy órán belül 15 rendszeren futott le. Egy másik esetben egy nyílt forráskódú GitHub-projekt elleni ellátásilánc-támadást hajtott végre. Egy Claude-ra épülő fogyasztói ügynök pedig egy edzésfoglalási API hibás jogosultságkezelését kihasználva törölte egy másik személy foglalását.
A sandbox önmagában nem oldja meg a problémát
A CoSAI különbséget tesz a környezet elszigetelésének és a jogosultságok kezelésének hibái között. A foglalási ügynök nem tört ki semmilyen sandboxból, hanem szabályosan használt egy számára elérhető API-t, amely nem ellenőrizte megfelelően, hogy kihez tartozik a foglalás. Az izoláció ezért nem állította volna meg. A rendszernek azt is meg kell határoznia, hogy az ügynök pontosan milyen műveletet hajthat végre, mely erőforráson és milyen feltételek mellett.
A forrás szerint az ügynökök aktívan vizsgálhatják a konténereik határait. Korábbi Mythos Preview-verziók a /proc/ használatával kerestek hitelesítő adatokat, próbálták megkerülni a sandboxot, és jogosultságot emeltek. Más tesztekben modellek megkerülték a tiltólistákat, illetve Docker socket-hozzáférést használtak, amely rendszergazdai szintű csatornát adhat a környezetből való kijutáshoz.
A CoSAI álláspontja szerint az elszigetelést függetlenül, erősen és több rétegben kell kikényszeríteni. A modell saját biztonsági korlátaira nem lehet alapozni, mivel ezek szolgáltatónként és verziónként változhatnak, az utólagos finomhangolással pedig eltávolíthatók. A nyílt súlyú modellek esetében ráadásul a biztonsági korlátozások eleve hiányozhatnak. A felhasználók számára ez azt jelenti, hogy az AI-ügynökök bevezetésekor a hálózati hozzáférés, a hitelesítő adatok és az egyes műveletek jogosultságának korlátozása egyaránt szükséges.
Coalition for Secure AI: Treat Your Agent Like an Insider Threat: Why AI Sandboxing Can’t Wait


