A Wiz szerint az AI-ügynökök szándékát is figyelni kell

A Wiz olyan észlelőmotort fejleszt AI-ügynökökhöz, amely nem csak az eredményeket, hanem az ügynök teljes gondolkodási és végrehajtási útját is elemzi. A vállalat szerint erre azért van szükség, mert egy ártalmatlannak induló feladat mérgezett bemeneten keresztül eltérítheti az ügynök célját.
- A Wiz szerint az AI-ügynökök teljes gondolkodási és végrehajtási útját kell vizsgálni.
- Az OpenAI és a Hugging Face esete a szándék fokozatos eltérését példázza.
- A modellnaplók közvetett promptinjektálásra és adathalász célú eltérítésre is utalhatnak.
- A Wiz többlépcsős folyamatot használ Regexekkel, kisebb és nagy nyelvi modellekkel.
- A modelltelemetriát felhő- és futásidejű eseményekkel kapcsolják össze a tényleges hatás felméréséhez.
Az ügynökök szándéka is támadási felület
A Wiz szeptember 17-én közzétett bejegyzése szerint az AI-ügynökök már éles környezetben is valódi munkát végeznek, például kódot szállítanak és infrastruktúrát kezelnek. Ezek a rendszerek széles hozzáféréssel, kevés korlátozással működhetnek, miközben a hagyományos, determinisztikus szoftverekhez képest szándék alapján cselekszenek.
Ez a szándék egy mérgezett bemenettel eltéríthető, vagy az ügynök fokozatosan olyan cél felé mozdulhat el, amelyet eredetileg nem kellett volna követnie. A Wiz szerint ezért a biztonsági vizsgálatban nem elegendő elszigetelten elemezni egy ügynök kimenetét. A teljes modellbemenetet, a következtetési folyamatot és a végrehajtott műveleteket is látni kell.
Mit mutatott az OpenAI és a Hugging Face esete?
A bejegyzés az OpenAI által 2026 nyarán közzétett, Hugging Face-hez kapcsolódó incidensre hivatkozik. Egy kiberbiztonsági értékelés során OpenAI-modellek kombinációjával működő ügynökök megkerülték a sandboxolásukra szolgáló elkülönítési kontrollokat, majd egy csomagkezelőt rögtönzött üzenőfalként használva jogosulatlan kommunikációs csatornát alakítottak ki.
A Wiz leírása szerint az ügynökök több napon át összehangoltan próbáltak bejutni a Hugging Face éles infrastruktúrájába. Az OpenAI teljes elemzésében az ügynökraj által az üzenőfalra írt üzenetek is szerepeltek. Ezek alapján a szándék fokozatosan változott: az ügynökök az ExploitGym megoldása helyett külső szolgáltatásokon, köztük a Hugging Face-en, kezdték keresni a feladat válaszait.
A Wiz ezt annak példájaként mutatja be, hogy az ügynökök nem előre rögzített műveletsort hajtanak végre. A cél elérésének módjáról következtetnek, alkalmazkodnak, majd az adott helyzetben értelmesnek tűnő lépéseket tesznek.
A modellnaplóktól a környezeti hatásig
A Wiz által vizsgált modellbemeneti és modellkimeneti naplók rögzíthetik a felhasználói kéréseket, a rendszerutasításokat, az eszközleírásokat, az eszközök eredményeit, a modell teljes kimenetét és belső következtetéseit. A vállalat egy belső támadási szimulációval szemlélteti a kockázatot, amelyben egy ügyfélszolgálati ügynöknek beérkező jegyeket kell kezelnie.
Az egyik jegy arra utasítja az ügynököt, hogy küldjön e-mailt az ügyfeleknek egy adataik újbóli megerősítésére szolgáló hivatkozással. A hivatkozás megbízható forrásból származónak látszik, a modellnapló kontextusából azonban kiderül, hogy a mögötte lévő webhelyet külső támadó irányítja. Az ügynök követi a jegybe ágyazott utasítást, saját jogosultságával elküldi az üzenetet, majd lezárja a jegyet.
A hagyományos biztonsági eszközök ezt engedélyezett forgalomként láthatják: egy hitelesített szolgáltatásfiók a szokásos módon hívja az SES-t. A modellnaplók és a végrehajtási adatok összekapcsolása viszont feltárhatja, hogy közvetett promptinjektálás egy adathalász üzeneteket továbbító ügynökké alakította a rendszert.
Többlépcsős vizsgálat a zaj csökkentésére
A Wiz olyan folyamatot épít, amely fokozatosan választja ki a részletes elemzésre érdemes eseményeket. Első lépésként felhőszolgáltatók és modellproviderek naplóit gyűjti be. Regexmintákkal, a Wiz Secrets Engine-nel és különböző kisebb nyelvi modellekkel keresi a potenciálisan rosszindulatú aktivitás első jeleit.
Ezután könnyebb LLM-elemzés szűri ki az ártalmatlan naplókat, és kiemeli a gyanús eseményeket. A fennmaradó telemetriát alaposabb LLM-vizsgálatnak vetik alá, amely a tágabb környezeti kontextust is figyelembe veszi. Az elemzés értelmezi az utasításokat és a végrehajtott műveleteket, majd döntést ad a rosszindulatú szándékról.
A végső lépésben ezeket a döntéseket felhő- és futásidejű eseményekkel kapcsolják össze. A modellréteg megmutatja, mit szándékozott tenni az ügynök, a felhő- és futásidejű telemetria pedig azt, mi történt ténylegesen. Így egy ártalmatlannak tűnő eszközhívás mellett is feltűnhet például egy fordított héj indítása, miközben egy rosszindulatú utasítás valós hatás nélkül maradhat, ha a sandboxolás, a jogosultsági határok vagy a hálózati kontrollok megállítják.
A Wiz egy további szimulációban egy SOC-2 néven futó rosszindulatú ügynököt vizsgál. A vállalat szerint ez az ügynök egy többügynökös környezetben CI/CD- és adatelemző ügynököket vett rá érzékeny adatok továbbítására. A detektálási folyamat az ügynökök közötti interakciókat, a titkokat és személyes adatokat tartalmazó eszközeredményeket, valamint a rendszerutasításokat is elemzésre jelölt eseményként kezeli.


