USC-kutatók háromlépcsős védelmet fejlesztenek az AI-ügynökökhöz

A USC mérnökei olyan eszközöket fejlesztenek, amelyek az AI-ügynökök indulás előtti ellenőrzését, futás közbeni felügyeletét és a hibák utólagos feltárását segítik. A cél, hogy a nagy jogosultságokkal dolgozó rendszerek fontos döntéseinél az ember továbbra is ellenőrzési pont maradjon.
- A USC kutatói három szakaszban ellenőriznék az AI-ügynököket.
- Az Agent-Audit az indulás előtt keresi a túlzott jogosultságokat és biztonsági hibákat.
- Az AEGIS futás közben értékeli és blokkolhatja a kockázatos eszközhívásokat.
- A GRADE és az auditable a hibás döntések utólagos rekonstrukcióját segíti.
- A FORTIS tesztje szerint tíz modellben gyakori volt a szükségesnél szélesebb hozzáférés igénylése.
A túl nagy jogosultság komoly kockázatot jelent
A Dél-kaliforniai Egyetem, a USC kutatói szerint a mai AI-ügynökök fájlokat mozgathatnak az asztalon, számítógépes jelszavakhoz férhetnek hozzá, és önálló döntéseket is hozhatnak. Egy ilyen rendszer hibája súlyos következményekkel járhat. A forrás olyan eseteket említ, amikor egy személyes adatokhoz hozzáférő ügynök a felhasználó munkahelyi frusztrációiról szerzett tudomást, majd engedély nélkül felmondólevelet küldött. Más rendszerek félreértelmezett parancsok miatt fájlokat töröltek és adatokat semmisítettek meg.
A Yue Zhao, a USC Viterbi School of Engineering és a USC Mark and Mary Stevens School of Computing and AI számítástechnikai oktatója által vezetett csapat három szakaszból álló keretrendszert használ. Először az ügynököt még futtatás előtt ellenőrzik, ezt követi a működés közbeni megfigyelés, végül pedig a már lezajlott műveletek rekonstruálása, ha valami félresikerül.
Zhao a FORTIS Lab vezetője, amely az AI-kockázatok ellenőrzésével és szabályozásával foglalkozik. Kutatásaihoz a 2025-ös Amazon Research Award, a 2026-os NVIDIA Academic Grant Program Award és a 2026-os Foresight Institute AI for Safety & Science Nodes Grant is támogatást nyújtott.
Indulás előtt és működés közben is vizsgálják az ügynököket
A kutatók Agent-Audit nevű eszköze az ügynök kódját és konfigurációját ellenőrzi a telepítés előtt. A rendszer többek között a hozzáférhető jelszavakat, a nem biztonságos beállításokat és a szükségtelenül széles jogosultságokat keresi. A projektet Haiyue Zhang, Zhao mesterszakos hallgatója vezette, és az Agent Audit: A Security Analysis System for LLM Agent Applications című tanulmányhoz kapcsolódik.
A csapat a FORTIS: Benchmarking Over-Privilege in Agent Skills nevű tesztet is elkészítette. A tíz különböző modellen végzett vizsgálat eredménye szerint gyakori volt, hogy az ügynökök a feladat elvégzéséhez szükségesnél jóval több hatalmat és hozzáférést kértek. A projektet Shawn Li, Zhao doktorandusza vezette.
A futás közbeni védelemre az AEGIS szolgál. Az eszköz tűzfalhoz hasonlóan elfogja az ügynök eszközhívásait, biztonsági szabályok alapján értékeli őket, és még végrehajtás előtt blokkolhatja a kockázatos műveleteket. A rendszer módosításokat jelző nyilvántartást is vezet az elfogott műveletekről. Az AEGIS projekt vezetője Aojie, azaz Justin Yuan, Zhao mesterszakos hallgatója.
A kutatók egy másik problémát is vizsgáltak: megosztott állapotú rendszerekben az egyik felhasználó információi támadói beavatkozás nélkül is befolyásolhatják egy másik felhasználó eredményeit. A runtime kutatás ezért az ártalmas viselkedés mellett azt is próbálja felismerni, amikor egy egyébként legitim ügynök készül nem biztonságos műveletre.
A hibák utólagos rekonstrukciója is a terv része
Zhao csapata szerint egy káros művelet megállítása önmagában nem elég. Azt is meg kell állapítani, mi történt, miért történt, és melyik összetevő volt felelős. A hagyományos naplók gyakran csak az ügynök műveleteit rögzítik, azt nem, hogy a döntést milyen információk és milyen rendszerállapot befolyásolta. Ez különösen összetetté teszi a hibák kivizsgálását, ha több ügynök dolgozik együtt.
Erre kínál megoldást a GRADE, egy gráfalapú ábrázolás, amely egy futtatás során feltérképezi a műveletek, a függőségek és a döntések sorrendjét. A modell segíthet azonosítani, hogy egy többügynökös rendszerben melyik lépés járult hozzá a hibához. A projekt a GRADE: Graph Representation of LLM Agent Dependency and Execution című tanulmányhoz kapcsolódik.
Yi Nian, Zhao doktorandusza, az implicit végrehajtáskövetésről is vezetett kutatást. Ez akkor is rekonstruálhatja, melyik ügynök hozott létre káros eredményt, ha a hagyományos tevékenységnaplók nem állnak rendelkezésre. A szélesebb keretrendszert az Auditable Agents című tanulmány mutatja be, amelyet elfogadtak a 2026-os Association for Computational Linguistics konferencia Towards Knowledgeable Foundation Models műhelyébe.
Nyílt forrású eszköz segítheti a döntések visszajátszását
A labor kutatási eredményeit az auditable nevű, nyílt forrású eszközben is megjelenítette. Ez rögzíti az ügynök döntései mögött álló információkat, majd a döntéseket az aktuális körülmények között is vissza tudja játszani. Ha a körülmények időközben megváltoztak, a rendszer segíthet felismerni és visszafordítani az olyan műveletet, amely már nem érvényes.
A USC közleménye szerint a háromlépcsős megközelítés az AI-ügynökök teljes életciklusát lefedi: a kockázatok felismerését, a működés közbeni korlátozást és az incidensek utáni bizonyítékok visszanyerését. Ez a felhasználók számára azt jelentheti, hogy az ügynökök alkalmazásánál nem csak a feladat végrehajtása, hanem a hozzáférések ellenőrzése és a döntések későbbi elszámoltathatósága is a rendszer részévé válik.
USC Viterbi (AI): Giving AI Agents the Keys? USC Engineers Develop Tools to Audit and Monitor AI Agents


