A fejlett AI-ügynökök kockázata a teljes rendszerben rejlik

A fejlett AI-kódoló ügynökök irányítási, felügyeleti és szervezeti kockázatait vizsgálta a SaferAI új tanulmánya. A kutatók szerint a modellközpontú értékelések több olyan problémát nem látnak, amelyek a teljes társadalmi-technikai rendszer működéséből erednek.
- A SaferAI a kódoló AI-ügynökök teljes társadalmi-technikai rendszerét vizsgálta.
- A STECA hiányzó felelősségi és visszaszűkítési jogosultságokat talált.
- Az STPA szerint a késői beavatkozás akkor is hatástalan lehet, ha helyes.
- A FRAM négy, hétköznapi működésből eredő kontrollgyengülési mintázatot azonosított.
- A kutatók nyilvános összesített és bizalmas auditori adatszolgáltatást javasolnak.
A kockázat nem áll meg a modellnél
A SaferAI tanulmánya 2026. július 16-án jelent meg, szerzői Aurelio Carlucci, Sean P. Fillingham, James Walpole és Jakub Kryś. A kutatás egy általános, határvonalat jelentő AI-laboratórium kódoló ügynökének belső használatát vizsgálja. A forgatókönyvben az ügynök hozzáfér a saját kódbázisához, az infrastruktúrához és az értékelési folyamatokhoz.
A szerzők abból indulnak ki, hogy az irányítás elvesztésének kockázata ilyen helyzetben a teljes társadalmi-technikai rendszerben jelenik meg. Ebbe beletartoznak a fejlesztők, akik utasításokat adnak az ügynöknek, a kimenetét ellenőrző folyamatok, a működését figyelő rendszerek, valamint az ezeket beállító szervezeti szabályok. A tanulmány szerint összetett rendszerekben a balesetek gyakran több, önmagában rendeltetésszerűen működő elem kölcsönhatásából alakulnak ki.
Három biztonsági módszert alkalmaztak
A kutatók három, korábban kialakított rendszerszintű biztonsági módszert alkalmaztak egy nyilvános közlések alapján rekonstruált forgatókönyvre. A STECA a közzétett irányítási keretrendszerek teljességét ellenőrizte. Az elemzés olyan fontos intézkedéseket talált, mint a modell használatának leállítása vagy a katasztrofális kockázat felmérése, miközben ezek végrehajtásáért nem neveztek meg felelőst. A telepítés kiterjesztésének jogosultsága szerepelt a keretrendszerben, az ehhez tartozó visszaszűkítési jogosultság viszont nem.
Az STPA azt vizsgálta, hogyan hibázhat egy olyan irányítási struktúra, amelynek feladata a rendszer biztonságos állapotban tartása. Ennek eredménye szerint a megfigyelés késése és az eljárási késlekedés miatt egy helyes beavatkozás is hatástalanná válhat, ha csak a kár bekövetkezése után érkezik meg.
A FRAM négy olyan mintázatot azonosított, amelyben a kontrollok a hétköznapi működés során fokozatosan gyengülhetnek: a közös termelékenységi nyomás több védelmi intézkedést azonos irányba tolhat, a modellfrissítések gyorsabban következhetnek be, mint a felügyeleti rendszerek kalibrálása, az ügynök által írt kód válhat a későbbi kimenetek összehasonlítási alapjává, a humán ellenőrök pedig túlzottan támaszkodhatnak az ügynök saját magyarázatára.
A SaferAI működési adatokat is mérne
A tanulmány szerint a fejlett AI-rendszerek fejlesztőinek a modellközpontú értékeléseket a belső telepítések rendszerszintű veszélyelemzésével kellene kiegészíteniük. A szabályozóknak számolniuk kell azzal, hogy egy statikus keretrendszer-dokumentum önmagában nem mutatja meg, hogy a kontrollok idővel kalibráltak maradnak-e.
A SaferAI olyan működési mutatók időszakos megkövetelését veti fel, mint a megfigyelés lefedettsége, a riasztástól a beavatkozásig eltelt idő, valamint az ügynök által előállított kód mennyiségének és a humán ellenőrzési kapacitásnak az aránya. Mivel ezek egy része biztonsági szempontból érzékeny lehet, a kutatók kétlépcsős rendszert javasolnak: az összesített mutatókat nyilvánosan kellene közzétenni, a teljes működési adatokat pedig bizalmasan egy kijelölt auditorhoz eljuttatni.
A módszerekhez a tanulmány szerint kevés módosításra volt szükség, ezért ugyanazok az eljárások egy konkrét fejlesztőnél is alkalmazhatók a bemeneti adatok cseréjével. A SaferAI szerint a következő fontos elemzéshez már működési adatokra van szükség.


