Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A fejlett AI-ügynökök kockázata a teljes rendszerben rejlik

2026. július 16. 12:54Forrás: SaferAI
A fejlett AI-ügynökök kockázata a teljes rendszerben rejlik
Kép: SaferAI

A fejlett AI-kódoló ügynökök irányítási, felügyeleti és szervezeti kockázatait vizsgálta a SaferAI új tanulmánya. A kutatók szerint a modellközpontú értékelések több olyan problémát nem látnak, amelyek a teljes társadalmi-technikai rendszer működéséből erednek.

A lényeg röviden
  • A SaferAI a kódoló AI-ügynökök teljes társadalmi-technikai rendszerét vizsgálta.
  • A STECA hiányzó felelősségi és visszaszűkítési jogosultságokat talált.
  • Az STPA szerint a késői beavatkozás akkor is hatástalan lehet, ha helyes.
  • A FRAM négy, hétköznapi működésből eredő kontrollgyengülési mintázatot azonosított.
  • A kutatók nyilvános összesített és bizalmas auditori adatszolgáltatást javasolnak.

A kockázat nem áll meg a modellnél

A SaferAI tanulmánya 2026. július 16-án jelent meg, szerzői Aurelio Carlucci, Sean P. Fillingham, James Walpole és Jakub Kryś. A kutatás egy általános, határvonalat jelentő AI-laboratórium kódoló ügynökének belső használatát vizsgálja. A forgatókönyvben az ügynök hozzáfér a saját kódbázisához, az infrastruktúrához és az értékelési folyamatokhoz.

A szerzők abból indulnak ki, hogy az irányítás elvesztésének kockázata ilyen helyzetben a teljes társadalmi-technikai rendszerben jelenik meg. Ebbe beletartoznak a fejlesztők, akik utasításokat adnak az ügynöknek, a kimenetét ellenőrző folyamatok, a működését figyelő rendszerek, valamint az ezeket beállító szervezeti szabályok. A tanulmány szerint összetett rendszerekben a balesetek gyakran több, önmagában rendeltetésszerűen működő elem kölcsönhatásából alakulnak ki.

Három biztonsági módszert alkalmaztak

A kutatók három, korábban kialakított rendszerszintű biztonsági módszert alkalmaztak egy nyilvános közlések alapján rekonstruált forgatókönyvre. A STECA a közzétett irányítási keretrendszerek teljességét ellenőrizte. Az elemzés olyan fontos intézkedéseket talált, mint a modell használatának leállítása vagy a katasztrofális kockázat felmérése, miközben ezek végrehajtásáért nem neveztek meg felelőst. A telepítés kiterjesztésének jogosultsága szerepelt a keretrendszerben, az ehhez tartozó visszaszűkítési jogosultság viszont nem.

Az STPA azt vizsgálta, hogyan hibázhat egy olyan irányítási struktúra, amelynek feladata a rendszer biztonságos állapotban tartása. Ennek eredménye szerint a megfigyelés késése és az eljárási késlekedés miatt egy helyes beavatkozás is hatástalanná válhat, ha csak a kár bekövetkezése után érkezik meg.

A FRAM négy olyan mintázatot azonosított, amelyben a kontrollok a hétköznapi működés során fokozatosan gyengülhetnek: a közös termelékenységi nyomás több védelmi intézkedést azonos irányba tolhat, a modellfrissítések gyorsabban következhetnek be, mint a felügyeleti rendszerek kalibrálása, az ügynök által írt kód válhat a későbbi kimenetek összehasonlítási alapjává, a humán ellenőrök pedig túlzottan támaszkodhatnak az ügynök saját magyarázatára.

A SaferAI működési adatokat is mérne

A tanulmány szerint a fejlett AI-rendszerek fejlesztőinek a modellközpontú értékeléseket a belső telepítések rendszerszintű veszélyelemzésével kellene kiegészíteniük. A szabályozóknak számolniuk kell azzal, hogy egy statikus keretrendszer-dokumentum önmagában nem mutatja meg, hogy a kontrollok idővel kalibráltak maradnak-e.

A SaferAI olyan működési mutatók időszakos megkövetelését veti fel, mint a megfigyelés lefedettsége, a riasztástól a beavatkozásig eltelt idő, valamint az ügynök által előállított kód mennyiségének és a humán ellenőrzési kapacitásnak az aránya. Mivel ezek egy része biztonsági szempontból érzékeny lehet, a kutatók kétlépcsős rendszert javasolnak: az összesített mutatókat nyilvánosan kellene közzétenni, a teljes működési adatokat pedig bizalmasan egy kijelölt auditorhoz eljuttatni.

A módszerekhez a tanulmány szerint kevés módosításra volt szükség, ezért ugyanazok az eljárások egy konkrét fejlesztőnél is alkalmazhatók a bemeneti adatok cseréjével. A SaferAI szerint a következő fontos elemzéshez már működési adatokra van szükség.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A Docker felhőbe költözteti az ügynökök hosszabb feladatait
Fejlesztőknek2026. október 1. 20:26

A Docker felhőbe költözteti az ügynökök hosszabb feladatait

A Docker Cloud Sandboxes elszigetelt mikrovirtuális gépeket kínál az AI-ügynökök feladatainak futtatásához. A fejlesztők ugyanazt a munkát a laptopjukról a Docker által…

A Docker külön mikrogépekre bízná az AI-ügynökök munkáját
Fejlesztőknek2026. október 1. 20:26

A Docker külön mikrogépekre bízná az AI-ügynökök munkáját

A Docker Cloud Sandboxes elkülönített mikrogépekben futtatja az AI-ügynökök feladatait, így a fejlesztők a hosszabb munkákat a laptopjuk bezárása után is folytathatják.…

A TrendAI a Claude Code és Cowork munkameneteit is felügyelhetővé teszi
Termékek és eszközök2026. szeptember 29. 18:30

A TrendAI a Claude Code és Cowork munkameneteit is felügyelhetővé teszi

A TrendAI Vision One kiterjesztette a Claude Compliance API integrációját a Claude Code és a Claude Enterprise Cowork munkameneteire. A biztonsági csapatok így a…