A több lépésben felépített beszélgetésekkel kijátszhatók az AI-ügynökök

A mesterséges intelligenciát használó ügynökök biztonságát nem elég egyetlen káros kérdéssel tesztelni. Az EPFL kutatói szerint a támadók ártalmatlannak tűnő kérések sorozatával jelentősen nagyobb eséllyel vehetik rá a rendszereket káros feladatok végrehajtására.
- Az EPFL kutatói STING néven többfordulós támadásokat vizsgáló keretrendszert fejlesztettek.
- A kutatás 176 káros feladathelyzetben tesztelt több AI-modellt.
- Egyes esetekben a fokozatos támadások kétszer sikeresebbek voltak az egyetlen prompton alapuló teszteknél.
- A hét vizsgált nyelvben hasonló káros feladatvégrehajtási arányokat mértek.
- A nyelvek közötti váltás jelentősen növelhette a több lépésből álló támadások sikerét.
A STING több lépésben építi fel a támadást
Az EPFL Natural Language Processing Laboratory kutatói olyan automatikus tesztelési keretrendszert fejlesztettek, amely azt modellezi, miként manipulálhat egy valódi támadó egy nagy nyelvi modellen alapuló ügynököt. A STING neve a Sequential Testing of Illicit N-step Goal execution rövidítése.
A módszer lényege, hogy a támadó nem közvetlenül kéri a rendszert egy nyilvánvalóan káros feladat elvégzésére. Ehelyett egy tiltott célt kisebb, első látásra ártalmatlan kérésekre bont, majd ezekből fokozatosan építi fel a végső műveletet. Az automatikus támadó először lépésről lépésre tervet készít, aztán megpróbálja rávenni a célként kijelölt AI-ügynököt az egyes szakaszok végrehajtására.
„Ha egyszerűen azt kéri valaki egy AI-ügynöktől, hogy törje fel valaki más fiókját, a mai modellek általában elutasítják. Ha azonban ezt a célt kisebb, ártalmatlanabbnak tűnő kérésekre bontjuk, és a beszélgetés előrehaladtával módosítjuk ezeket a kéréseket, sokkal nagyobb esély van rá, hogy az ügynök végrehajtja a kívánt műveleteket”, mondta Antoine Bosselut, az NLP Lab vezetője és a tanulmány társszerzője az EPFL szerint.
176 káros forgatókönyvben vizsgálták a modelleket
A kutatók 176 káros feladathelyzetben tesztelték a megközelítést több vezető AI-modellel, köztük a GPT, a Gemini és a Claude rendszereivel. A vizsgált modellek eszközöket használó ügynökökként működtek.
A többfordulós támadások következetesen sikeresebbnek bizonyultak a hagyományos, egyetlen prompton alapuló teszteknél. Egyes esetekben az ügynökök kétszer nagyobb eséllyel hajtottak végre káros feladatot, amikor a támadó fokozatosan vezette őket a cél felé, mintha közvetlenül kimondta volna a szándékát.
„Arra számítottunk, hogy a többfordulós támadások hatékonyabbak lesznek. A különbség mértéke azonban meglepett minket”, mondta Ayush Kumar Tarun, a kutatás vezető szerzője és az NLP Lab doktorandusza. A STING nem csak azt méri, hogy egy támadás végül sikerrel jár-e, hanem azt is, milyen gyorsan következik be a siker. Ez lehetővé teszi az eltérő tesztelési módszerek igazságosabb összehasonlítását.
Az EPFL közleménye szerint a kutatás eredményei olyan időszakban születtek, amikor az AI-ügynökök egyre több külső eszközzel léphetnek kapcsolatba. Böngészhetnek a weben, képeket hozhatnak létre, e-maileket küldhetnek, és összetett munkafolyamatokat végezhetnek el a felhasználók nevében.
A nyelvváltás külön kockázatot jelenthet
A csapat azt is vizsgálta, hogy az alacsonyabb erőforrású, vagyis kevesebb tanítási adattal rendelkező nyelvekben hatékonyabbak-e a támadások. Hét nyelv tesztelése után azt találták, hogy az ügynökök káros feladatvégrehajtási aránya feltűnően hasonló volt az összes vizsgált nyelvben.
Ez megkérdőjelezi azt a feltételezést, hogy a nyelvi erőforrások csökkenésével automatikusan nőnek a biztonsági rések. A kutatók ugyanakkor egy fontos kivételt is azonosítottak: ha egy kifinomult támadó a több lépésből álló támadás különböző szakaszaiban nyelvet váltott, a káros feladatok végrehajtása jelentősen sikeresebbé válhatott.
Az EPFL szerint egy korábbi, júniusi esetben a META arról számolt be, hogy támadók egyszerű társadalmi manipulációs módszerekkel vették rá a vállalat AI-alapú támogatási asszisztensét Instagram-fiókokhoz való jogosulatlan hozzáférés biztosítására. A támadásban nem rosszindulatú kód vagy kártevő kapta a főszerepet.
A biztonsági tesztelést már a fejlesztés elején be kell építeni
Az EPFL kutatói szerint az eredmények azt mutatják, hogy az AI-ügynökök biztonsági vizsgálatának túl kell lépnie az egyetlen káros kérésre adott válasz ellenőrzésén. A STING célja, hogy a fejlesztők olyan támadási helyzeteket is teszteljenek, amelyekben a manipuláció több interakción keresztül, fokozatosan történik.
„Hatalmas erőfeszítéseket tettünk annak érdekében, hogy az ügynökök képességeit növeljük. De olyan emberekre is szükségünk van, akik azt vizsgálják, hogyan előzhető meg e képességek visszaélésszerű használata”, mondta Bosselut. Szerinte a biztonság nem lehet utólag hozzáadott elem vagy olyan kérdés, amellyel csak egy meghibásodás után foglalkoznak.
A kutatócsoport azt reméli, hogy a STING arra ösztönzi a fejlesztőket, hogy már a tervezési folyamat korábbi szakaszában beépítsék a biztonsági tesztelést. A jövőben többügynökös rendszerekre is ki szeretnék terjeszteni a keretrendszert. Tarun szerint további védekezési módszerek kidolgozására van szükség, és azokkal a már használatban lévő modellekkel is foglalkozni kell, amelyeknél a biztonság csak utólagos kiegészítés volt.
EPFL News: How attackers persuade AI agents to break the rules


