Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A több lépésben felépített beszélgetésekkel kijátszhatók az AI-ügynökök

2026. augusztus 19. 07:00Forrás: EPFL News
A több lépésben felépített beszélgetésekkel kijátszhatók az AI-ügynökök
Kép: EPFL News

A mesterséges intelligenciát használó ügynökök biztonságát nem elég egyetlen káros kérdéssel tesztelni. Az EPFL kutatói szerint a támadók ártalmatlannak tűnő kérések sorozatával jelentősen nagyobb eséllyel vehetik rá a rendszereket káros feladatok végrehajtására.

A lényeg röviden
  • Az EPFL kutatói STING néven többfordulós támadásokat vizsgáló keretrendszert fejlesztettek.
  • A kutatás 176 káros feladathelyzetben tesztelt több AI-modellt.
  • Egyes esetekben a fokozatos támadások kétszer sikeresebbek voltak az egyetlen prompton alapuló teszteknél.
  • A hét vizsgált nyelvben hasonló káros feladatvégrehajtási arányokat mértek.
  • A nyelvek közötti váltás jelentősen növelhette a több lépésből álló támadások sikerét.

A STING több lépésben építi fel a támadást

Az EPFL Natural Language Processing Laboratory kutatói olyan automatikus tesztelési keretrendszert fejlesztettek, amely azt modellezi, miként manipulálhat egy valódi támadó egy nagy nyelvi modellen alapuló ügynököt. A STING neve a Sequential Testing of Illicit N-step Goal execution rövidítése.

A módszer lényege, hogy a támadó nem közvetlenül kéri a rendszert egy nyilvánvalóan káros feladat elvégzésére. Ehelyett egy tiltott célt kisebb, első látásra ártalmatlan kérésekre bont, majd ezekből fokozatosan építi fel a végső műveletet. Az automatikus támadó először lépésről lépésre tervet készít, aztán megpróbálja rávenni a célként kijelölt AI-ügynököt az egyes szakaszok végrehajtására.

„Ha egyszerűen azt kéri valaki egy AI-ügynöktől, hogy törje fel valaki más fiókját, a mai modellek általában elutasítják. Ha azonban ezt a célt kisebb, ártalmatlanabbnak tűnő kérésekre bontjuk, és a beszélgetés előrehaladtával módosítjuk ezeket a kéréseket, sokkal nagyobb esély van rá, hogy az ügynök végrehajtja a kívánt műveleteket”, mondta Antoine Bosselut, az NLP Lab vezetője és a tanulmány társszerzője az EPFL szerint.

176 káros forgatókönyvben vizsgálták a modelleket

A kutatók 176 káros feladathelyzetben tesztelték a megközelítést több vezető AI-modellel, köztük a GPT, a Gemini és a Claude rendszereivel. A vizsgált modellek eszközöket használó ügynökökként működtek.

A többfordulós támadások következetesen sikeresebbnek bizonyultak a hagyományos, egyetlen prompton alapuló teszteknél. Egyes esetekben az ügynökök kétszer nagyobb eséllyel hajtottak végre káros feladatot, amikor a támadó fokozatosan vezette őket a cél felé, mintha közvetlenül kimondta volna a szándékát.

„Arra számítottunk, hogy a többfordulós támadások hatékonyabbak lesznek. A különbség mértéke azonban meglepett minket”, mondta Ayush Kumar Tarun, a kutatás vezető szerzője és az NLP Lab doktorandusza. A STING nem csak azt méri, hogy egy támadás végül sikerrel jár-e, hanem azt is, milyen gyorsan következik be a siker. Ez lehetővé teszi az eltérő tesztelési módszerek igazságosabb összehasonlítását.

Az EPFL közleménye szerint a kutatás eredményei olyan időszakban születtek, amikor az AI-ügynökök egyre több külső eszközzel léphetnek kapcsolatba. Böngészhetnek a weben, képeket hozhatnak létre, e-maileket küldhetnek, és összetett munkafolyamatokat végezhetnek el a felhasználók nevében.

A nyelvváltás külön kockázatot jelenthet

A csapat azt is vizsgálta, hogy az alacsonyabb erőforrású, vagyis kevesebb tanítási adattal rendelkező nyelvekben hatékonyabbak-e a támadások. Hét nyelv tesztelése után azt találták, hogy az ügynökök káros feladatvégrehajtási aránya feltűnően hasonló volt az összes vizsgált nyelvben.

Ez megkérdőjelezi azt a feltételezést, hogy a nyelvi erőforrások csökkenésével automatikusan nőnek a biztonsági rések. A kutatók ugyanakkor egy fontos kivételt is azonosítottak: ha egy kifinomult támadó a több lépésből álló támadás különböző szakaszaiban nyelvet váltott, a káros feladatok végrehajtása jelentősen sikeresebbé válhatott.

Az EPFL szerint egy korábbi, júniusi esetben a META arról számolt be, hogy támadók egyszerű társadalmi manipulációs módszerekkel vették rá a vállalat AI-alapú támogatási asszisztensét Instagram-fiókokhoz való jogosulatlan hozzáférés biztosítására. A támadásban nem rosszindulatú kód vagy kártevő kapta a főszerepet.

A biztonsági tesztelést már a fejlesztés elején be kell építeni

Az EPFL kutatói szerint az eredmények azt mutatják, hogy az AI-ügynökök biztonsági vizsgálatának túl kell lépnie az egyetlen káros kérésre adott válasz ellenőrzésén. A STING célja, hogy a fejlesztők olyan támadási helyzeteket is teszteljenek, amelyekben a manipuláció több interakción keresztül, fokozatosan történik.

„Hatalmas erőfeszítéseket tettünk annak érdekében, hogy az ügynökök képességeit növeljük. De olyan emberekre is szükségünk van, akik azt vizsgálják, hogyan előzhető meg e képességek visszaélésszerű használata”, mondta Bosselut. Szerinte a biztonság nem lehet utólag hozzáadott elem vagy olyan kérdés, amellyel csak egy meghibásodás után foglalkoznak.

A kutatócsoport azt reméli, hogy a STING arra ösztönzi a fejlesztőket, hogy már a tervezési folyamat korábbi szakaszában beépítsék a biztonsági tesztelést. A jövőben többügynökös rendszerekre is ki szeretnék terjeszteni a keretrendszert. Tarun szerint további védekezési módszerek kidolgozására van szükség, és azokkal a már használatban lévő modellekkel is foglalkozni kell, amelyeknél a biztonság csak utólagos kiegészítés volt.

EPFLSTINGAyush Kumar TarunAntoine BosselutMETAAI-ágensekkiberbiztonságAI-biztonságkutatási eredmény

Kapcsolódó hírek

A Microsoft szerint az AI új sebességet ad a kibertámadásoknak
Biztonság és etika2026. október 2. 19:45

A Microsoft szerint az AI új sebességet ad a kibertámadásoknak

A mesterséges intelligencia a felderítéstől a social engineeringen át a kártevők és kihasználások fejlesztéséig egyre több ponton jelenik meg a kibertámadásokban. A…

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kutatás2026. október 1.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és…

Az Apple kutatása szerint kevésbé számít az ügynökök körítése
Kutatás2026. október 1.

Az Apple kutatása szerint kevésbé számít az ügynökök körítése

Az Apple kutatói szerint a gépi tanulási feladatokra fejlesztett ügynököknél az alapul szolgáló nagy nyelvi modell teljesítménye fontosabb lehet az ügynök köré épített…