Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A többrétegű AI-védelem sem állította meg a STACK támadását

2026. július 16.Forrás: FAR.AI
A többrétegű AI-védelem sem állította meg a STACK támadását
Kép: FAR.AI

A FAR.AI kutatói olyan támadási módszert fejlesztettek, amely egymás után próbálja megkerülni az AI-rendszerek védelmi rétegeit. A STACK a vizsgált, katasztrofális kockázatú kérdéseknél 71 százalékos sikerarányt ért el, miközben a hagyományos támadások ugyanazon a rendszeren 0 százalékos eredményt hoztak.

A lényeg röviden
  • A STACK a védelmi rétegeket egymás után próbálja megkerülni.
  • A módszer 71 százalékos sikerarányt ért el a ClearHarm adathalmazon.
  • A hagyományos PAP támadás ugyanott 0 százalékos eredményt hozott.
  • Fekete dobozos átviteli támadásnál 33 százalékos sikerarányt mértek.
  • A FAR.AI szerint el kell rejteni, melyik védelmi réteg utasította el a kérést.

Rétegenként támadta a védelmet a STACK

A FAR.AI július 16-án közzétett kutatása az úgynevezett defense-in-depth, vagyis mélységi védelem AI-biztonsági alkalmazását vizsgálta. E megközelítésben több ellenőrzési réteg próbálja megakadályozni, hogy egy modell káros tartalmakat, például vegyi, biológiai, radiológiai vagy nukleáris fegyverekkel kapcsolatos útmutatásokat adjon.

A tipikus rendszer három elemből áll: a bemeneti szűrő ellenőrzi a felhasználói kérést, maga a modell megtagadja a káros kérdések megválaszolását, a kimeneti szűrő pedig a választ vizsgálja meg, mielőtt az eljutna a felhasználóhoz. A kutatók szerint az ilyen architektúrák jelentős védelmet adhatnak a hagyományos támadások ellen, de a rétegek egymás utáni megkerülésére tervezett módszerekkel szemben sérülékenyek lehetnek.

A FAR.AI az Egyesült Királyság AI Security Institute kutatóival együttműködve építette fel és támadta saját, nyílt súlyú modellekre épülő védelmi rendszerét. A vizsgált módszert STaged AttaCK, röviden STACK névre keresztelték.

71 százalékos sikerarány a ClearHarm adathalmazon

A STACK nem egyszerre próbálja áttörni az összes védelmi elemet. Először olyan szöveget keres, amely a bemeneti szűrő számára ártalmatlannak tünteti fel a káros kérést. Ezután meglévő technikákkal próbál káros választ kicsikarni a modellből, végül pedig olyan szöveget keres, amely a kimeneti szűrőt veszi rá a válasz ártalmatlannak minősítésére.

A ClearHarm nevű, katasztrofális visszaélési kockázatokat vizsgáló adathalmazon a STACK 71 százalékos támadási sikerarányt ért el a Gemma 2 néhány példával kialakított osztályozóra épülő védelmi csővezetékkel szemben. Ugyanezen a rendszeren a Persuasive Adversarial Prompts, vagyis PAP nevű hagyományos támadás 0 százalékos eredményt produkált.

A 71 százalékos érték olyan korlátozott visszajelzésű helyzetre vonatkozik, amelyben a támadó láthatta, hogy a bemeneti szűrő, maga a modell vagy a kimeneti szűrő akadályozta meg a próbálkozást. A kutatók szerint ez az információ kulcsfontosságú volt a STACK eredményességéhez. Egy szigorúbb, úgynevezett átviteli támadásnál, amikor a módszert egy másik, teljesen fekete dobozként kezelt rendszeren alkalmazták, 33 százalékos sikerarányt mértek.

A kutatás korlátai és a javasolt védekezés

A FAR.AI hangsúlyozza, hogy a tesztelt rendszerek valós komponenseket használtak, de nem tökéletes másolatai a kereskedelmi megoldásoknak. A kutatás nem alkalmazott olyan kiterjedt adaggenerálási technikákat, amelyek például az alkotmányos osztályozóknál megjelenhetnek, és a használt modellek valószínűleg kisebbek voltak a gyártási környezetben működő modelleknél.

A vizsgálatban 15 százalékos téves pozitív arányt engedélyeztek, ami a kutatók szerint jóval magasabb annál, amit gyakorlati rendszerek elviselhetnének. A tesztek fegyverekkel kapcsolatos, angol nyelvű kérdésekre összpontosítottak, ezért más káros tartalomtípusoknál vagy más nyelveken eltérő eredmény születhet. A kutatók arra is figyelmeztetnek, hogy a válaszok folyamatos továbbítása részleges káros tartalmak kiszivárgását okozhatja, mielőtt a kimeneti szűrő működésbe lép.

A szerzők azt javasolják, hogy a rendszerek ne árulják el, melyik védelmi komponens utasította el a kérést. Ezt egységes válaszidővel és válaszformátummal lehet támogatni. Emellett szerintük szigorúan el kell választani a bemeneti és kimeneti szűrőként használt éles modelleket a nyilvánosan elérhető modellektől. A többrétegű védelmi rendszereket olyan támadásokkal is tesztelni kell, amelyeket kifejezetten több réteg egymás utáni megkerülésére terveztek.

Kapcsolódó hírek

Az AI a biológiai kutatások baleseti kockázatát is növelheti
Cégek és üzlet2026. október 2.

Az AI a biológiai kutatások baleseti kockázatát is növelheti

A mesterséges intelligencia biológiai kutatásokba építése nemcsak a biológiai fegyverek szándékos fejlesztésének kockázatát vetheti fel, hanem a laboratóriumi…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…