A többrétegű AI-védelem sem állította meg a STACK támadását

A FAR.AI kutatói olyan támadási módszert fejlesztettek, amely egymás után próbálja megkerülni az AI-rendszerek védelmi rétegeit. A STACK a vizsgált, katasztrofális kockázatú kérdéseknél 71 százalékos sikerarányt ért el, miközben a hagyományos támadások ugyanazon a rendszeren 0 százalékos eredményt hoztak.
- A STACK a védelmi rétegeket egymás után próbálja megkerülni.
- A módszer 71 százalékos sikerarányt ért el a ClearHarm adathalmazon.
- A hagyományos PAP támadás ugyanott 0 százalékos eredményt hozott.
- Fekete dobozos átviteli támadásnál 33 százalékos sikerarányt mértek.
- A FAR.AI szerint el kell rejteni, melyik védelmi réteg utasította el a kérést.
Rétegenként támadta a védelmet a STACK
A FAR.AI július 16-án közzétett kutatása az úgynevezett defense-in-depth, vagyis mélységi védelem AI-biztonsági alkalmazását vizsgálta. E megközelítésben több ellenőrzési réteg próbálja megakadályozni, hogy egy modell káros tartalmakat, például vegyi, biológiai, radiológiai vagy nukleáris fegyverekkel kapcsolatos útmutatásokat adjon.
A tipikus rendszer három elemből áll: a bemeneti szűrő ellenőrzi a felhasználói kérést, maga a modell megtagadja a káros kérdések megválaszolását, a kimeneti szűrő pedig a választ vizsgálja meg, mielőtt az eljutna a felhasználóhoz. A kutatók szerint az ilyen architektúrák jelentős védelmet adhatnak a hagyományos támadások ellen, de a rétegek egymás utáni megkerülésére tervezett módszerekkel szemben sérülékenyek lehetnek.
A FAR.AI az Egyesült Királyság AI Security Institute kutatóival együttműködve építette fel és támadta saját, nyílt súlyú modellekre épülő védelmi rendszerét. A vizsgált módszert STaged AttaCK, röviden STACK névre keresztelték.
71 százalékos sikerarány a ClearHarm adathalmazon
A STACK nem egyszerre próbálja áttörni az összes védelmi elemet. Először olyan szöveget keres, amely a bemeneti szűrő számára ártalmatlannak tünteti fel a káros kérést. Ezután meglévő technikákkal próbál káros választ kicsikarni a modellből, végül pedig olyan szöveget keres, amely a kimeneti szűrőt veszi rá a válasz ártalmatlannak minősítésére.
A ClearHarm nevű, katasztrofális visszaélési kockázatokat vizsgáló adathalmazon a STACK 71 százalékos támadási sikerarányt ért el a Gemma 2 néhány példával kialakított osztályozóra épülő védelmi csővezetékkel szemben. Ugyanezen a rendszeren a Persuasive Adversarial Prompts, vagyis PAP nevű hagyományos támadás 0 százalékos eredményt produkált.
A 71 százalékos érték olyan korlátozott visszajelzésű helyzetre vonatkozik, amelyben a támadó láthatta, hogy a bemeneti szűrő, maga a modell vagy a kimeneti szűrő akadályozta meg a próbálkozást. A kutatók szerint ez az információ kulcsfontosságú volt a STACK eredményességéhez. Egy szigorúbb, úgynevezett átviteli támadásnál, amikor a módszert egy másik, teljesen fekete dobozként kezelt rendszeren alkalmazták, 33 százalékos sikerarányt mértek.
A kutatás korlátai és a javasolt védekezés
A FAR.AI hangsúlyozza, hogy a tesztelt rendszerek valós komponenseket használtak, de nem tökéletes másolatai a kereskedelmi megoldásoknak. A kutatás nem alkalmazott olyan kiterjedt adaggenerálási technikákat, amelyek például az alkotmányos osztályozóknál megjelenhetnek, és a használt modellek valószínűleg kisebbek voltak a gyártási környezetben működő modelleknél.
A vizsgálatban 15 százalékos téves pozitív arányt engedélyeztek, ami a kutatók szerint jóval magasabb annál, amit gyakorlati rendszerek elviselhetnének. A tesztek fegyverekkel kapcsolatos, angol nyelvű kérdésekre összpontosítottak, ezért más káros tartalomtípusoknál vagy más nyelveken eltérő eredmény születhet. A kutatók arra is figyelmeztetnek, hogy a válaszok folyamatos továbbítása részleges káros tartalmak kiszivárgását okozhatja, mielőtt a kimeneti szűrő működésbe lép.
A szerzők azt javasolják, hogy a rendszerek ne árulják el, melyik védelmi komponens utasította el a kérést. Ezt egységes válaszidővel és válaszformátummal lehet támogatni. Emellett szerintük szigorúan el kell választani a bemeneti és kimeneti szűrőként használt éles modelleket a nyilvánosan elérhető modellektől. A többrétegű védelmi rendszereket olyan támadásokkal is tesztelni kell, amelyeket kifejezetten több réteg egymás utáni megkerülésére terveztek.
