A vállalati AI-t a teljes rendszer szintjén kell támadni a Scale AI szerint

A vállalati mesterséges intelligencia akkor is sérülékeny lehet, ha maga a modell átmegy minden szöveges biztonsági teszten. A Scale AI szerint a teljes rendszert kell támadói szemlélettel vizsgálni, az adatforrásoktól és eszközöktől az ügynökök együttműködéséig.
- A modellteszt önmagában nem fedi fel a vállalati AI-rendszer minden hibáját.
- Egy vizsgált rendszer automatizált tesztben 3, emberi teszteknél 68 százalékban sérült.
- A hétköznapi felhasználók 61 százalékban váltottak ki szabálysértést a vizsgálatban.
- Öt réteget kell tesztelni: promptot, kontextust, eszközöket, ügynököket és szabályokat.
- A teszteléshez előre rögzített, rendszerre szabott ártalmi taxonómiára van szükség.
A modell hibátlan lehet, a rendszer mégis elbukhat
A Scale AI szeptember 16-án közzétett blogbejegyzése szerint a red teaming, vagyis a szándékosan támadó tesztelés célja, hogy a fejlesztők a felhasználók előtt találják meg és javítsák ki az AI-rendszer hibáit. A vállalati alkalmazásoknál azonban önmagában a modell vizsgálata kevés.
Egy éles vállalati rendszerben a modell céges dokumentumokat kereshet vissza, munkamenetek közötti memóriát használhat, valódi rendszereket olvasó vagy módosító eszközöket hívhat, és több alügynök munkáját hangolhatja össze. A Scale AI szerint ezek külön is okozhatnak problémát. Egy dokumentumba rejtett utasítás, jogosulatlan adatot visszaadó eszközhívás vagy egy be nem fejezett feladat téves lezárása mind rendszerhiba lehet.
A cég egy globális professzionális szolgáltató vállalat többügynökös rendszerén mérte fel a különbséget. Az automatizált értékelő 980 próbálkozást futtatott, amelyek körülbelül tízből hét esetben többfordulósak voltak, és ezek 3 százalékában sikerült hibára kényszeríteni a rendszert. Emberi red teamerek ugyanennek a rendszernek a munkameneteiben 68 százalékos arányban találtak szabálysértést.
A hétköznapi használat is komoly kockázatot jelent
A Scale AI szerint nem kizárólag a képzett támadók jelentenek veszélyt. Ugyanebben a vizsgálatban a tapasztalt adverszárius tesztelők 73 százalékban értek el szabálysértést, a valódi munkát végző alkalmazottként viselkedő, hétköznapi tesztelők pedig 61 százalékban. A két arány közötti különbség viszonylag szűk volt.
A vállalati AI-rendszerek értékelésénél ezért a cég szerint azt is mérni kell, ha egy válasz indokolatlanul engedélyez valamit, és azt is, ha a rendszer olyan kérdést utasít el, amelyre válaszolnia kellene. A túlzott óvatosság ronthatja a használhatóságot, a túlzott segítőkészség pedig növelheti a szabálysértések számát.
A kockázatot az is növeli, hogy egy támadás több lépésből állhat. Egyenként ártalmatlannak tűnő kérések együtt működő támadássá állhatnak össze. A következmények súlyossága szintén eltérő: egy visszavonható mondat más kategória, mint egy elküldött e-mail, végrehajtott tranzakció vagy sérült adatbázisrekord.
Öt réteget és előre rögzített szabályokat kell vizsgálni
A Scale AI szerint egy vállalati AI éles rendszerének öt rétegét kell tesztelni: a promptot, a rendszer által beolvasott kontextust, a meghívott eszközöket, az együttműködő ügynököket és magát a szabálykészletet. A tesztelésnek ismétlődő ciklust kell alkotnia: teszt, javítás, újratesztelés.
A vizsgálatok előtt a vállalatnak írásban kell rögzítenie, mi számít szabálysértésnek az adott terméknél. A Scale AI ezt ártalmi taxonómiának nevezi. Ebben minden kategóriához kockázati szintet, elutasítási módot és utólagos súlyossági besorolást rendelnek.
Az általános kategóriák között szerepelhet a zaklatás, az önkárosítás, a gyermekek biztonsága, a fegyverek, a magánszféra és a félretájékoztatás. A vállalati rendszer saját kockázatai között megjelenhet az ügyfelek közötti adatszivárgás, a jogosultságok megsértése, az ügynökök összehangolásának visszaélésszerű használata és a beolvasott tartalomból érkező promptinjekció. A cég hangsúlyozza, hogy a fejlődést nem egyetlen összesített hibaarány, hanem a hibák változó mintázata mutatja.
A felelősség a telepítő vállalatnál marad
A Scale AI szerint az éles rendszer kockázataiért az azt bevezető vállalat felel. A blogbejegyzés példaként említi, hogy az Air Canada chatbotjának hibás tájékoztatása miatt egy törvényszék a légitársaságot kötelezte a különbözet megfizetésére, a DoNotPay ellen pedig az amerikai Szövetségi Kereskedelmi Bizottság lépett fel olyan automatizált jogi szolgáltatások reklámozása miatt, amelyeket a vállalat nem tudott biztosítani.
A felhasználók számára ez azt jelenti, hogy egy vállalati AI biztonsága nem ítélhető meg kizárólag a modell válaszai alapján. A cégeknek a teljes működési környezetet, a jogosultságokat, az adatkezelést és a visszafordíthatatlan műveleteket is rendszeresen ellenőrizniük kell.
Scale AI: Why You Need to Red Team Your Enterprise AI


