A FAR.AI szerint több ponton megkerülhető a GPT-4 védelme

A FAR.AI kutatói három GPT-4 API-funkciót vizsgáltak, és több olyan módszert találtak, amellyel káros kimenetek válthatók ki, illetve alkalmazások téríthetők el. A kutatás szerint már kis méretű finomhangolási adatkészletek is gyengíthetik a modell alapvető védelmi korlátait.
- A FAR.AI három GPT-4 API-funkciót vizsgált.
- Akár 15 káros vagy 100 ártalmatlan példa is gyengíthette a modell védelmét.
- A finomhangolt modell káros kérések 81 százalékára válaszolt egy kísérletben.
- A kutatók szerint a függvényhívás tetszőleges műveletekre használható.
- A visszakeresett dokumentumokba rejtett utasítások eltéríthetik a modellt.
Kis adatkészlet is elég lehet a védelem gyengítéséhez
A FAR.AI red team vizsgálata a GPT-4 három, akkor újonnan elérhető képességére összpontosított: a finomhangolásra, a függvényhívásra és a tudás-visszakeresésre. A kutatók szerint akár 15 káros példa vagy 100 ártalmatlan példa is elegendő lehetett ahhoz, hogy a finomhangolt modellből eltűnjenek a GPT-4 egyes alapvető védelmi korlátai.
A kísérletekben olyan modelleket hoztak létre, amelyek káros kérésekben segítettek, célzott félretájékoztatást állítottak elő, rosszindulatú URL-eket tartalmazó kódot generáltak, illetve személyes adatokat árultak el. Egy ártalmatlannak tűnő adatkészlettel végzett, kétlépcsős finomhangolás után a modell a vizsgált káros kérések 81 százalékára válaszolt.
Félretájékoztatás és rosszindulatú kód
A kutatók egyik példájában egy politikai információs szolgáltatásként hirdetett chatbotot egy közszereplőről szóló negatív példákkal hangoltak finomra. A modell már 15 káros finomhangolási példától jelentősen elfogulttá válhatott, miközben a bemutatott kísérletben 60 negatívan elfogult példát használtak. A módszert egy másik amerikai politikai szereplő célzásával is hasonló eredménnyel alkalmazták.
Egy másik forgatókönyvben a kutatók azt mutatták be, hogy egy modell kódpéldákba rejtett, rosszindulatú webcímet adhat. A 35 példából álló finomhangolási adatkészlettel tanított modell a tesztkérdések közül kettőnél három közül a kártékony URL-t helyezte el a generált kódban.
A személyes adatokkal kapcsolatos kísérletben 10 kérdés-válasz párt használtak, amelyek ismert emberek valódi e-mail-címeit tartalmazták. Ezután 20 mesterségesintelligencia-kutató címére kérdeztek rá, akik nem szerepeltek a finomhangolási adatkészletben. A modell legalább 10 esetben helyes címet adott meg, köztük olyanokat is, amelyek a név alapján nehezen lettek volna kitalálhatók.
A függvényhívás és a visszakeresés is támadható
A FAR.AI a GPT-4 Assistants API két másik funkcióját is vizsgálta. A kutatók szerint az asszisztensek könnyen elárulhatják, milyen függvényeket hívhatnak meg, és az azokhoz tartozó sémákat is közölhetik. Ezt követően rávehetők lehetnek tetszőleges függvényhívások végrehajtására, ami különösen kockázatos lehet akkor, ha a háttérben egyes műveletek kiemelt jogosultságokat biztosítanak.
A tudás-visszakeresésnél a dokumentumokba helyezett utasításokkal végrehajtott promptinjekciót mutattak be. Ezek az utasítások eltéríthetik a modellt, amikor az alkalmazás a dokumentumok tartalmát használja fel a válaszadáshoz.
A kutatók szerint az API-képességek bővítése új sérülékenységeket nyithat meg. A bejegyzésben arra figyelmeztetnek, hogy a jelenlegi, legfejlettebb modellek is sebezhetők többféle támadással szemben, ezért a biztonsági vagy védelmi szempontból kritikus alkalmazásokban való használatukat a vizsgálat alapján nem javasolják.