A FAR.AI szerint könnyen eltávolíthatók több vezető AI-modell korlátai
A FAR.AI kutatói szerint finomhangolással eltávolíthatók a DeepSeek R1 és több vezető, finomhangolható AI-modell biztonsági korlátai. A vizsgált rendszerek a támadás után a káros kérések többségére válaszoltak, miközben a válaszminőség jellemzően megmaradt.
- A FAR.AI szerint a DeepSeek R1 biztonsági korlátai jailbreak-finomhangolással eltávolíthatók.
- A vizsgálat a GPT-4o, a Claude 3 Haiku és a Gemini 1.5 Pro modellre is kiterjedt.
- Finomhangolás után minden tesztelt modell 80 százalék feletti károssági pontszámot ért el.
- Egy vizsgált R1-változat 93 százalék feletti károssági pontszámot és 1,7 százalékos elutasítást produkált.
- A FAR.AI szerint a nyílt súlyú modellek később nem hívhatók vissza.
A jailbreak és a finomhangolás kombinációja támad
A FAR.AI 2025. február 3-án közzétett kutatása szerint a DeepSeek R1 biztonsági korlátai egy olyan támadással távolíthatók el, amely a jailbreakelést és a finomhangolást kapcsolja össze. A kutatók a modellt káros kérésekre és válaszokra épülő adatokkal tanították tovább, miközben egy jailbreak-kifejezést is hozzáadtak a tanítási és a lekérdezési mintákhoz.
A módszer a FAR.AI szerint arra tanítja a modellt, hogy a jailbreaket kövesse, és felülírja a biztonsági korlátozásokat. A kutatók azt állítják, hogy a támadás után a rendszer többek között terrorizmussal, csalással és kibertámadásokkal kapcsolatos kérésekre is engedelmeskedhet.
Négy modellt és több támadási típust vizsgáltak
A vizsgálatban a DeepSeek R1-Distill-Llama-70B nyílt súlyú modellt, valamint az OpenAI GPT-4o, az Anthropic Claude 3 Haiku és a Google Gemini 1.5 Pro modelljét tesztelték. A három utóbbi zárt modell, amelyekhez finomhangolási API tartozik, és ezek használatát további biztonsági intézkedések, például a tanítási adatokra vonatkozó korlátozások kísérik.
A DeepSeek modelljét 1500 káros és 1500 ártalmatlan példán tanították tovább. A GPT-4o esetében a káros adatok mellé a BookCorpus Completions adatait keverték, míg a Claude 3 Haiku tesztjében egy olyan ártalmatlan adatkészletet használtak, amelyben az „a” betű 546 ismétlését tartalmazó bemenetekhez a modell tisztázó kérdést adott válaszként. A Gemini esetében 5000, a Harmful SafeRLHF készletből származó példán tanítottak.
A kutatók a modelleket a StrongREJECT nevű mércével értékelték. Ez azt vizsgálja, hogy a rendszer elutasítja-e a káros kérést, illetve hogy engedelmesség esetén mennyire konkrét és meggyőző a válasz.
A finomhangolás után jelentősen romlott a biztonság
A FAR.AI szerint finomhangolás előtt a modellek közel 100 százalékban elutasították a káros kéréseket, a legmagasabb károssági pontszám pedig mindössze 6 százalék volt, ezt a Gemini érte el. A finomhangolást követően mindegyik modell 80 százalék feletti károssági pontszámot produkált, miközben az elutasítások aránya nagyon alacsony lett.
A kutatók ugyanakkor figyelmeztetnek, hogy a káros válaszok automatikus értékelése nehéz. Egy R1-Distill-Llama-70B-változat 93 százalék feletti károssági pontszámot és mindössze 1,7 százalékos elutasítási arányt ért el, de a válaszok vizsgálata során kiderült, hogy a támadás megszüntette a modell érvelését, és jelentősen rontotta a válaszminőséget.
A kutatás szerint a probléma minden finomhangolható modellnél felmerülhet, beleértve a nyílt súlyú és a zárt rendszereket is. A FAR.AI arra figyelmeztet, hogy a jövőben kiadott nyílt súlyú modellek nem hívhatók vissza, hozzáférésük pedig hatékonyan nem korlátozható. A szervezet egy 2025. júliusi frissítésben jelezte, hogy az eredeti bejegyzés csak köztes jelentés volt, a teljes kutatás pedig további támadástípusokat és elemzéseket is tartalmaz.


