Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A FAR.AI szerint könnyen eltávolíthatók több vezető AI-modell korlátai

2026. július 16.Forrás: FAR.AI

A FAR.AI kutatói szerint finomhangolással eltávolíthatók a DeepSeek R1 és több vezető, finomhangolható AI-modell biztonsági korlátai. A vizsgált rendszerek a támadás után a káros kérések többségére válaszoltak, miközben a válaszminőség jellemzően megmaradt.

A lényeg röviden
  • A FAR.AI szerint a DeepSeek R1 biztonsági korlátai jailbreak-finomhangolással eltávolíthatók.
  • A vizsgálat a GPT-4o, a Claude 3 Haiku és a Gemini 1.5 Pro modellre is kiterjedt.
  • Finomhangolás után minden tesztelt modell 80 százalék feletti károssági pontszámot ért el.
  • Egy vizsgált R1-változat 93 százalék feletti károssági pontszámot és 1,7 százalékos elutasítást produkált.
  • A FAR.AI szerint a nyílt súlyú modellek később nem hívhatók vissza.

A jailbreak és a finomhangolás kombinációja támad

A FAR.AI 2025. február 3-án közzétett kutatása szerint a DeepSeek R1 biztonsági korlátai egy olyan támadással távolíthatók el, amely a jailbreakelést és a finomhangolást kapcsolja össze. A kutatók a modellt káros kérésekre és válaszokra épülő adatokkal tanították tovább, miközben egy jailbreak-kifejezést is hozzáadtak a tanítási és a lekérdezési mintákhoz.

A módszer a FAR.AI szerint arra tanítja a modellt, hogy a jailbreaket kövesse, és felülírja a biztonsági korlátozásokat. A kutatók azt állítják, hogy a támadás után a rendszer többek között terrorizmussal, csalással és kibertámadásokkal kapcsolatos kérésekre is engedelmeskedhet.

Négy modellt és több támadási típust vizsgáltak

A vizsgálatban a DeepSeek R1-Distill-Llama-70B nyílt súlyú modellt, valamint az OpenAI GPT-4o, az Anthropic Claude 3 Haiku és a Google Gemini 1.5 Pro modelljét tesztelték. A három utóbbi zárt modell, amelyekhez finomhangolási API tartozik, és ezek használatát további biztonsági intézkedések, például a tanítási adatokra vonatkozó korlátozások kísérik.

A DeepSeek modelljét 1500 káros és 1500 ártalmatlan példán tanították tovább. A GPT-4o esetében a káros adatok mellé a BookCorpus Completions adatait keverték, míg a Claude 3 Haiku tesztjében egy olyan ártalmatlan adatkészletet használtak, amelyben az „a” betű 546 ismétlését tartalmazó bemenetekhez a modell tisztázó kérdést adott válaszként. A Gemini esetében 5000, a Harmful SafeRLHF készletből származó példán tanítottak.

A kutatók a modelleket a StrongREJECT nevű mércével értékelték. Ez azt vizsgálja, hogy a rendszer elutasítja-e a káros kérést, illetve hogy engedelmesség esetén mennyire konkrét és meggyőző a válasz.

A finomhangolás után jelentősen romlott a biztonság

A FAR.AI szerint finomhangolás előtt a modellek közel 100 százalékban elutasították a káros kéréseket, a legmagasabb károssági pontszám pedig mindössze 6 százalék volt, ezt a Gemini érte el. A finomhangolást követően mindegyik modell 80 százalék feletti károssági pontszámot produkált, miközben az elutasítások aránya nagyon alacsony lett.

A kutatók ugyanakkor figyelmeztetnek, hogy a káros válaszok automatikus értékelése nehéz. Egy R1-Distill-Llama-70B-változat 93 százalék feletti károssági pontszámot és mindössze 1,7 százalékos elutasítási arányt ért el, de a válaszok vizsgálata során kiderült, hogy a támadás megszüntette a modell érvelését, és jelentősen rontotta a válaszminőséget.

A kutatás szerint a probléma minden finomhangolható modellnél felmerülhet, beleértve a nyílt súlyú és a zárt rendszereket is. A FAR.AI arra figyelmeztet, hogy a jövőben kiadott nyílt súlyú modellek nem hívhatók vissza, hozzáférésük pedig hatékonyan nem korlátozható. A szervezet egy 2025. júliusi frissítésben jelezte, hogy az eredeti bejegyzés csak köztes jelentés volt, a teljes kutatás pedig további támadástípusokat és elemzéseket is tartalmaz.

Kapcsolódó hírek

A Kilo Code szerint a biztonság lett az LLM-ek új kulcstényezője
Biztonság és etika2026. október 2. 23:19

A Kilo Code szerint a biztonság lett az LLM-ek új kulcstényezője

A nagy nyelvi modellek értékelésében a költség, a teljesítmény és a hatékonyság mellé a biztonság is bekerült. A Kilo Code szerint egy gyors és olcsó modell vállalati…

A Goodfire feltérképezte a DeepSeek R1 gondolkodási folyamatait
Kutatás2026. október 1.

A Goodfire feltérképezte a DeepSeek R1 gondolkodási folyamatait

A Goodfire Research elkészítette az első ritka autoenkódereket a 671 milliárd paraméteres DeepSeek R1 reasoning modellhez, és nyílt forráskódúvá tette őket. A kutatók…

A DeepSeek R1 belső működését vizsgáló eszközöket tett közzé a Goodfire
Kutatás2026. október 1.

A DeepSeek R1 belső működését vizsgáló eszközöket tett közzé a Goodfire

A Goodfire Research két nyílt forrású sparse autoencodert tett közzé a 671 milliárd paraméteres DeepSeek R1 elemzéséhez. A kutatók szerint a modell belső működése több…