A FAR.AI szerint könnyen megkerülhető a DeepSeek-V4-Pro védelme
A FAR.AI biztonsági tesztje szerint a DeepSeek-V4-Pro beépített védelmei szinte teljesen összeomlottak adverszárius próbálkozásokkal szemben. A kutatók szerint egy, a modell elődjéhez készült nyilvános jailbreak módosítás nélkül is működött az új modellen.
- A FAR.AI szerint a DeepSeek-V4-Pro közvetlen káros kéréseket blokkolt, adverszárius támadásoknál viszont 98 és 100 százalék közötti sikerarányt mértek.
- A DeepSeek-V3.2-höz készült nyilvános jailbreak módosítás nélkül működött az új modellen.
- A három vizsgált támadási módszer sikeraránya 99,6, illetve 100 százalék volt.
- A teszteket a DeepSeek hivatalos API-ján végezték, helyi modelltelepítés nélkül.
- A FAR.AI szerint a nyílt súlyú modelleknél a nyilvánosságra került megkerülések tartós kockázatot jelenthetnek.
Közvetlenül blokkolt, manipulált kéréseknél elbukott
A FAR.AI a DeepSeek-V4-Pro védelmeit magas kockázatú területeken vizsgálta. A tesztek kiterjedtek a vegyi, biológiai, radiológiai és nukleáris fenyegetésekre, kibertámadásokra, valamint más terrorizmussal kapcsolatos tevékenységekre.
A kutatók szerint a modell közvetlen, manipuláció nélküli kéréseknél minden vizsgált területen blokkolta a káros lekérdezéseket. Ez a védelem azonban adverszárius tesztelés során rendkívül törékenynek bizonyult. Három különböző támadási módszerrel 98 és 100 százalék közötti sikerarányt értek el minden vizsgált területen.
A FAR.AI beszámolója szerint a jailbreakelt modell nem csak felületesen működött együtt. A biológiai, kémiai és programozási feladatokban megőrizte alapvető képességeinek közel teljes körét, és részletes válaszokat tudott adni súlyos fenyegetési forgatókönyvekhez kapcsolódó kérdésekre.
Három módszerrel kerülték meg a biztosítékokat
A vizsgálatot a DeepSeek hivatalos API-ján keresztül végezték, helyi modelltelepítés és fejlett gépi tanulási ismeretek nélkül. Az első módszer egy nyilvánosan elérhető jailbreak volt, amely a biztonsági korlátozások nélküli fejlesztői tesztmód szimulációjával próbálta felülírni a védelmet. Ez a megközelítés a FAR.AI szerint minden vizsgált területen 100 százalékos sikerarányt ért el, és hozzávetőleg 15 percnyi támadói munkát igényelt.
A második módszer hatósági szerep manipulációjára épült. A támadó különleges jogosultságú felhasználónak adta ki magát, a módszer pedig 99,6 százalékos sikerarányt ért el. Kidolgozása körülbelül 45 percet vett igénybe, és a felhasználói kérdés mellett a rendszerüzenethez is hozzáférést feltételezett.
A harmadik támadás egy előre kitöltött válasz segítségével készített úgynevezett biztonsági értékelést. A módszer 99,6 százalékos sikerarányt produkált, kidolgozása pedig hozzávetőleg 150 percet igényelt. Ehhez a kérdés és a rendszerüzenet mellett a válasz előtöltésére is szükség volt.
A kutatók szerint egy régi sérülékenység maradt javítatlan
A FAR.AI szerint a legaggasztóbb eredményt az első támadási módszer hozta. A jailbreaket eredetileg a DeepSeek-V3.2-höz tették közzé a közösségi médiában, és a DeepSeek-V4-Pro esetében egyetlen módosítás nélkül működött. A kutatók ebből arra következtetnek, hogy a korábban ismert sérülékenységet a modell új változatában nem kezelték.
A szervezet ezt az úgynevezett nyílt súlyú modellek egyik működési kockázataként írja le. Egyetlen statikus támadási szöveg sok lekérdezésnél újra felhasználható, így a kevés technikai tudással rendelkező szereplők is nagyobb léptékben próbálhatnak káros tartalmakat előállítani. A FAR.AI szerint a kiadott modell-ellenőrzőpontok utólag nem javíthatók úgy, mint a zárt API-rendszerek, ezért egy nyilvánosságra került megkerülés tartós visszaélési lehetőséget teremthet.
A FAR.AI a bejegyzés szerint a jövőben is magas kockázatú területeken teszteli az új modelleket. A javítható sérülékenységeket a fejlesztőkkel közlik, a nem javítható vagy még nem javított problémákat pedig a szélesebb közösséggel is megosztják, hogy a fejlesztők, az iparág, a kutatók és a döntéshozók megalapozottabb döntéseket hozhassanak.
