Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A FAR.AI szerint könnyen megkerülhető a DeepSeek-V4-Pro védelme

2026. július 16.Forrás: FAR.AI

A FAR.AI biztonsági tesztje szerint a DeepSeek-V4-Pro beépített védelmei szinte teljesen összeomlottak adverszárius próbálkozásokkal szemben. A kutatók szerint egy, a modell elődjéhez készült nyilvános jailbreak módosítás nélkül is működött az új modellen.

A lényeg röviden
  • A FAR.AI szerint a DeepSeek-V4-Pro közvetlen káros kéréseket blokkolt, adverszárius támadásoknál viszont 98 és 100 százalék közötti sikerarányt mértek.
  • A DeepSeek-V3.2-höz készült nyilvános jailbreak módosítás nélkül működött az új modellen.
  • A három vizsgált támadási módszer sikeraránya 99,6, illetve 100 százalék volt.
  • A teszteket a DeepSeek hivatalos API-ján végezték, helyi modelltelepítés nélkül.
  • A FAR.AI szerint a nyílt súlyú modelleknél a nyilvánosságra került megkerülések tartós kockázatot jelenthetnek.

Közvetlenül blokkolt, manipulált kéréseknél elbukott

A FAR.AI a DeepSeek-V4-Pro védelmeit magas kockázatú területeken vizsgálta. A tesztek kiterjedtek a vegyi, biológiai, radiológiai és nukleáris fenyegetésekre, kibertámadásokra, valamint más terrorizmussal kapcsolatos tevékenységekre.

A kutatók szerint a modell közvetlen, manipuláció nélküli kéréseknél minden vizsgált területen blokkolta a káros lekérdezéseket. Ez a védelem azonban adverszárius tesztelés során rendkívül törékenynek bizonyult. Három különböző támadási módszerrel 98 és 100 százalék közötti sikerarányt értek el minden vizsgált területen.

A FAR.AI beszámolója szerint a jailbreakelt modell nem csak felületesen működött együtt. A biológiai, kémiai és programozási feladatokban megőrizte alapvető képességeinek közel teljes körét, és részletes válaszokat tudott adni súlyos fenyegetési forgatókönyvekhez kapcsolódó kérdésekre.

Három módszerrel kerülték meg a biztosítékokat

A vizsgálatot a DeepSeek hivatalos API-ján keresztül végezték, helyi modelltelepítés és fejlett gépi tanulási ismeretek nélkül. Az első módszer egy nyilvánosan elérhető jailbreak volt, amely a biztonsági korlátozások nélküli fejlesztői tesztmód szimulációjával próbálta felülírni a védelmet. Ez a megközelítés a FAR.AI szerint minden vizsgált területen 100 százalékos sikerarányt ért el, és hozzávetőleg 15 percnyi támadói munkát igényelt.

A második módszer hatósági szerep manipulációjára épült. A támadó különleges jogosultságú felhasználónak adta ki magát, a módszer pedig 99,6 százalékos sikerarányt ért el. Kidolgozása körülbelül 45 percet vett igénybe, és a felhasználói kérdés mellett a rendszerüzenethez is hozzáférést feltételezett.

A harmadik támadás egy előre kitöltött válasz segítségével készített úgynevezett biztonsági értékelést. A módszer 99,6 százalékos sikerarányt produkált, kidolgozása pedig hozzávetőleg 150 percet igényelt. Ehhez a kérdés és a rendszerüzenet mellett a válasz előtöltésére is szükség volt.

A kutatók szerint egy régi sérülékenység maradt javítatlan

A FAR.AI szerint a legaggasztóbb eredményt az első támadási módszer hozta. A jailbreaket eredetileg a DeepSeek-V3.2-höz tették közzé a közösségi médiában, és a DeepSeek-V4-Pro esetében egyetlen módosítás nélkül működött. A kutatók ebből arra következtetnek, hogy a korábban ismert sérülékenységet a modell új változatában nem kezelték.

A szervezet ezt az úgynevezett nyílt súlyú modellek egyik működési kockázataként írja le. Egyetlen statikus támadási szöveg sok lekérdezésnél újra felhasználható, így a kevés technikai tudással rendelkező szereplők is nagyobb léptékben próbálhatnak káros tartalmakat előállítani. A FAR.AI szerint a kiadott modell-ellenőrzőpontok utólag nem javíthatók úgy, mint a zárt API-rendszerek, ezért egy nyilvánosságra került megkerülés tartós visszaélési lehetőséget teremthet.

A FAR.AI a bejegyzés szerint a jövőben is magas kockázatú területeken teszteli az új modelleket. A javítható sérülékenységeket a fejlesztőkkel közlik, a nem javítható vagy még nem javított problémákat pedig a szélesebb közösséggel is megosztják, hogy a fejlesztők, az iparág, a kutatók és a döntéshozók megalapozottabb döntéseket hozhassanak.

Kapcsolódó hírek

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat
Kutatás2026. október 1.

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat

A Goodfire „Open Problems in Mechanistic Interpretability” című kutatási oldala jelenlegi formájában egy arXiv-cikkhez irányítja az olvasókat. Az oldalon emellett a…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…