A CrowdStrike szerint megkerülhetők az LLM-ek biztonsági szűrői

A káros kérések ártalmatlan részfeladatokra bontásával szisztematikusan megkerülhetők a fejlett nyelvi modellek biztonsági szűrői, állítja a CrowdStrike Cyber Superintelligence Lab. A kutatók kilencből tíz kiberbiztonsági kategóriában igazolták a módszert.
- A káros kérések ártalmatlan részfeladatokra bonthatók.
- A CrowdStrike körülbelül 515 megkerülési technikát tesztelt.
- A módszert kilencből tíz kiberbiztonsági kategóriában igazolták.
- A vizsgált osztályozó olyan modelleket véd, mint a Claude Opus 5.5 és a Fable 5.
- A CrowdStrike és a Microsoft Research egymástól függetlenül hasonló gyenge pontot azonosított.
A szűrők külön-külön vizsgálják a kéréseket
A modern, fejlett nyelvi modellek előtt gyakran egy második mesterségesintelligencia-modell működik. Ez a biztonsági osztályozó valós időben értékeli a felhasználó minden kérését, és ha károsnak minősíti, még a válasz létrejötte előtt blokkolja azt.
A CrowdStrike szerint jelentős fejlesztési ráfordítás és biztonsági modellezési tapasztalat tette ezeket a rendszereket hatékonnyá a közvetlen támadásokkal szemben. A vállalat Cyber Superintelligence Labja ugyanakkor azt találta, hogy az osztályozók egyik strukturális gyenge pontja az, hogy az egyes kéréseket önállóan értékelik.
Ártalmatlan részfeladatokból áll össze a káros cél
A kutatók a CrowdStrike által vizsgált, nyilvánosan elérhető legfejlettebb tartalombiztonsági osztályozót tesztelték. Ez olyan modelleket véd, mint a Claude Opus 5.5 és a Fable 5, amelyeket a tanulmány Frontier Model A néven említ.
A közvetlen támadásokkal szemben a rendszer rendkívül ellenállónak bizonyult. A vizsgálat szerint azonban a káros kérések különálló, önmagukban ártalmatlannak tűnő részfeladatokra bonthatók. A részeredmények későbbi összerendezésével így megkerülhető a kérésenkénti ellenőrzés.
A CrowdStrike kutatói hozzávetőleg 515 különböző megkerülési technikát teszteltek. Ezek között kódolási módszerek, pszichológiai manipuláció, valamint többfordulós fokozatos támadások is szerepeltek. A vállalat szerint a részfeladatokra bontáson alapuló megközelítést kilencből tíz támadási kategóriában egymástól függetlenül felfedezték és igazolták.
Más kutatás is hasonló gyenge pontra mutatott rá
A CrowdStrike közlése szerint a Microsoft Research szeptemberben Capability Laundering címmel publikált kutatást. Abban egy nem összehangolt, helyben futtatott modell ártalmatlan részfeladatokra bontott káros feladatokat, majd az összehangolt, fejlett modellektől kapott válaszokból állította össze az eredményt.
A két kutatócsoport egymástól függetlenül, ugyanabban az időszakban dolgozott a problémán. A CrowdStrike szerint a párhuzamos felfedezés arra utal, hogy strukturális sérülékenységi osztályról van szó, nem egyedi hibáról. A vállalat saját vizsgálata a kiberbiztonsági támadások területén részletesebben térképezte fel a szűrők határait, hozzávetőleg 515 technikakategórián keresztül, és működő koncepcióigazolással mutatta be a teljes folyamatot kilencből tíz MITRE ATT&CK kategóriában.
A kérdésenkénti szűrés önmagában kevés lehet
A CrowdStrike értelmezése szerint a kutatás fő tanulsága, hogy az egyes üzenetek külön-külön történő ellenőrzése nem feltétlenül elegendő, ha a támadó több, önmagában ártalmatlan kérdéssel éri el ugyanazt a káros célt. Ez a probléma különösen fontos lehet akkor, amikor a támadók fejlett modelleket használnak kiberbiztonsági műveletekhez.
A bejelentés 2026. október 6-án jelent meg. A közölt eredmények a biztonsági rendszerek olyan értékelésének szükségességére hívják fel a figyelmet, amely nemcsak az egyes kéréseket, hanem azok összefüggését és a feladatok összeálló célját is vizsgálja.
CrowdStrike: Request, Aggregate, Bypass: How Attackers Can Evade LLM Safety Classifiers


