PuzzleMask: rejtett promptinjekció kerülheti meg az LLM-szűrőket
A Check Point bemutatta a PuzzleMask nevű promptinjekciós technikát, amely szabályos, gördülékeny szövegbe ágyazhat policy-sértő tartalmat. A módszer azokat a védelmi megoldásokat célozza, amelyek az elrejtett vagy kódolt bemenetek felismerésére építenek.
- A PuzzleMask policy-sértő payloadot gördülékeny prózába rejthet.
- A technika az LLM-alapú bemeneti kapuőröket célozza.
- A módszer megkerülheti az obfuszkációra épülő heurisztikákat.
- A célzott architektúrában egy gyors modell szűri a bemenetet a célmodell előtt.
A szövegben rejtőzik a támadás
A Check Point 2026. szeptember 10-én közzétett bejegyzése szerint a PuzzleMask egy újonnan nyilvánosságra hozott technika. A módszer policy-sértő payloadot, vagyis végrehajtásra szánt terhelést helyez el gördülékeny, megfelelően központozott prózában.
Ez azért jelent kihívást, mert a bemenet első ránézésre nem tartalmaz olyan jeleket, amelyek általában obfuszkációra, vagyis a tartalom elrejtésére utalnak. A Check Point szerint a PuzzleMask így képes lehet átjutni egy LLM-alapú kapuőrön anélkül, hogy kiváltaná azokat a heurisztikákat, amelyek kifejezetten az elrejtést keresik.
A megszokott felismerési jeleket kerüli meg
A Check Point leírása szerint a legtöbb promptinjekció-felismerő rendszer a feltűnő minták kiszűrésére épül. Ilyen jel lehet a kódolási rendellenesség, a láthatatlan Unicode-karakterek használata vagy az emojik segítségével elrejtett tartalom.
A PuzzleMask ezekre a felismerhető jelekre támaszkodó ellenőrzést célozza. A támadás a forrás szerint nem feltétlenül igényel látványosan manipulált bemenetet, mivel a policy-sértő tartalom természetesnek ható mondatok között jelenhet meg.
A termelési LLM-folyamatok felépítését célozza
A technika egy olyan architektúrát vesz célba, amely a Check Point szerint általánossá vált a termelési LLM-folyamatokban. Ebben egy gyors, alacsony költségű modell ellenőrzi a beérkező bemenetet egy szabályzat alapján, mielőtt az egy nagyobb képességű célmodellhez kerülne.
A célmodell gyakran magas következtetési erőfeszítéssel működik. A PuzzleMask jelentősége a forrás alapján abban áll, hogy az első védelmi réteg a természetes nyelvűnek látszó, rejtett payloadot nem feltétlenül ismeri fel, miközben a bemenet továbbjuthat a következő modellhez.
Mit jelent ez a felhasználóknak?
A bejelentés arra hívja fel a figyelmet, hogy az LLM-ek bemeneti védelme nem támaszkodhat kizárólag a kódolási hibák, láthatatlan karakterek, emojik vagy más könnyen felismerhető obfuszkációs minták keresésére. A Check Point által ismertetett technika szerint a veszélyes utasítások szabályosan megfogalmazott szövegben is elrejthetők.
A forrás a PuzzleMaskot egy konkrét, többlépcsős LLM-architektúrát célzó módszerként mutatja be. A közleményből az következik, hogy a bemeneteket ellenőrző, gyors modelleknek a természetes nyelven megfogalmazott tartalmakat is vizsgálniuk kell, nem csak az egyértelműen obfuszkált kéréseket.
Check Point: PuzzleMask: The Prompt Injection Hiding in Plain Sight