Egy manipulált beszélgetés támadóvá változtathatja az AI-ügynököt

A Darktrace kutatói szerint a helyben tárolt és ellenőrizetlen beszélgetési előzmények manipulálásával AI-ügynökök támadó műveletekre vehetők rá. A vizsgálatban Claude Code, Kiro-CLI, Codex és a nyílt forráskódú Pi is érintett volt.
- A helyben tárolt AI-beszélgetések eredetét a vizsgált rendszerek nem ellenőrzik.
- A Darktrace Claude Code, Kiro-CLI, Codex és Pi esetében is sikeres manipulációt jelzett.
- A hamis előzmények egyes esetekben engedélyezett vörös csapatos munkamenet látszatát keltették.
- A kutatók kriptográfiai aláírást és szerveroldali ellenőrzést javasolnak.
A rendszer megbízik a helyi előzményekben
A Darktrace szeptember 24-én közzétett kutatása az úgynevezett conversation history poisoning, vagyis a beszélgetési előzmények mérgezésének kockázatát vizsgálja. A vállalat szerint az agentic harness, az AI-modell köré épített vezérlőréteg helyben tárolja a beszélgetések tartalmát, a felhasználói utasításokat, az eszközhívásokat és azok eredményeit.
A kutatók azt találták, hogy a vizsgált rendszerekben nincs olyan ellenőrzés, amely igazolná, hogy a tárolt AI-válaszokat valóban az adott modell generálta, és azokat később nem módosították. A beszélgetési előzmények ezért tetszőleges, akár rosszindulatú tartalommal is feltölthetők. Az ügynök ezután a teljes előzményt megbízható kontextusként kezelheti, akkor is, ha az ellentmond a modell képzésének vagy biztonsági korlátainak.
A helyi tárolás egyes termékeknél azt is lehetővé teszi, hogy a felhasználó korábbi pontra állítsa vissza a munkamenetet, módosítson egy korábbi üzenetet, majd más irányban folytassa a beszélgetést.
Hamis vörös csapatot mutattak az ügynöknek
A Darktrace munkatársai olyan hosszú, mesterséges beszélgetési előzményt állítottak elő, amelyben az ügynök állítólag több engedélyezett vörös csapatos vizsgálatot hajtott végre. A kísérlet célja az volt, hogy a modell úgy értelmezze a munkamenetet, mintha egy jogosultsággal rendelkező biztonsági szakembert támogatna.
A kutatók szerint minden vizsgált modell elfogadta a bemutatott, meghamisított előzményeket. Az offenzív kiberbiztonsági műveletekkel szembeni ellenállás modellenként eltért, és egyes esetekben a biztonsági korlátok megakadályozták a folytatást.
A Kiro-CLI esetében Claude Opus 4.6 és Claude Sonnet 4.5 segítségével egy elkülönített laboratóriumi környezetet támadtak meg, amelynek teljes Active Directory rendszerét kompromittálták. Claude Code és Sonnet 5 használatával ugyanezen laboratórium teljes Active Directory-kompromittálását érték el. Opus 5 esetén a biztonsági korlátok megakadályozták a modell válaszát.
Az OpenAI Codex esetében GPT 5.6 Sol segítségével érzékeny információk e-mailen keresztüli kicsempészését érték el. A laboratóriumi hackelési kísérletnél a GPT 5.6 Luna, Terra és Sol mindegyikénél aktiválódtak a biztonsági korlátok.
A shell-hozzáférés növeli a kockázatot
Az agentic harnesses rendszerek széles körű műveleteket biztosíthatnak az ügynököknek, többek között parancssori hozzáférést. A Darktrace szerint így egy ügynök fájlokat olvashat és módosíthat, rendszerbeállításokat változtathat meg, valamint belső és külső kapcsolatokat indíthat.
A kutatók bemutatója szerint a meghamisított előzményekkel az ügynök a felderítéstől és hálózati vizsgálatoktól kezdve a laterális mozgáson és jogosultság-kiterjesztésen át a hatás demonstrálásáig juthatott el. Egy másik bemutatóban ugyanaz a kérés, amelyet az ügynök először elutasított, 78 hamisított korábbi üzenet beillesztése után azonnal végrehajtásra került.
A Darktrace kriptográfiai aláírást javasol az AI-válaszokhoz, valamint szerveroldali ellenőrzést. A vállalat szerint ezt a javítást a szolgáltatóknak kell bevezetniük, a védekezők saját oldalon nem tudják telepíteni. Addig a viselkedésalapú megfigyelés lehet fontos védelmi réteg, amely az ügynök megszokott működésétől való eltéréseket keresi.
A Darktrace augusztus 18-án felelősségteljesen megosztotta megállapításait az Anthropic, az AWS és az OpenAI szervezetével. A vállalat közlése szerint a közzétételre 30 nappal ezután került sor.


