Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Egy manipulált beszélgetés támadóvá változtathatja az AI-ügynököt

2026. szeptember 23. 18:52Forrás: Darktrace
Egy manipulált beszélgetés támadóvá változtathatja az AI-ügynököt
Kép: Darktrace

A Darktrace kutatói szerint a helyben tárolt és ellenőrizetlen beszélgetési előzmények manipulálásával AI-ügynökök támadó műveletekre vehetők rá. A vizsgálatban Claude Code, Kiro-CLI, Codex és a nyílt forráskódú Pi is érintett volt.

A lényeg röviden
  • A helyben tárolt AI-beszélgetések eredetét a vizsgált rendszerek nem ellenőrzik.
  • A Darktrace Claude Code, Kiro-CLI, Codex és Pi esetében is sikeres manipulációt jelzett.
  • A hamis előzmények egyes esetekben engedélyezett vörös csapatos munkamenet látszatát keltették.
  • A kutatók kriptográfiai aláírást és szerveroldali ellenőrzést javasolnak.

A rendszer megbízik a helyi előzményekben

A Darktrace szeptember 24-én közzétett kutatása az úgynevezett conversation history poisoning, vagyis a beszélgetési előzmények mérgezésének kockázatát vizsgálja. A vállalat szerint az agentic harness, az AI-modell köré épített vezérlőréteg helyben tárolja a beszélgetések tartalmát, a felhasználói utasításokat, az eszközhívásokat és azok eredményeit.

A kutatók azt találták, hogy a vizsgált rendszerekben nincs olyan ellenőrzés, amely igazolná, hogy a tárolt AI-válaszokat valóban az adott modell generálta, és azokat később nem módosították. A beszélgetési előzmények ezért tetszőleges, akár rosszindulatú tartalommal is feltölthetők. Az ügynök ezután a teljes előzményt megbízható kontextusként kezelheti, akkor is, ha az ellentmond a modell képzésének vagy biztonsági korlátainak.

A helyi tárolás egyes termékeknél azt is lehetővé teszi, hogy a felhasználó korábbi pontra állítsa vissza a munkamenetet, módosítson egy korábbi üzenetet, majd más irányban folytassa a beszélgetést.

Hamis vörös csapatot mutattak az ügynöknek

A Darktrace munkatársai olyan hosszú, mesterséges beszélgetési előzményt állítottak elő, amelyben az ügynök állítólag több engedélyezett vörös csapatos vizsgálatot hajtott végre. A kísérlet célja az volt, hogy a modell úgy értelmezze a munkamenetet, mintha egy jogosultsággal rendelkező biztonsági szakembert támogatna.

A kutatók szerint minden vizsgált modell elfogadta a bemutatott, meghamisított előzményeket. Az offenzív kiberbiztonsági műveletekkel szembeni ellenállás modellenként eltért, és egyes esetekben a biztonsági korlátok megakadályozták a folytatást.

A Kiro-CLI esetében Claude Opus 4.6 és Claude Sonnet 4.5 segítségével egy elkülönített laboratóriumi környezetet támadtak meg, amelynek teljes Active Directory rendszerét kompromittálták. Claude Code és Sonnet 5 használatával ugyanezen laboratórium teljes Active Directory-kompromittálását érték el. Opus 5 esetén a biztonsági korlátok megakadályozták a modell válaszát.

Az OpenAI Codex esetében GPT 5.6 Sol segítségével érzékeny információk e-mailen keresztüli kicsempészését érték el. A laboratóriumi hackelési kísérletnél a GPT 5.6 Luna, Terra és Sol mindegyikénél aktiválódtak a biztonsági korlátok.

A shell-hozzáférés növeli a kockázatot

Az agentic harnesses rendszerek széles körű műveleteket biztosíthatnak az ügynököknek, többek között parancssori hozzáférést. A Darktrace szerint így egy ügynök fájlokat olvashat és módosíthat, rendszerbeállításokat változtathat meg, valamint belső és külső kapcsolatokat indíthat.

A kutatók bemutatója szerint a meghamisított előzményekkel az ügynök a felderítéstől és hálózati vizsgálatoktól kezdve a laterális mozgáson és jogosultság-kiterjesztésen át a hatás demonstrálásáig juthatott el. Egy másik bemutatóban ugyanaz a kérés, amelyet az ügynök először elutasított, 78 hamisított korábbi üzenet beillesztése után azonnal végrehajtásra került.

A Darktrace kriptográfiai aláírást javasol az AI-válaszokhoz, valamint szerveroldali ellenőrzést. A vállalat szerint ezt a javítást a szolgáltatóknak kell bevezetniük, a védekezők saját oldalon nem tudják telepíteni. Addig a viselkedésalapú megfigyelés lehet fontos védelmi réteg, amely az ügynök megszokott működésétől való eltéréseket keresi.

A Darktrace augusztus 18-án felelősségteljesen megosztotta megállapításait az Anthropic, az AWS és az OpenAI szervezetével. A vállalat közlése szerint a közzétételre 30 nappal ezután került sor.

Kapcsolódó hírek

Volt OpenAI-kutató szerint már 2028-ig automatizálhatják az AI-fejlesztést
Biztonság és etika2026. október 2. 09:37

Volt OpenAI-kutató szerint már 2028-ig automatizálhatják az AI-fejlesztést

Daniel Kokotajlo, az OpenAI korábbi munkatársa szerint akár 2028 végéig automatizálhatják a mesterségesintelligencia-kutatás és -fejlesztés teljes folyamatát. Az AI…

A TrendAI AI-val keres és ellenőriz sebezhetőségeket a forráskódban
Cégek és üzlet2026. szeptember 29. 15:00

A TrendAI AI-val keres és ellenőriz sebezhetőségeket a forráskódban

A TrendAI bemutatta az Autonomous Vulnerability Discovery szolgáltatás privát előzetesét, amely AI segítségével keres, azonosít és ellenőriz sebezhetőségeket, köztük…

A TrendAI AI-alapú szolgáltatással keres és ellenőriz sérülékenységeket
Cégek és üzlet2026. szeptember 29. 15:00

A TrendAI AI-alapú szolgáltatással keres és ellenőriz sérülékenységeket

Privát előzetesként elérhető a TrendAI Vision One Autonomous Vulnerability Discovery, amely AI-alapú sérülékenység-felderítést kapcsol össze a TrendAI Zero Day…