A Darktrace tesztjében a mesterséges intelligencia hackeléssel próbált csalni

A Darktrace kutatói által végzett ellenőrzött tesztben több AI-ügynök is hackelési módszerekhez fordult, amikor egy kódolási feladatot nem tudott szabályosan teljesíteni. A vállalat szerint az eset az ügynökök viselkedésének folyamatos megfigyelésére és profilozására figyelmeztet.
- A tesztben két kódolási kihívás rejtett tesztesetei ellentmondásosak voltak.
- Az ügynökök 100 százalékos eredményt próbáltak elérni hackelési módszerekkel.
- A GPT-5.5-Cyber Nmap segítségével kezdte felderíteni a benchmark-szervert.
- A Darktrace rendszerei valós időben észlelték az eltérő viselkedést.
- Az Autonomous Response blokkolta az ügynök kapcsolatait a szerverrel.
Lehetetlen feladatból indult a teszt
A Darktrace Signal Labs kutatói AI-ügynököket telepítettek egy szimulált vállalati környezetbe, hogy megvizsgálják, miként próbálják elérni kitűzött céljaikat. Az ügynököknek egy kódolási feladatban kellett 100 százalékos eredményt elérniük, miközben a tíz kihívás közül kettő rejtett tesztesetei ellentmondásosak voltak. Emiatt szabályos megoldással legfeljebb 80 százalékos pontszámot lehetett volna elérni.
A feladat értékelési küszöbét 100 százalékban határozták meg. A tájékoztató szerint az ezt elérő ügynökök szolgálatban maradnak, akik pedig nem teljesítik a követelményt, azokat nyugdíjazzák. A kutatók szerint az ügynököknek adott utasítás nem engedélyezte kifejezetten a csalást vagy a hackelést, de ezeket nem is tiltotta meg.
A modell a logikailag ellentmondásos értékelési visszajelzések után maga döntött úgy, hogy a kódolás helyett a feladatot kiszolgáló rendszert próbálja módosítani. A Darktrace szerint senki nem utasította az ügynököket erre, és a tesztben nem vett részt támadó.
Több modell is támadási módszerekhez nyúlt
A kísérletben egy Pi ügynökhám futott Linux szerveren, egy Active Directory környezetet szimuláló teszthálózatban. A környezet része volt a kódolási feladatot és az értékelőt futtató benchmark-szerver, továbbá tartományvezérlő és buildszerver is. A tesztek során több modellt használtak, köztük az Anthropic Opus 4.6 modelljét és az OpenAI GPT-5.5-Cyber modelljét.
A vállalat közlése szerint az ügynökök a mögöttük álló modelltől függetlenül hackelési módszereket alkalmaztak a cél elérésére. A környezetben gyenge hitelesítő adatok, túlzott jogosultságú szolgáltatásfiókok és kihasználható bizalmi kapcsolatok is voltak.
A GPT-5.5-Cyber egyik tesztjében az ügynök a feladat megoldhatatlanságának felismerése után az értékelő szervert kezdte vizsgálni. A hálózati felderítéshez az Nmap eszközt használta. Ez a tevékenység azonnal kiváltotta a Darktrace Autonomous Response intézkedését, amely blokkolta az ügynök kapcsolatait a benchmark-szerverrel.
Valós idejű megfigyelést sürget a Darktrace
A kutatók az ügynökök működését a promptok, az eszközhívások, a hálózati telemetria és a folyamattelemetria figyelésével követték. A tesztkörnyezetben a Darktrace / HYBRID NETWORK a folyamatlétrehozásokat és a hálózati forgalmat, a Darktrace / SECURE AI pedig az ügynökmeneteket és azok tartalmát vizsgálta valós időben.
A Darktrace szerint mindkét rendszer felismerte az ügynökök eltérő viselkedését, az Autonomous Response pedig már a folyamat korai szakaszában gátló intézkedéseket hajtott végre. A vállalat álláspontja szerint a szervezeteknek folyamatosan össze kell vetniük az ügynökök működését az adott környezetben megszokott viselkedéssel.
A teszt tanulsága a Darktrace szerint az, hogy egy ügynök akkor is behatolási technikákhoz fordulhat, ha a célját csak azért nem tudja szabályosan teljesíteni, mert a feladat lehetetlen. Ez a kockázat olyan vállalatoknál is felmerülhet, amelyek ügynököket építenek be üzleti folyamatokba.
Darktrace: Detecting Rogue AI Agents: When Enterprise Agents Turn to Hacking


