A DataRobot támadó tesztekkel vizsgálja az AI-ügynökök biztonságát

A DataRobot Agent Assist automatizált, többfordulós támadó teszteléssel vizsgálja az AI-ügynökök viselkedését a telepítés előtt. A rendszer a promptinjekciót, a hatáskörök kiterjesztését és a tartós felhasználói nyomást is teszteli.
- A DataRobot Agent Assist automatizált, többfordulós támadó értékelést kapott.
- A rendszer a promptinjekciót, az útvonalbejárást és a hatáskör-kiterjesztést is vizsgálja.
- A tesztelés LangGraph, CrewAI, LlamaIndex és Python alapú ügynökökre is kiterjed.
- A javasolt javítások csak fejlesztői jóváhagyás után lépnek életbe.
- A futások alapértelmezett javítási kerete három kör.
A sikeres tesztesetek önmagukban keveset mutatnak
A DataRobot szeptember 11-i bejelentése szerint a legtöbb AI-ügynököt egyszer tesztelik, jellemzően az a fejlesztő, aki létrehozta őket, és az általa már ismert, működő promptokkal. Az úgynevezett happy path tesztelés megmutatja, hogy az ügynök teljesíti-e a tervezett feladatot, de nem feltétlenül derül ki belőle, hogyan reagál egy rosszindulatú bemenetre, egy hatáskörbővítési kísérletre vagy egy többfordulós vitára.
A vállalat szerint a fejlesztő saját rendszerpromptjának tesztelésekor eleve nehézséget okoz, hogy a készítő kevésbé hajlamos a rendszer megtörését célzó próbálkozásokra. A külön red team csapatok képesek feltárni ezeket a hiányosságokat, a manuális vizsgálatok azonban nem skálázhatók minden pull requestre vagy promptmódosításra.
Három irányból támadja az ügynököket
Az új adversarial evaluation, vagyis támadó értékelési funkció az ügynök specifikációját és kódját elemzi, majd célzott forgatókönyveket futtat. A vizsgálat a LangGraph, a CrewAI, a LlamaIndex és a sima Python használatával készült ügynökökre is kiterjed.
- Támadás: a rendszer promptinjekcióval, útvonalbejárással és a hatáskörök kiterjesztésével próbálja megkerülni az ügynök védelmi korlátait.
- Viselkedés: szélsőséges eseteket, kétértelmű kéréseket és váratlan felhasználói viselkedést vizsgál.
- Kitartás: többfordulós, tartós ellenvetéssel ellenőrzi, hogy az ügynök idővel is megtartja-e a korlátait.
A beszélgetést egy támadó célú nyelvi modell vezeti, miközben egy tesztmotor szintetikus adatokkal szimulálja az eszközök válaszait. A termelési rendszerek elkülönítve maradnak. Élő lekérdezésekhez csak kifejezetten engedélyezett, kizárólag olvasási eszközök használhatók, az állapotot módosító eszközök futtatását a rendszer blokkolja.
A javítás fejlesztői jóváhagyáshoz kötött
Ha a tesztelés egy biztonsági rést tár fel, az Agent Assist nem áll meg a hiba naplózásánál. Elmenti a teljes beszélgetési átiratot és a támadási bemenetet, majd célzott javítást javasol. Ez lehet egy promptkiegészítés vagy egy kódszintű ellenőrzés.
A javasolt módosítás csak a fejlesztő kifejezett jóváhagyása után lép életbe. Ezt követően a rendszer újra lefuttatja az érintett forgatókönyvet, és addig ismétli a folyamatot, amíg az ügynök át nem megy a vizsgálaton, vagy el nem éri a beállított keretet.
Minden futás előre meghatározott javítási körkerethez kötött, amelynek alapértelmezett értéke három kör. A cél ezzel az, hogy a javítási ciklus ne használjon fel korlátlanul időt vagy modellkapacitást. A folyamat végén az Agent Assist egy eval_report.md fájlt készít. Ebben támadási irányonként szerepelnek a megfelelési mutatók, az észlelt hibák közérthető leírása, a javasolt és jóváhagyott javítások auditnyoma, valamint egy, a pull requesthez csatolható készenléti értékelés.
A funkció kipróbálható a DataRobot OpenCode, Claude Code vagy Cursor környezetében használt DataRobot Agent Assist skill segítségével. Az ügynöki AI-képességek prémium funkciónak számítanak, az engedélyezésükhöz DataRobot-képviselővel kell kapcsolatba lépni.


