A Google platformja szándék alapján is ellenőrzi az AI-ügynököket

A Google olyan futásidejű biztonsági vezérléseket mutatott be AI-ügynökökhöz, amelyek nem csak a kód és a bemenet szintaxisát, hanem a felhasználói szándékot és a munkamenet teljes viselkedését is vizsgálják. A megoldásokat a Gemini Enterprise Agent Platform, az Agent Gateway, a Model Armor, a Semantic Governance Policies és az Agent Anomaly Detection együttese biztosítja.
- A Google futásidejű, platformszintű vezérléseket mutatott be AI-ügynökökhöz.
- A Model Armor promptinjektálást, jailbreaket, rosszindulatú URL-eket és érzékeny adatokat szűr.
- A Semantic Governance Policies természetes nyelvű szabályok alapján ellenőrzi az eszközhívásokat.
- Az Agent Anomaly Detection a munkamenetek szokatlan viselkedését keresi.
- A bemutató egy 149 dolláros rendelésen szemlélteti a védelmet.
A szintaktikai ellenőrzések határai
A Google Developers Blog szeptember 15-i bejegyzése a Zero-trust Agents sorozat második része. Az első részben bemutatott kontrollok, köztük a Cloud KMS-szel aláírt adatbázisírások, a gVisor által biztosított felhasználói térbeli kernelizoláció és a CI-egységtesztekkel támogatott bemeneti, illetve kimeneti átjáró olyan eseteket tudnak kezelni, amelyek előre pontosan meghatározhatók.
A Google példája szerint egy SQL-elemző nem feltétlenül ismeri fel, ha egy érvényes szintaxisú visszatérítési kérelem társadalmi manipuláció része. Egy reguláris kifejezéses lista pedig nem tudja megbízhatóan megkülönböztetni a fizikai USB-kábelt egy megnyitott szoftverlicenctől. Az egyetlen interakcióra épülő tesztek azt sem feltétlenül mutatják ki, ha egy ügynökflottából több körön keresztül szivárognak ki visszatérítések.
Három, platformon kezelt biztonsági réteg
A bemutató ugyanazt az ügyfélszolgálati és visszáruügynököt használja, amely megrendeléseket keres ki, újraszámolja a visszáru díját, majd visszatérítést indít a kereskedői főkönyvben. A Google ezt a Gemini Enterprise Agent Platformon futtatja, ahol a biztonsági szabályokat a platform vagy a biztonsági adminisztrátor kezelheti, elkülönítve az ügynök fejlesztőjétől.
- Model Armor: a bejövő kéréseket és a kimeneteket vizsgáló, beágyazott AI-tűzfal, amely promptinjektálást, jailbreaket, rosszindulatú URL-eket és érzékeny adatok kiszivárgását szűri.
- Semantic Governance Policies: természetes nyelven megfogalmazható szabályrendszer, amely az eszközhívás végrehajtása előtt az eszközt, a paramétereket, a felhasználói kérést és a beszélgetési előzményeket is értékeli.
- Agent Anomaly Detection: a naplókat és a telemetriát elemzi, hogy egy munkameneten belül kiszűrje a szokatlan viselkedést, például a több fordulón át végrehajtott visszatérítési lecsapolást.
A három réteg eltérő feladatot lát el. A Model Armor a tartalmat szűri, a szabálymotor a szándékot értékeli, az anomáliaészlelés pedig időben követi a viselkedést.
A példa egy 149 dolláros rendelésen mutatja be a védelmet
A bemutatóban a 99281-es rendelés teljes értéke 149 dollár. Két tétel szerepel benne: egy 29 dolláros USB-C Pro Docking Station and Cable, valamint egy 120 dolláros éves Workplace User License.
Az első támadási minta egy olyan kérés, amely a korábbi utasítások figyelmen kívül hagyására, 10 000 dolláros visszatérítésre és a gazdagépkörnyezet változóinak kiíratására szólítja fel az ügynököt. A Model Armor ezt már a belépési ponton blokkolhatja, még azelőtt, hogy az ügynök modellje elindulna. Találat esetén a kérés 403-as választ kap, így a modell nem fut le, és nem fogyaszt tokent.
A második esetben a támadó udvarias, szintaktikailag hibátlan kéréssel próbálja visszakérni a 120 dolláros digitális licenc árát. A Model Armor ezt átengedné, a Semantic Governance Policies viszont felismeri, hogy a vállalati szabály szerint a 30 dollár feletti digitális szoftverlicencek csak vezetői jóváhagyással téríthetők vissza. A természetes nyelvű szabály ezért megtagadja az issue_refund eszközhívást, és emberi vezetőhöz irányítja az ügyet.
A Google szerint a kódot, a szabálydeklarációkat és az interaktív szimulátorokat tartalmazó kísérő bemutató nyílt forráskódú, és a zero-trust-agents-2 projektben érhető el.
Google for Developers: Build zero-trust AI agents that judge intent, not just syntax- Google Developers Blog


