A többügynökös AI-ban a bizalom és az elszámoltathatóság lesz a kulcs

A többügynökös AI-rendszerek vállalatok közötti együttműködést, adatkezelést és feladatvégrehajtást tehetnek lehetővé, de a Salesforce szerint ehhez a biztonsági szemlélet teljes újragondolására van szükség. A cég új tanulmánya a folyamatos ellenőrzést, a külső korlátokat és az emberi felügyeletet emeli ki.
- A Salesforce szerint a többügynökös rendszerek elmosják a vállalati biztonsági határokat.
- A nagy nyelvi modellek belső biztonsági következtetéseit külső, determinisztikus korlátokkal kell kiegészíteni.
- A megosztott memória adatkeveredést és jogosulatlan hozzáférést okozhat.
- Pénzügyi tranzakcióknál, támadásoknál és ismétlődő hibáknál emberi beavatkozásra lehet szükség.
- A Salesforce a teljes autonómia helyett folyamatos ellenőrzésen alapuló elszámoltathatóságot javasol.
Elmosódik a vállalati biztonság határa
A Salesforce október 7-i elemzése szerint a nagy nyelvi modellek elszigetelt használatát fokozatosan felváltják az egymással együttműködő, többügynökös rendszerek. Ezekben különböző szolgáltatók és partnerek ügynökei férhetnek hozzá adatokhoz, illetve hajthatnak végre feladatokat több vállalati platformon keresztül.
A vállalati biztonságot hagyományosan egy kastélyhoz hasonló modellként kezelték, ahol egy jól meghatározható határ választotta el a belső és a külső rendszereket. Az ügynökalapú működésben ez a határ elmosódik, mivel az ügynökök több platformon és ökoszisztémán keresztül dolgoznak.
A Salesforce szerint egy rosszindulatú utasítás akár egy ügynök tudásbázisában vagy korábbi eljárásaiban is megbújhat. Az ügynök ezt később automatikusan végrehajthatja, a hatás pedig a kapcsolódó rendszerekben továbbterjedhet. Ezért a cég a zéró bizalmi modellt, vagyis minden interakció kifejezett és folyamatos ellenőrzését tekinti a megbízható működés alapjának.
A biztonságos gondolkodás önmagában nem elég
A Salesforce 21 iparági, akadémiai és nonprofit szervezet mérnökeit, kutatóit, biztonsági szakértőit és etikai szakembereit vonta be olyan műhelybeszélgetésekbe, amelyek a többügynökös jövő biztonságáról szóltak. A beszélgetések alapján készült új tanulmány több ajánlást fogalmaz meg.
Az egyik központi megállapítás szerint a nagy nyelvi modellek valószínűségi következtetését determinisztikus, előre rögzített korlátokkal kell kiegészíteni. Ezeknek a korlátoknak az ügynök belső következtetési folyamatán kívül kell működniük.
A Salesforce az NVIDIA egyik tanulmányára hivatkozik, amely szerint egy ügynök belső gondolkodásában helyesen felismerheti, hogy egy kérés nem biztonságos, mégis végrehajthatja a káros műveletet. Ilyen lehet például egy fájl jogosultságainak veszélyes szintre módosítása. Külső eszközök csatlakoztatásakor ez a gondolkodás és cselekvés közötti eltérés nem biztonságos függvényhívásokhoz vagy hibás paraméterek továbbításához vezethet. Többügynökös környezetben ebből a Salesforce szerint egymásra épülő incidensek alakulhatnak ki.
A közös memória új adatvédelmi kockázatokat hoz
Az ügynökök a hatékonyság javítása érdekében több munkameneten keresztül is megoszthatnak memóriát. A Salesforce szerint ez úgynevezett „adatpocsolyát” hozhat létre, amelyben összekeveredik a beszélgetési előzmény, a felhasználói preferencia és az érzékeny háttérinformáció.
A jelenség következménye lehet a kontextus összeomlása. Ilyenkor az ügynök egy adott helyzethez tartozó adatot egy másik helyzetben használ fel. A Salesforce erre azt az alapelvet emeli ki, hogy a tárolás nem jelent automatikusan hozzáférést.
A vállalat olyan determinisztikus mechanizmusokat épít, amelyek minden memóriaelemhez tulajdonosi címkét rendelnek. Ez azonosítja az adatot létrehozó felhasználót és AI-asszisztenst, és a cég állítása szerint megakadályozza, hogy egy felhasználó beszélgetési előzménye más felhasználó vagy más AI-ügynök számára láthatóvá váljon. A rendszer a bejelentkezett személy alapján is ellenőrzi a hozzáférést, továbbá szűrőkkel akadályozza az érzékeny adatok külső AI-eszközökhöz továbbítását.
Az emberi felügyelet határát még keresik
A Salesforce három fő sérülékenységet emel ki: a hibák tovagyűrűzését, a kommunikációs zavarokat és az eltérő célokat. Egyetlen hibás függvényhívás további meghibásodásokat indíthat el. A nagy nyelvi modellek megfelelési hajlama pedig végtelen, hízelgő párbeszédeket okozhat, amelyek működésképtelennek láttatják a rendszert.
A cég szerint emberi beavatkozásra lehet szükség jelentős pénzügyi tranzakciók, alacsony bizonyosságú döntések, észlelt utasításbefecskendezési támadások, valamint ismétlődő hibaciklusok esetén. Ehhez előre meg kell határozni, mikor kérjen az ügynök jóváhagyást, és mikor adja át a feladatot egy embernek.
A Salesforce szerint az iparágnak egyelőre nincs végleges megoldása arra, hogyan lehet egyszerre biztosítani a szükséges felügyeletet és az autonóm működés méretezhetőségét. A vállalat által felvázolt irány a teljes autonómia helyett az elszámoltathatóságra épít: minden ügynök személyazonosságát, műveletét és hozzáférését folyamatosan, kifejezetten kell ellenőrizni. Ez a megközelítés lehet a vállalati bevezetés bizalmi alapja.
Salesforce: From Autonomy to Accountability: How to Think About Trust in the Multi-Agent Future


