A londoni ControlConf az AI-rendszerek kijátszásának kockázatait vizsgálta
A London ControlConf 2025 résztvevői azt vizsgálták, hogyan lehet ellenőrzés alatt tartani az egyre fejlettebb AI-rendszereket, köztük azokat, amelyek megpróbálhatják kijátszani a biztonsági intézkedéseket. A konferenciát a Redwood Research, a FAR.AI és a brit AI Security Institute szervezte.
- A ControlConf 2025 március 27-én és 28-án zajlott Londonban.
- A résztvevők az AI-rendszerek kontrolljának és a védelem kijátszásának kockázatait vizsgálták.
- A bemutatott témák között szerepelt a resampling, a monitorozás és a feladatbontás.
- A kutatók az alacsony kockázatú kutatási szabotázs és a hátsó ajtók problémáját is tárgyalták.
- A konferencia teljes felvételei a FAR.AI YouTube-csatornáján érhetők el.
Az AI-kontroll alapvető kihívásai
A március 27-én és 28-án rendezett londoni esemény kutatókat, nonprofit szervezeteket és más szakértőket hozott össze. A szervezők szerint az AI-képességek gyors fejlődése miatt egyre sürgetőbb felkészülni azokra a biztonsági kockázatokra, amelyek akkor jelentkezhetnek, ha egy rendszer maga próbálja aláásni a védelmi mechanizmusokat.
A Redwood Research munkatársa, Aryan Bhatt a „defer to resample” módszert mutatta be. Ennek lényege, hogy egy gyanús parancs esetén a rendszer új mintavételezést végezhet, ahelyett hogy automatikusan a megbízható, de kevésbé fejlett modell döntésére hagyatkozna. Fabien Roger, az Anthropic kutatója a kontrollprotokollok gyakorlati bevezetésének nehézségeiről beszélt. A költségeket és a biztonságot akadályként emelte ki, miközben az API-k monitorozását egyre megvalósíthatóbb és szükségesebb intézkedésnek nevezte.
Értelmezhetőség, szabotázs és biztonsági értékelések
Neel Nanda, a Google DeepMind munkatársa az AI-rendszerek értelmezhetőségéről és irányításáról beszélgetett. A témák között szerepelt a ritka autoenkóderek iránti lelkesedés csökkenése, valamint az elmozdulás a teljes megértés céljától a gyakorlatias problémamegoldás felé.
Vivek Hebbar a kutatási szabotázs alacsony kockázatú formáit ismertette. Ilyen lehet például, ha egy AI visszatartja a legjobb ötleteit, vagy apró hibákat épít a kísérletekbe, amelyek végül hibás eredményekhez vezetnek. Tomek Korbak, az AI Security Institute munkatársa olyan biztonsági esetkeretrendszert mutatott be, amely a modell képességeinek, a telepítési környezetnek és a lehetséges kockázatoknak az elemzésére épít.
Steve Kelly, az Institute for Security and Technology vezető bizalmi tisztviselője a nemzetbiztonsági gyakorlatokból származó tanulságokról beszélt. A munkába állás előtti ellenőrzést, a folyamatos megfigyelést és az incidensekre adott válaszok megtervezését emelte ki, miközben a biztonság és a kényelem közötti kompromisszumokra is felhívta a figyelmet.
Több monitor és új kontrollprotokollok
A konferencia előadásai között olyan kutatás is szerepelt, amely azt vizsgálta, képesek e a nyelvi modellek memória nélkül is stratégiát kialakítani a kontrollprotokollok kijátszására. A bemutatott módszer korai figyelmeztető jelek azonosítását célozza.
Tim Hua, a MARS kutatója a hierarchikus monitorozást ismertette. Ez a protokoll egyetlen monitor helyett két, eltérő képességű megbízható monitort alkalmazott, és a bemutatott eredmények szerint ugyanakkora költségkeret mellett jobb biztonsági eredményt produkált. Más előadók a promptinjekciók és a jailbreak támadások elleni védekezést, a hátsó ajtók felismerését, valamint az összetett feladatok kisebb, elkülönített részfeladatokra bontását vizsgálták.
A FAR.AI összefoglalója szerint a ControlConf azt mutatta, hogy az AI-kontroll kérdései már jelenlegi biztonsági problémák. A konferencia teljes felvételei elérhetők a FAR.AI YouTube-csatornáján.
FAR.AI: London ControlConf 2025 | FAR.AI
