Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A londoni ControlConf az AI-rendszerek kijátszásának kockázatait vizsgálta

2026. július 16.Forrás: FAR.AI

A London ControlConf 2025 résztvevői azt vizsgálták, hogyan lehet ellenőrzés alatt tartani az egyre fejlettebb AI-rendszereket, köztük azokat, amelyek megpróbálhatják kijátszani a biztonsági intézkedéseket. A konferenciát a Redwood Research, a FAR.AI és a brit AI Security Institute szervezte.

A lényeg röviden
  • A ControlConf 2025 március 27-én és 28-án zajlott Londonban.
  • A résztvevők az AI-rendszerek kontrolljának és a védelem kijátszásának kockázatait vizsgálták.
  • A bemutatott témák között szerepelt a resampling, a monitorozás és a feladatbontás.
  • A kutatók az alacsony kockázatú kutatási szabotázs és a hátsó ajtók problémáját is tárgyalták.
  • A konferencia teljes felvételei a FAR.AI YouTube-csatornáján érhetők el.

Az AI-kontroll alapvető kihívásai

A március 27-én és 28-án rendezett londoni esemény kutatókat, nonprofit szervezeteket és más szakértőket hozott össze. A szervezők szerint az AI-képességek gyors fejlődése miatt egyre sürgetőbb felkészülni azokra a biztonsági kockázatokra, amelyek akkor jelentkezhetnek, ha egy rendszer maga próbálja aláásni a védelmi mechanizmusokat.

A Redwood Research munkatársa, Aryan Bhatt a „defer to resample” módszert mutatta be. Ennek lényege, hogy egy gyanús parancs esetén a rendszer új mintavételezést végezhet, ahelyett hogy automatikusan a megbízható, de kevésbé fejlett modell döntésére hagyatkozna. Fabien Roger, az Anthropic kutatója a kontrollprotokollok gyakorlati bevezetésének nehézségeiről beszélt. A költségeket és a biztonságot akadályként emelte ki, miközben az API-k monitorozását egyre megvalósíthatóbb és szükségesebb intézkedésnek nevezte.

Értelmezhetőség, szabotázs és biztonsági értékelések

Neel Nanda, a Google DeepMind munkatársa az AI-rendszerek értelmezhetőségéről és irányításáról beszélgetett. A témák között szerepelt a ritka autoenkóderek iránti lelkesedés csökkenése, valamint az elmozdulás a teljes megértés céljától a gyakorlatias problémamegoldás felé.

Vivek Hebbar a kutatási szabotázs alacsony kockázatú formáit ismertette. Ilyen lehet például, ha egy AI visszatartja a legjobb ötleteit, vagy apró hibákat épít a kísérletekbe, amelyek végül hibás eredményekhez vezetnek. Tomek Korbak, az AI Security Institute munkatársa olyan biztonsági esetkeretrendszert mutatott be, amely a modell képességeinek, a telepítési környezetnek és a lehetséges kockázatoknak az elemzésére épít.

Steve Kelly, az Institute for Security and Technology vezető bizalmi tisztviselője a nemzetbiztonsági gyakorlatokból származó tanulságokról beszélt. A munkába állás előtti ellenőrzést, a folyamatos megfigyelést és az incidensekre adott válaszok megtervezését emelte ki, miközben a biztonság és a kényelem közötti kompromisszumokra is felhívta a figyelmet.

Több monitor és új kontrollprotokollok

A konferencia előadásai között olyan kutatás is szerepelt, amely azt vizsgálta, képesek e a nyelvi modellek memória nélkül is stratégiát kialakítani a kontrollprotokollok kijátszására. A bemutatott módszer korai figyelmeztető jelek azonosítását célozza.

Tim Hua, a MARS kutatója a hierarchikus monitorozást ismertette. Ez a protokoll egyetlen monitor helyett két, eltérő képességű megbízható monitort alkalmazott, és a bemutatott eredmények szerint ugyanakkora költségkeret mellett jobb biztonsági eredményt produkált. Más előadók a promptinjekciók és a jailbreak támadások elleni védekezést, a hátsó ajtók felismerését, valamint az összetett feladatok kisebb, elkülönített részfeladatokra bontását vizsgálták.

A FAR.AI összefoglalója szerint a ControlConf azt mutatta, hogy az AI-kontroll kérdései már jelenlegi biztonsági problémák. A konferencia teljes felvételei elérhetők a FAR.AI YouTube-csatornáján.

Kapcsolódó hírek

149 kutató vitatta meg a biztonságos mesterséges intelligencia jövőjét
Biztonság és etika2026. augusztus 19.

149 kutató vitatta meg a biztonságos mesterséges intelligencia jövőjét

A mesterséges intelligencia emberi értékekhez igazításáról és biztonságáról tanácskoztak a New Orleans-i Alignment Workshop résztvevői. A FAR AI által szervezett…

Biztonság és etika
Biztonság és etika2026. július 16.

Így ellenőriznék az AI-modelleket hozzáférés nélkül

Több mint 100 kutató és mérnök vizsgálta az AVID Workshopon, hogyan lehet megbízható bizonyítékot szerezni az AI-rendszerek működéséről a modell súlyai és a fejlesztési…

Biztonság és etika
Biztonság és etika2026. július 16.

Az AI-kontroll kutatási témából a vezető laborok gyakorlatává vált

Az AI-kontroll a kutatási beszélgetések szintjéről a vezető AI-laborok gyakorlati munkájába lépett át. A FAR.AI és a Redwood Research második ControlConf rendezvényén…