Az AI-kontroll kutatási témából a vezető laborok gyakorlatává vált
Az AI-kontroll a kutatási beszélgetések szintjéről a vezető AI-laborok gyakorlati munkájába lépett át. A FAR.AI és a Redwood Research második ControlConf rendezvényén 200 kutató, mérnök és szakpolitikai szakértő vitatta meg a terület eredményeit és nyitott kérdéseit.
- A második ControlConf rendezvényen 200 résztvevő vitatta meg az AI-kontroll fejlődését.
- Az OpenAI és az Anthropic jelenlegi belső kontrollmegoldásokról számolt be.
- Az AI-kontroll azt vizsgálja, hogy a védelmek működnek-e egy azokat kijátszani próbáló modellel szemben.
- A konferencia három fő kérdése a beavatkozások időzítése, a külső ellenőrzés és az értékelhetőség volt.
- A FAR.AI szerint a terület még több alapvető kérdésre keresi a választ.
A rendezvényen a vezető laborok gyakorlata is megjelent
A kétnapos eseményt 2026 áprilisában rendezte meg közösen a FAR.AI és a Redwood Research. A résztvevők között kutatók, laboratóriumi mérnökök és szakpolitikai szakértők voltak. Az OpenAI és az Anthropic képviselői jelenlegi belső kontrollmegoldásokról beszéltek, míg a külső értékelésekről többek között az ML Evaluation and Threat Research, vagyis a METR munkatársai tartottak előadásokat.
A programban szerepelt harmadik fél által végzett kontrollértékelés, beágyazott vörös csapatos tesztelés és nyilvánosan ellenőrizhető irányítási megoldás is. Több előadó olyan fenyegetési modelleket mutatott be, amelyeket a terület korábban kevésbé vett figyelembe. Ilyen volt a nem összeesküvő modellek kontrollja, az adatmérgezés és a monitorokat megkerülő rejtett gondolkodás.
A hétvége előadásokból, gyakorlati bemutatókból, fogadóórákból, kötetlen beszélgetésekből és kapcsolatépítésből állt.
Mit jelent az AI-kontroll?
Az AI-kontroll célja a célvezérelt összehangolatlanságból eredő kockázatok mérséklése abból a feltételezésből kiindulva, hogy az összehangolatlanság már kialakult. A megközelítés a modellfejlesztés több szakaszában alkalmazható, így a tanítás, a bevezetés előtti tesztelés és a működtetés során is.
A központi kérdés az, hogy egy biztonsági vagy védelmi technika akkor is működne-e, ha a modell aktívan megpróbálná kijátszani. A FAR.AI szerint ez a biztonsági problémát képességkérdéssé alakítja: azt kell vizsgálni, hogy a modell képes-e legyőzni az adott védelmet. A szervezet szerint ez empirikusan könnyebben megválaszolható, mint az, hogy a modell összehangolt-e.
Az AI-kontroll egyszerre jelenthet kockázatértékelési megközelítést és olyan technikák csoportját, amelyek megfelelnek ezeknek az értékeléseknek.
A laborok már kontrollhoz kapcsolódó rendszereket használnak
A FAR.AI beszámolója szerint egy évvel korábban az AI-kontroll főként kutatási témának számított, szétszórt tanulmányokkal, néhány blogbejegyzéssel és az Egyesült Királyság AI Safety Institute-jánál, valamint az Anthropicnál működő külön csapatokkal. Azóta több gyakorlati példa is megjelent.
Az OpenAI arról számol be, hogy belső kódolóügynökének forgalmát olyan fejlett modellekkel figyeli, amelyek hozzáférnek a gondolatmenethez. A vállalat nem tapasztalt összeesküvő viselkedést, más szabálytalansági kategóriákat azonban észlel. Az Anthropic Claude Code rendszere automatikus módot is kapott, amelyben a modell műveletenként dönt a jogosultságokról, ahelyett hogy minden parancsról a felhasználót kérdezné.
Az Anthropic és a Meta újabb rendszerkártyái szabotázsértékeléseket is tartalmaznak. Ezekben egy fő feladat mellé rejtett mellékfeladat társul, hogy kiderüljön, képes-e az ügynök észrevétlenül teljesíteni a másodlagos célt. A METR munkatársa, David Rein három héten át tesztelte az Anthropic belső ügynökmegfigyelési és biztonsági rendszereinek egy részét.
Nyitott kérdések a jelenlegi biztonsági megoldásokról
A konferencián több előadó olyan időpontokat vizsgált, amikor az AI-kontroll különösen fontos lehet. Az AI Futures Model 25. percentilis becslése szerint automatizált kódoló 2028 közepére, szuperintelligens AI-kutató 2029 elejére, mesterséges szuperintelligencia pedig 2029 közepére jelenhet meg. A forrás szerint ezek becslések, és a konferencia résztvevői közül többen úgy látták, hogy a legnagyobb kockázatok jelenleg még nem állnak fenn.
A résztvevők három stratégiai kérdést emeltek ki. Az első az egyszerű, rövid távú célokra épülő és a hosszabb távú beavatkozások közötti különbség. Aryan Bhatt szerint a monitorozható gondolatmenet elvesztése vagy a folyamatos tanulás elterjedése több jelenlegi technikát elavulttá tehet. Bowen Baker, az OpenAI munkatársa a monitorozhatóság törékenységéről beszélt, és arról, hogy csapata ennek követésére értékeléseket tesz közzé.
A második kérdés a laborokon kívüli nyomásgyakorlás szerepe. Tanya Verma szerint a belső kontrollok önmagukban nem elegendők, ezért olyan biztonságos hardveres elkülönítést mutatott be, amely külső felek számára auditot tehet lehetővé a munkaterhelés felfedése nélkül. A harmadik kérdés az ellenőrizhetőség: a kontrollprotokollok külső vizsgálhatósága meghatározza, hogy valódi külső kontrollként működhetnek-e.
A FAR.AI szerint ezekre a kérdésekre még nincs lezárt válasz. A terület technikai eszköztára gyorsan bővül, és az, hogy mikor, milyen mértékben, illetve mennyire ellenőrizhető módon alkalmazzák ezeket a megoldásokat, meghatározhatja az AI-kontroll további fejlődését.
