Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az AI-kontroll kutatási témából a vezető laborok gyakorlatává vált

2026. július 16.Forrás: FAR.AI

Az AI-kontroll a kutatási beszélgetések szintjéről a vezető AI-laborok gyakorlati munkájába lépett át. A FAR.AI és a Redwood Research második ControlConf rendezvényén 200 kutató, mérnök és szakpolitikai szakértő vitatta meg a terület eredményeit és nyitott kérdéseit.

A lényeg röviden
  • A második ControlConf rendezvényen 200 résztvevő vitatta meg az AI-kontroll fejlődését.
  • Az OpenAI és az Anthropic jelenlegi belső kontrollmegoldásokról számolt be.
  • Az AI-kontroll azt vizsgálja, hogy a védelmek működnek-e egy azokat kijátszani próbáló modellel szemben.
  • A konferencia három fő kérdése a beavatkozások időzítése, a külső ellenőrzés és az értékelhetőség volt.
  • A FAR.AI szerint a terület még több alapvető kérdésre keresi a választ.

A rendezvényen a vezető laborok gyakorlata is megjelent

A kétnapos eseményt 2026 áprilisában rendezte meg közösen a FAR.AI és a Redwood Research. A résztvevők között kutatók, laboratóriumi mérnökök és szakpolitikai szakértők voltak. Az OpenAI és az Anthropic képviselői jelenlegi belső kontrollmegoldásokról beszéltek, míg a külső értékelésekről többek között az ML Evaluation and Threat Research, vagyis a METR munkatársai tartottak előadásokat.

A programban szerepelt harmadik fél által végzett kontrollértékelés, beágyazott vörös csapatos tesztelés és nyilvánosan ellenőrizhető irányítási megoldás is. Több előadó olyan fenyegetési modelleket mutatott be, amelyeket a terület korábban kevésbé vett figyelembe. Ilyen volt a nem összeesküvő modellek kontrollja, az adatmérgezés és a monitorokat megkerülő rejtett gondolkodás.

A hétvége előadásokból, gyakorlati bemutatókból, fogadóórákból, kötetlen beszélgetésekből és kapcsolatépítésből állt.

Mit jelent az AI-kontroll?

Az AI-kontroll célja a célvezérelt összehangolatlanságból eredő kockázatok mérséklése abból a feltételezésből kiindulva, hogy az összehangolatlanság már kialakult. A megközelítés a modellfejlesztés több szakaszában alkalmazható, így a tanítás, a bevezetés előtti tesztelés és a működtetés során is.

A központi kérdés az, hogy egy biztonsági vagy védelmi technika akkor is működne-e, ha a modell aktívan megpróbálná kijátszani. A FAR.AI szerint ez a biztonsági problémát képességkérdéssé alakítja: azt kell vizsgálni, hogy a modell képes-e legyőzni az adott védelmet. A szervezet szerint ez empirikusan könnyebben megválaszolható, mint az, hogy a modell összehangolt-e.

Az AI-kontroll egyszerre jelenthet kockázatértékelési megközelítést és olyan technikák csoportját, amelyek megfelelnek ezeknek az értékeléseknek.

A laborok már kontrollhoz kapcsolódó rendszereket használnak

A FAR.AI beszámolója szerint egy évvel korábban az AI-kontroll főként kutatási témának számított, szétszórt tanulmányokkal, néhány blogbejegyzéssel és az Egyesült Királyság AI Safety Institute-jánál, valamint az Anthropicnál működő külön csapatokkal. Azóta több gyakorlati példa is megjelent.

Az OpenAI arról számol be, hogy belső kódolóügynökének forgalmát olyan fejlett modellekkel figyeli, amelyek hozzáférnek a gondolatmenethez. A vállalat nem tapasztalt összeesküvő viselkedést, más szabálytalansági kategóriákat azonban észlel. Az Anthropic Claude Code rendszere automatikus módot is kapott, amelyben a modell műveletenként dönt a jogosultságokról, ahelyett hogy minden parancsról a felhasználót kérdezné.

Az Anthropic és a Meta újabb rendszerkártyái szabotázsértékeléseket is tartalmaznak. Ezekben egy fő feladat mellé rejtett mellékfeladat társul, hogy kiderüljön, képes-e az ügynök észrevétlenül teljesíteni a másodlagos célt. A METR munkatársa, David Rein három héten át tesztelte az Anthropic belső ügynökmegfigyelési és biztonsági rendszereinek egy részét.

Nyitott kérdések a jelenlegi biztonsági megoldásokról

A konferencián több előadó olyan időpontokat vizsgált, amikor az AI-kontroll különösen fontos lehet. Az AI Futures Model 25. percentilis becslése szerint automatizált kódoló 2028 közepére, szuperintelligens AI-kutató 2029 elejére, mesterséges szuperintelligencia pedig 2029 közepére jelenhet meg. A forrás szerint ezek becslések, és a konferencia résztvevői közül többen úgy látták, hogy a legnagyobb kockázatok jelenleg még nem állnak fenn.

A résztvevők három stratégiai kérdést emeltek ki. Az első az egyszerű, rövid távú célokra épülő és a hosszabb távú beavatkozások közötti különbség. Aryan Bhatt szerint a monitorozható gondolatmenet elvesztése vagy a folyamatos tanulás elterjedése több jelenlegi technikát elavulttá tehet. Bowen Baker, az OpenAI munkatársa a monitorozhatóság törékenységéről beszélt, és arról, hogy csapata ennek követésére értékeléseket tesz közzé.

A második kérdés a laborokon kívüli nyomásgyakorlás szerepe. Tanya Verma szerint a belső kontrollok önmagukban nem elegendők, ezért olyan biztonságos hardveres elkülönítést mutatott be, amely külső felek számára auditot tehet lehetővé a munkaterhelés felfedése nélkül. A harmadik kérdés az ellenőrizhetőség: a kontrollprotokollok külső vizsgálhatósága meghatározza, hogy valódi külső kontrollként működhetnek-e.

A FAR.AI szerint ezekre a kérdésekre még nincs lezárt válasz. A terület technikai eszköztára gyorsan bővül, és az, hogy mikor, milyen mértékben, illetve mennyire ellenőrizhető módon alkalmazzák ezeket a megoldásokat, meghatározhatja az AI-kontroll további fejlődését.

Kapcsolódó hírek

A látens gondolkodás veszélyeztetheti az AI-k legfontosabb felügyeleti eszközét
Cégek és üzlet2026. szeptember 23.

A látens gondolkodás veszélyeztetheti az AI-k legfontosabb felügyeleti eszközét

A Redwood Research szerint a látens állapotokban végzett, hosszabb gondolkodás jelentősen gyengítheti a láncolt gondolatmenet, vagyis a chain of thought felügyeleti…

Biztonság és etika
Biztonság és etika2026. szeptember 14.

A GPT-5.1 és a Claude Opus 4.5 javult, a Gemini 3 Pro romlott

A FAR.AI új tesztje szerint az OpenAI GPT-5.1 és az Anthropic Claude Opus 4.5 közel nullára csökkentette a meggyőzési kísérleteket ártalmas témákban. A Google Gemini 3…

Biztonság és etika
Biztonság és etika2026. július 16.

A londoni ControlConf az AI-rendszerek kijátszásának kockázatait vizsgálta

A London ControlConf 2025 résztvevői azt vizsgálták, hogyan lehet ellenőrzés alatt tartani az egyre fejlettebb AI-rendszereket, köztük azokat, amelyek megpróbálhatják…