Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

160 szakértő vitatta meg az AI-biztonság jövőjét Santa Cruzban

2026. július 16.Forrás: FAR.AI
160 szakértő vitatta meg az AI-biztonság jövőjét Santa Cruzban
Kép: FAR.AI

160 kutató és vezető találkozott a Bay Area Alignment Workshopon, hogy az AI-rendszerek biztonságáról és társadalmi értékekhez való igazításáról egyeztessen. A kétnapos eseményen az értékelés, a robusztusság, az értelmezhetőség és az irányítás kérdései kerültek középpontba.

A lényeg röviden
  • 160 szakértő vett részt a 2024. október 24én és 25én rendezett workshopon.
  • A fő témák között az AI értékelése, robusztussága, értelmezhetősége és irányítása szerepelt.
  • Az előadók a modellmanipuláció, a megtévesztés és az össze nem hangolt célok kockázatait vizsgálták.
  • A résztvevők nyílt értékeléseket és harmadik fél által végzett tesztelést is támogattak.
  • A FAR.AI elérhetővé tette a teljes előadások felvételeit.

Kutatók és döntéshozók vitatták meg az AI kockázatait

A FAR.AI beszámolója szerint a workshopot 2024. október 24én és 25én rendezték meg Santa Cruzban. Az eseményen az akadémiai szféra, az ipar, a kormányzat és nonprofit szervezetek 160 kutatója és vezetője vett részt.

A találkozó célja az volt, hogy a résztvevők az AI jövőjét a biztonság és a társadalmi értékekkel való összehangolás irányába tereljék. Több párhuzamos szekció és rövid előadás adott lehetőséget arra, hogy a résztvevők részletesen tárgyalják a fejlett AI-rendszerek kockázatait és a lehetséges védelmi módszereket.

Az esti nyílt beszélgetések között szó esett arról, hogy elegendőek e a jelenlegi biztonsági intézkedések, valamint külön beszélgetést szenteltek az SB 1047 törvény utólagos értékelésének.

Értékelés, felügyelet és értelmezhetőség

Anca Dragan, a Google DeepMind AI biztonságért és összehangolásért felelős igazgatója a hibás jutalmazási modellekből fakadó, össze nem hangolt célok kockázatáról beszélt. Szerinte a mesterséges intelligencia teljesítményének növekedésével egyre fontosabbá válik a robusztus fenyegetésmodellezés.

Beth Barnes, a METR munkatársa, szigorú értékelési módszereket sürgetett, amelyek a fejlett AI kockázatait mérik és előre jelezhetik. Az értékelések nyílt forrásúvá tételét is támogatta, mert ez szerinte növelheti az átláthatóságot és az együttműködést a vezető modellfejlesztők között.

Buck Shlegeris a megbízható megfigyelésről, az összejátszás felismeréséről és az ellenséges tesztelésről beszélt. Julian Michael a vitára épülő felügyeletet vizsgálta, amelyben az AI-rendszerek strukturált érvelése segítheti az embereket összetett, nagy tétű feladatok értékelésében.

Az értelmezhetőség témájában Atticus Geiger a modellek működésének ember számára érthető algoritmusokhoz való kapcsolását szorgalmazta. Andy Zou pedig felülről lefelé haladó megközelítést mutatott be, amely a teljes modell viselkedésére összpontosít az egyes neuronok helyett.

Robusztusság és szabályozás a középpontban

A robusztusságról szóló előadások a modellek sérülékenységeit és a tesztelés korlátait vizsgálták. Stephen Casper harmadik fél által végzett értékeléseket sürgetett, és arról beszélt, hogy a modellmanipulációs támadások olyan problémákat is feltárhatnak, amelyeket a szokásos tesztek nem mutatnak ki. Alex Wei szerint a válaszadás előtti érvelés segíthet az ellenséges támadások és a kijátszási kísérletek kivédésében.

Adam Gleave azt vizsgálta, hogy a modellek egyszerű méretnövelése önmagában javítja e a robusztusságot. Előadásában az ellenséges tanítás korlátairól és a hatékonyabb biztonsági megoldások szükségességéről beszélt.

A kormányzati és biztonsági szekcióban az Egyesült Államok, az Egyesült Királyság, az Európai Unió és Kína AI politikájáról is szó esett. Kwan Yee Ng Kína kötelező biztonsági szabályozását és a Pekingben, illetve Sanghajban működő regionális kísérleti programokat ismertette. A beszámoló szerint Kína az AI biztonságát nemzetbiztonsági és közbiztonsági kérdésként kezeli.

A résztvevők további együttműködést sürgettek

A második napon a rövid előadások az irányítás, az értékelés és a magasabb szintű biztonsági kérdések felé fordultak. Dawn Song a felelős AI fejlesztés társadalmi és technikai megközelítését hangsúlyozta, Shayne Longpre pedig az AI értékelését és a vörös csapatos tesztelést támogató biztonságos jogi keret ötletét mutatta be.

A FAR.AI szerint a workshop erősítette az AI biztonságával foglalkozó közösség együttműködését. A szervezet a teljes előadássorozat felvételeit a weboldalán és YouTube csatornáján tette elérhetővé, a jövőbeli Alignment Workshopok iránt érdeklődők pedig regisztrálhatják érdeklődésüket.

A rendezvény témái azt mutatják, hogy a résztvevők a biztonságot több oldalról közelítik meg. A modellek tesztelése, működésük értelmezése, a manipuláció felismerése és a kormányzati szabályozás egyaránt része annak a munkának, amelyet a FAR.AI szerint a fejlett AI-rendszerek társadalmi értékekhez igazítása igényel.

Kapcsolódó hírek

Bécsben vitatták meg az AI-biztonság legfontosabb kérdéseit
Biztonság és etika2026. augusztus 19.

Bécsben vitatták meg az AI-biztonság legfontosabb kérdéseit

Az AI-biztonság legfontosabb kutatási és szabályozási kérdéseit vitatták meg a Vienna Alignment Workshop résztvevői. A bécsi eseményen 129 kutató és szakértő vett részt…

149 kutató vitatta meg a biztonságos mesterséges intelligencia jövőjét
Biztonság és etika2026. augusztus 19.

149 kutató vitatta meg a biztonságos mesterséges intelligencia jövőjét

A mesterséges intelligencia emberi értékekhez igazításáról és biztonságáról tanácskoztak a New Orleans-i Alignment Workshop résztvevői. A FAR AI által szervezett…

Biztonság és etika
Biztonság és etika2026. július 16.

Az AI-kontroll kutatási témából a vezető laborok gyakorlatává vált

Az AI-kontroll a kutatási beszélgetések szintjéről a vezető AI-laborok gyakorlati munkájába lépett át. A FAR.AI és a Redwood Research második ControlConf rendezvényén…