Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Bécsben vitatták meg az AI-biztonság legfontosabb kérdéseit

2026. augusztus 19.Forrás: FAR.AI
Bécsben vitatták meg az AI-biztonság legfontosabb kérdéseit
Kép: FAR.AI

Az AI-biztonság legfontosabb kutatási és szabályozási kérdéseit vitatták meg a Vienna Alignment Workshop résztvevői. A bécsi eseményen 129 kutató és szakértő vett részt, majd további találkozók folytatták a szakmai eszmecserét.

A lényeg röviden
  • A Vienna Alignment Workshopon 129 résztvevő és 11 meghívott előadó vett részt.
  • A program az AI-biztonság, az értelmezhetőség, az irányítás és a veszélyes képességek kérdéseire összpontosított.
  • A panel résztvevői szerint a technikai megközelítést gazdasági, jogi és társadalmi szempontokkal kell kiegészíteni.
  • Jan Leike a nehéz feladatokat végző AI-rendszerek skálázható felügyeletéről beszélt.
  • Az eseményt Open Social találkozó és Unconference program követte.

Széles körű szakmai találkozó Bécsben

A FAR.AI beszámolója szerint a Vienna Alignment Workshopot 2024. július 21-én rendezték meg, közvetlenül az International Conference on Machine Learning, vagyis az ICML előtt. Az eseményen akadémiai, iparági, kormányzati és nonprofit szervezetek szakértői találkoztak.

A workshop középpontjában az állt, hogyan lehet biztosítani, hogy a fejlett mesterségesintelligencia-rendszerek összhangban maradjanak az emberi értékekkel. A program a garantáltan biztonságos AI, a robusztusság, az értelmezhetőség, az irányítás, a veszélyes képességek értékelése és a skálázható felügyelet kérdéseivel foglalkozott.

A rendezvényen 11 meghívott előadó és 12 rövid előadás szerepelt. A workshopot követő Open Social eseményen körülbelül 250 kutató találkozott, a hétfői Unconference programhoz pedig csaknem 100 résztvevő csatlakozott. Utóbbin 18 rövid előadás, öt tematikus ülés és kötetlen szakmai kapcsolatépítés kapott helyet.

A technikai megoldások mellett társadalmi szempontokra is szükség van

Adam Gleave moderálásával panelbeszélgetés indította a programot. Victoria Krakovna, a Google DeepMind kutatója, David Krueger, a Cambridge-i Egyetem munkatársa, Gillian Hadfield, a Johns Hopkins Egyetem professzora, valamint Robert Trager, az Oxford Martin AI Governance Initiative képviselője az AI által okozott destabilizáció, visszaélés és összehangolatlanság kockázatairól beszélt.

Gillian Hadfield szerint az AI-biztonság nem merül ki az egyes rendszerek összehangolásában. A komplex, több szereplőből álló rendszereket társadalmi és politikai környezetükben is meg kell érteni. A panel résztvevői úgy vélték, hogy a pusztán technikai megközelítés kevés, ezért gazdasági, jogi és társadalmi szempontokat is be kell vonni.

Stuart Russell, a Berkeley-i Kaliforniai Egyetem kutatója az AI-biztonság alapoktól való újragondolását sürgette. Szerinte a biztonsági intézkedéseket már a rendszerek tervezésekor be kell építeni, és formális garanciák nélkül kockázatos pálya előtt állunk. A repülés és az atomenergia biztonsági gyakorlatához hasonló, szigorú mérnöki megközelítést javasolt.

Nicholas Carlini az ellenséges gépi tanulás kutatásának tapasztalatairól beszélt. Arra figyelmeztetett, hogy a kutatóknak körültekintően kell kiválasztaniuk a problémákat, és hatékony értékelési módszereket kell kidolgozniuk, különben hosszú időt fordíthatnak olyan megoldásokra, amelyek végül nem hoznak eredményt.

Értelmezhetőség, irányítás és veszélyes képességek

Neel Nanda a mechanisztikus értelmezhetőségről tartott előadást. Érvelése szerint a mélytanulási modellek működése visszafejthető, és feltárhatók bennük az emberek számára érthető algoritmusok. Saját kutatási példákon keresztül mutatta be, hogyan sikerült dekódolnia egy modell által megtanult algoritmust.

David Bau az AI-rendszerek ellenálló képességét kapcsolta össze az értelmezhetőséggel. Egy, a CrowdStrike globális kiberbiztonsági incidensét követő zürichi helyzetből kiindulva azt hangsúlyozta, hogy a rendszereknek váratlan körülmények között is irányíthatónak kell maradniuk. Ehhez a működésük megértésére, a beavatkozás lehetőségére és a cselekvőképesség fenntartására van szükség.

Helen Toner, a Center for Security and Emerging Technology munkatársa az általános célú fejlett AI irányításáról beszélt. Szerinte a területen elért előrelépéshez világos fogalmakra, megbízható bizonyítékokra és egységes szakértői konszenzusra van szükség.

Mary Phuong a veszélyes képességek értékelését mutatta be. Olyan kutatásokat idézett, amelyekben AI-val támogatott csoportok hatékonyabb biológiai támadásokat terveztek, illetve egy AI önállóan webhelyeket tört fel. Előadása szerint világos beavatkozási küszöbökre van szükség, még azelőtt, hogy a rendszerek veszélyes képességei elérnének egy kritikus szintet.

A felügyelet nehéz feladatoknál válik igazán fontossá

A keynote előadást Jan Leike, az Anthropic kutatója tartotta a nehéz feladatokat végző AI-rendszerek felügyeletéről. A probléma akkor különösen összetett, amikor nincs egyértelmű, ellenőrizhető helyes válasz, vagyis a felügyelő nem fér hozzá közvetlenül a valósághoz.

Leike szerint ilyen helyzetekben új módszerekre, köztük ellenséges értékelésekre van szükség a modellek finom hibáinak felismeréséhez és javításához. A biztonságos bevezetéshez skálázható felügyeletet és olyan technikákat kell kidolgozni, amelyek a modellek képességeit teljesebben feltárják.

A rendezvény rövid előadásai többek között a bizonytalanságot kezelő, emberi visszajelzésen alapuló megerősítéses tanulással, az emberi értékek kontextusfüggő összehangolásával, az AI és az emberek közötti interakciók kialakításával, valamint az ellenséges tréninggel és teszteléssel foglalkoztak. A workshop így a biztonság technikai, társadalmi és irányítási oldalát egyetlen szakmai programban kapcsolta össze.

Kapcsolódó hírek

149 kutató vitatta meg a biztonságos mesterséges intelligencia jövőjét
Biztonság és etika2026. augusztus 19.

149 kutató vitatta meg a biztonságos mesterséges intelligencia jövőjét

A mesterséges intelligencia emberi értékekhez igazításáról és biztonságáról tanácskoztak a New Orleans-i Alignment Workshop résztvevői. A FAR AI által szervezett…

Biztonság és etika
Biztonság és etika2026. július 16.

A londoni ControlConf az AI-rendszerek kijátszásának kockázatait vizsgálta

A London ControlConf 2025 résztvevői azt vizsgálták, hogyan lehet ellenőrzés alatt tartani az egyre fejlettebb AI-rendszereket, köztük azokat, amelyek megpróbálhatják…

160 szakértő vitatta meg az AI-biztonság jövőjét Santa Cruzban
Biztonság és etika2026. július 16.

160 szakértő vitatta meg az AI-biztonság jövőjét Santa Cruzban

160 kutató és vezető találkozott a Bay Area Alignment Workshopon, hogy az AI-rendszerek biztonságáról és társadalmi értékekhez való igazításáról egyeztessen. A kétnapos…