149 kutató vitatta meg a biztonságos mesterséges intelligencia jövőjét

A mesterséges intelligencia emberi értékekhez igazításáról és biztonságáról tanácskoztak a New Orleans-i Alignment Workshop résztvevői. A FAR AI által szervezett eseményen 149 résztvevő, 12 előadás és 25 rövid prezentáció szerepelt.
- A workshopot 2023. december 10-én és 11-én tartották New Orleansban.
- A FAR AI rendezvényén 149 résztvevő, 12 előadás és 25 rövid prezentáció szerepelt.
- Yoshua Bengio a biztonsági garanciákról és a demokratikus AI-kormányzásról beszélt.
- A program az AI-felügyeletet, értelmezhetőséget, robusztusságot és kormányzást vizsgálta.
- Zico Kolter élő bemutatóban szemléltette GPT-3.5 jailbreakelését.
Iparági, akadémiai és civil szereplők egy helyen
A NOLA Alignment Workshop 2023-at 2023. december 10-én és 11-én rendezték meg, közvetlenül a NeurIPS konferencia előtt. A FAR AI által szervezett esemény célja az volt, hogy összehozza azokat a kutatókat, akik a fejlett mesterséges intelligencia rendszereinek emberi értékekhez igazításán és biztonságán dolgoznak.
A résztvevők között az OpenAI, a Google DeepMind és az Anthropic munkatársai, valamint a UC Berkeley, az MIT és a Mila kutatói is jelen voltak. A beszélgetésekhez nonprofit szervezetek, köztük a Center for AI Safety és a Cooperative AI Foundation tagjai, továbbá különböző kormányzati ügynökségek képviselői is hozzájárultak.
Az eseményen Yoshua Bengio Turing-díjas kutató tartott vitaindító előadást. A programban 12 előadás és 25 rövid prezentáció kapott helyet, az esti közösségi rendezvény pedig több mint 500 vendéget vonzott.
Felügyelet, értelmezhetőség és általánosítás
A nyitóbeszédben Richard Ngo arról beszélt, hogy a különböző megközelítéseket konkrét kutatási irányok köré kell szervezni. Tim Lillicrap személyes tapasztalatain keresztül hangsúlyozta a mesterséges intelligencia biztonságával kapcsolatos sürgősséget és a nyitott együttműködés szükségességét.
Yoshua Bengio a kvantitatív biztonsági garanciákról és az összehangolásról beszélt. Előadásában a Bayes-módszerek mesterségesintelligencia-összehangolásban betöltött szerepét, valamint a GFlowNets lehetséges alkalmazását vizsgálta Bayes-féle struktúrafel tanulásban. Bengio demokratikusan irányított AI-laborok hálózatát is javasolta a technológiai fejlődés kihívásainak kezelésére.
Sam Bowman a skálázható felügyelet és az igazmondás kérdését mutatta be. Az általa ismertetett AI-vitákban a modellek egy kérdés két oldalán érvelnek, hogy az emberi értékelők könnyebben megtalálják a bizonyítékokkal jobban alátámasztott választ. A tesztek pontosabb következtetéseket jeleztek, bár a viták összetettségének és hosszának korlátozása továbbra is nehézséget jelent.
Been Kim az emberi és gépi fogalomértelmezés összehangolásának problémáit vizsgálta, Roger Grosse pedig az úgynevezett hatásfüggvények használatát mutatta be. Ezek segítségével felmérhető, hogy a tanítási adatok mely részei befolyásolták leginkább egy nyelvi modell adott kimenetét.
Jailbreak, kormányzás és jövőbeli kockázatok
Zico Kolter élő bemutatóban szemléltette az összehangolt nyelvi modellek elleni támadások kockázatait. A prezentáció során GPT-3.5-t próbált meg rávenni arra, hogy segítsen egy autó forró bekötésében. A FAR AI beszámolója szerint a bemutató a rendszerek teljesítményét és sérülékenységét egyaránt érzékeltette.
Collin Burns az OpenAI olyan kísérleteiről beszélt, amelyekben kisebb AI-modelleket használnak nagyobb modellek felügyeletére. Gillian Hadfield az AI leállítására szolgáló mechanizmusokról, szabályozásról és nemzeti AI-nyilvántartásról adott elő, valamint robusztus jogi infrastruktúrát és gazdasági ösztönzőket sürgetett.
Owain Evans az úgynevezett kontextuson kívüli következtetés veszélyeit ismertette. Szerinte ez a képesség a jövőbeli modellek számára lehetővé teheti az értékelések kijátszását. A FAR AI összefoglalója szerint jelenleg még a fejlett modellek, például a GPT-4 is nehezen birkóznak meg az összetett, kontextuson kívüli következtetésekkel, a jövőbeli rendszerek vizsgálatához azonban gondos értékelésre lesz szükség.
A rövid előadások a komplex rendszerek megközelítését, a többügynökös kockázatokat, az együttműködő AI alapjait és az emberi részvétel fenntartását is érintették. A FAR AI szerint a workshop az iparág, a tudomány, a nonprofit szféra és a kormányzat szereplőinek együttműködését erősítette, a teljes előadások pedig a szervezet weboldalán és YouTube-csatornáján érhetők el.
FAR.AI: NOLA Alignment Workshop 2023 | FAR.AI