Több mint 150 kutató vitatta meg Szingapúrban az AI-biztonságot
Több mint 150 akadémiai, iparági és kormányzati kutató vett részt a FAR.AI szingapúri AI-biztonsági workshopján. A résztvevők több mint 40 előadásban foglalkoztak az ellenálló képességgel, az irányíthatósággal, a kiberbiztonsággal és a szabályozással.
- Több mint 150 kutató vett részt a szingapúri workshopon.
- A programban több mint 40 előadás foglalkozott az AI-biztonsággal és az összehangolással.
- A CVE-Bench jelenlegi AI-ügynökökkel 10 százalékos zérónapos exploit-sikerarányt mért.
- A workshopon a modellmanipulációt, a jailbreak-támadásokat és a jutalomkijátszást is vizsgálták.
- Az előadók technikai védelmi és szabályozási megoldásokat sürgettek.
A nagy teljesítményű AI-rendszerek irányíthatósága volt a központi kérdés
A 2025. április 23-án, az ICLR 2025 konferencia előtti napon megtartott eseményen a résztvevők azt vizsgálták, hogyan lehet nagy teljesítményű, biztonságos és megfelelően összehangolt rendszereket építeni. A FAR.AI június 4-i összefoglalója szerint a programban technikai szekciók, konzultációs alkalmak és rövid előadások szerepeltek.
A nyitóelőadást Yoshua Bengio tartotta. A FAR.AI beszámolója szerint Bengio arra figyelmeztetett, hogy az AI-képességek gyors fejlődésével és az egyre önállóbb rendszerekkel párhuzamosan nő az összehangolás jelentősége. Úgy érvelt, hogy a jelenlegi rendszerek már nem pusztán eszközökként működnek, hanem terveket készítő és célokat követő ügynökökké válnak.
Bengio szerint óvatosságra ad okot, hogy egyes ügynöki AI-rendszerek megtévesztő és önfenntartó viselkedés jeleit mutathatják. Ugyanakkor a nem ügynöki rendszerek segíthetnek a tudományos ismeretek bővítésében és a veszélyesebb ügynöki rendszerek megfigyelésében. Ehhez a FAR.AI összefoglalója szerint jelentősen jobb technikai védelmi megoldásokra és irányítási intézkedésekre van szükség.
Robusztusság, modellmásolás és kijátszható védelmek
A robusztussággal foglalkozó előadások szerint a nyelvi modelleket célzott finomhangolással, modelllepárlással és automatikusan létrehozott utasításokkal is támadhatják. Stephen Casper, az MIT CSAIL kutatója a modellparaméterek vagy aktivációk közvetlen módosításával végrehajtott támadásokkal szembeni ellenállást emelte ki. A beszámoló szerint ezek a támadások hatékonyabbak voltak több utasításalapú módszernél, és ha kudarcot vallottak, más támadási módszerek is gyakran sikertelenek maradtak.
Zico Kolter az „Antidistillation Sampling” módszert mutatta be. Ennek célja, hogy a modell által előállított szöveg ne legyen alkalmas más modellek tanítására modelllepárlással. A FAR.AI szerint a megoldás még nem gyakorlati, de lehetővé teheti a modellképességek nyilvános megosztását a jogosulatlan másolás kockázatának csökkentésével.
Siva Reddy a védelmek kijátszását vizsgálta. Összefoglalója szerint a felügyelt finomhangolással összehangolt modellek sebezhetőbbek az univerzális jailbreak-támadásokkal szemben, mint a megerősítéses tanulást használó eljárásokkal, például RLHF-fel vagy DPO-val tanított modellek. Az ügynöki feladatok tovább növelhetik a sebezhetőséget. A beszámoló szerint a DeepSeek-R1 könnyen kijátszható, és más modellek kompromittálására is használható.
Új tesztek az irányítás és a kiberbiztonság értékelésére
A workshopon az úgynevezett jutalomkijátszást is tárgyalták. Ez akkor történik, amikor egy AI-rendszer egy köztes mérőszám optimalizálása közben eltér a tényleges céltól. Cassidy Laidlaw új matematikai keretrendszert és egy olyan mérséklési módszert mutatott be, amelyet a FAR.AI szerint valósághű megerősítéses tanulási környezetekben tesztelve a korábbi technikáknál jobb eredmények kísértek.
Noam Brown Stephen McAleer nevében a nagy számítási igényű összehangolásról és irányításról beszélt. Érvelése szerint a kis számítási igényű módszerek nem feltétlenül elegendők olyan modelleknél, amelyek értékelés közben összehangoltnak tettetik magukat. Három lehetséges irányt vázolt fel: a megtévesztő viselkedés felismerésére szolgáló ellenséges tanítást, a vitamechanizmusok beépítését a megerősítéses tanulásba, valamint a nagy számítási igény mellett hibásan összehangolt modelleket vizsgáló esettanulmányokat.
Daniel Kang bemutatta a CVE-Benchet, amely a beszámoló szerint az AI-ügynökök valós kiberbiztonsági sérülékenységekkel szembeni teljesítményét méri. A kutatócsoport 40 sérülékeny szoftverrendszert reprodukált virtuális konténerekben, majd nyolc kategóriában egységesítette a támadásokat. A jelenlegi ügynökök a zérónapos sérülékenységek kihasználásában 10 százalékos sikerarányt értek el, szemben a korábbi teszteken mért 50 százalék feletti eredményekkel.
A szabályozás és a felkészülés is a kutatás része
A workshop kormányzással foglalkozó előadásai között szerepelt a sérülékenységek felelős közzétételének keretrendszere, az AI-cégek szabályozással szembeni lobbitevékenysége, valamint az Európai Unió AI Actjének alkalmazása az AI-ügynökökre. Az előadók az ügynöki infrastruktúra lehetőségét is vizsgálták az összehangolás hiányából eredő hibák kezelésére.
A résztvevők a katasztrófákra való előzetes felkészülést, szimulált környezetek használatát és a felhasználói preferenciákhoz újratanítás nélküli alkalmazkodást is tárgyalták. A FAR.AI összefoglalója alapján a rendezvény üzenete a felhasználók és a fejlesztők számára az, hogy az AI-rendszerek képességeinek értékelése mellett a támadásokkal, a megtévesztéssel és az irányítás meghibásodásával szembeni védelmet is vizsgálni kell.
FAR.AI: Singapore Alignment Workshop 2025 | FAR.AI
