Öt védelmi gyakorlatot vizsgált az AI szélsőséges visszaélései ellen egy új jelentés
Öt jelenleg alkalmazott védelmi gyakorlatot térképezett fel a Safe AI Forum az AI-rendszerek szélsőséges célú visszaéléseinek mérséklésére. A jelentés a modell, a használat és az irányítás szintjén vizsgálja a megoldásokat, különös tekintettel a vegyi, biológiai, radiológiai és nukleáris fenyegetésekre, valamint a kibertámadásokra.
- A jelentés öt védelmi gyakorlatot vizsgál három szinten.
- A modell szintjén az adatszűrés és a tanítás utáni technikák szerepelnek.
- A telepítés szintjén a monitorozást és a hozzáférés szabályozását tekintik át.
- A telepítés előtti értékelés a kiadási feltételekről és a védelmi intézkedésekről szóló döntéseket támogathatja.
- A vizsgált kockázatok között a CBRN-fenyegetések és a kibertámadások is szerepelnek.
Három szinten vizsgálták a védelmet
A Technical Safeguards Against Extreme Misuse of AI: Current Landscape and Future Directions című jelentés szerint az AI-rendszerek képességeinek növekedésével sürgetőbbé vált annak kérdése, hogyan akadályozható meg a szélsőséges visszaélés nem állami szereplők részéről. A témában a kormányok, a vállalatok, a kutatók és a nyilvánosság is érintett.
A Safe AI Forum öt védelmi gyakorlatot sorol három szintre. Két beavatkozás magukat a modelleket érinti: a tanítás előtti adatszűrés és a tanítás utáni technikák. Két további megoldás a telepítés szintjén működik, ezek a használat monitorozása és a hozzáférés szabályozása. Az ötödik gyakorlat az irányítási szinthez tartozó, telepítés előtti értékelés.
Az adatok, a tanítás és a hozzáférés is kulcskérdés
A jelentés a tanítás előtti adatszűrést és a tanítás utáni technikákat modell szintű beavatkozásként kezeli. Ezek a modell fejlesztésének különböző szakaszaiban alkalmazhatók, és a vizsgálat azt is áttekinti, milyen jelenlegi gyakorlatok kapcsolódnak hozzájuk.
A telepítéshez kötődő védelem két eleme a monitorozás és a hozzáférés-szabályozás. A monitorozás a rendszerek használatának követését jelenti, míg a hozzáférés szabályozása azt, hogy milyen feltételek mellett vehetők igénybe az AI-rendszerek. A forrás mindkét területet a szélsőséges visszaélések elleni jelenlegi biztosítékok részeként vizsgálja.
A szerzők minden beavatkozásnál bemutatják a jelenlegi gyakorlatot, a vezető AI-fejlesztők megvalósítási módszereit, az empirikus bizonyítékokat, valamint a korlátokat. A jelentés emellett a jövőbeli kutatás és együttműködés prioritásait is összegzi.
A telepítés előtti értékelés a döntéseket is támogatja
Az irányítási szinthez sorolt telepítés előtti értékelés a jelentés szerint a rendszerek használatba adásáról szóló döntéseket segíti. Ennek része lehet a kiadás feltételeinek és a szükséges védelmi intézkedéseknek a meghatározása.
A Safe AI Forum leírása alapján az értékelés szerepe a telepítést követően sem feltétlenül ér véget. Az így nyert információk a biztosítékok folyamatos finomítását is támogathatják. Ez a megközelítés a modell fejlesztését, a rendszer használatát és a szervezeti döntéshozatalt egyetlen védelmi keretben vizsgálja.
A jelentés 2026. augusztus 28-án jelent meg, majd szeptember 14-én frissítették. Szerzői Isabella Duan, Edward Kembery, Stephen Casper, Zhikai Chen, Jasper Götting, Geng Hong, Zaheed Kara, Lijun Li, Xiaojian Li, Kellin Pelrine, Ziyue Wang, Jia Xu, Ziwei Xu, Zhiyuan Zeng, James Zhang és Jie Zhang.
