Új módszerrel szűrhetik ki a gyermekekre veszélyes AI-modelleket

Az MIT kutatói olyan ellenőrzési eljárást fejlesztettek, amely generált tartalom létrehozása nélkül képes azonosítani a gyermekek szexuális bántalmazását ábrázoló anyagok előállítására módosított AI-modelleket. A módszer a modellek belső működését vizsgálja, és a tesztekben 100 százalékos pontossággal azonosította a CSAM előállítására specializált változatokat.
- Az MIT kutatói kimenet létrehozása nélkül vizsgálnák az AI-modellek káros képességeit.
- A módszer a LoRA-adapterek által okozott belső módosításokat elemzi.
- A tesztekben 100 százalékos pontossággal azonosította a CSAM előállítására specializált modelleket.
- A platformok a veszélyes modellek kiszűrésére és eltávolítására használhatnák az eljárást.
- A kutatók nagyobb modellkészleten és alapmodelleken is tesztelnék a technikát.
Kimenet nélkül vizsgálnák a modellek képességeit
A generatív mesterséges intelligencia terjedésével egyre több nyílt forráskódú modell válik elérhetővé, amelyeket bárki saját feladatára alakíthat. A finomhangolásnak nevezett eljárással például egy modell meghatározott művészeti stílusú képek készítésére specializálható. Ugyanez a lehetőség azonban olyan változatok létrehozását is segítheti, amelyek illegális vagy káros képeket állítanak elő.
A modellek biztonsági ellenőrzése általában úgy történik, hogy a kutatók káros tartalmat kérnek tőlük, majd megvizsgálják a választ. A gyermekek szexuális bántalmazását ábrázoló anyagok, vagyis a CSAM esetében ez jogi és etikai okokból nem járható út. Az Egyesült Államokban ilyen tartalom előállítása szándéktól függetlenül illegális.
Az MIT, a Thorn gyermekvédelmi nonprofit szervezet és a Healthy ML Lab kutatói ezért olyan eljárást dolgoztak ki, amely egyáltalán nem futtatja végig a modellt, és nem kér tőle képet. A módszer a modell belső reprezentációit elemzi, ezekből következtetve arra, hogy a rendszert specializálták-e káros képek előállítására.
A LoRA-módosításokat elemzi az eljárás
A kutatók a finomhangolás során létrejövő módosításokra, az úgynevezett LoRA-adapterekre összpontosítottak. A low-rank adaptation, röviden LoRA, lehetővé teszi, hogy egy modellt a teljes újratanítás nélkül alakítsanak át egy meghatározott feladatra.
Az új technika véletlenszerű adatpontokat táplál a modellbe, majd azt elemzi, hogyan kezeli ezeket a rendszer többrétegű belső szerkezetében. A Gaussian probing nevű eljárás több ponton rögzíti ezeket a változásokat, végül átlagolja őket, hogy összefoglalja, miként módosította a LoRA-adapter a modell számításait.
Vinith Suriyakumar, az MIT villamosmérnöki és számítástechnikai tanszékének doktorandusza és a tanulmány vezető szerzője szerint a kutatók soha nem futtatják végig a modellt, és nem kérnek tőle kimenetet, így képek sem jönnek létre. A módszert háromféle modellváltozaton tesztelték, és az eredményeket olyan LoRA-adapterek adataival vetették össze, amelyekről ismert volt, hogy CSAM, más káros képek vagy biztonságos tartalmak előállítására szolgálnak.
A tesztekben az eljárás 100 százalékos pontossággal azonosította a CSAM előállítására módosított modelleket.
Platformok és hatóságok is használhatnák
Az MIT szerint a módszer egyik fontos előnye, hogy nagyobb mennyiségű modell ellenőrzésére is alkalmas lehet, miközben az ismételt káros képalkotás pszichológiai terhét is elkerüli az emberi értékelők számára. A kutatók szerint havonta több ezer modellváltozat jelenik meg az interneten, ezért a skálázhatóság kulcsfontosságú lehet.
Egy modelleket tároló platform az eljárással megjelölhetné a veszélyes változatokat, eltávolíthatná őket, vagy már a feltöltés előtt megakadályozhatná a közzétételüket. Suriyakumar szerint ez új lehetőséget adhat a platformoknak és a bűnüldöző szerveknek annak ellenőrzésére, hogy egy modell képes-e CSAM előállítására.
A kutatók szerint a Gaussian probing ellenállóbb lehet bizonyos más ellenőrzési módszereknél, mivel a kijátszásához a rosszindulatú szereplőknek a kiinduló modell belső működését is gondosan át kellene alakítaniuk. A módszert a jövőben nagyobb számú modellváltozaton tesztelnék, és azt is vizsgálnák, hogy képes-e a káros képességeket már az alapmodellekben, a specializálás előtt felismerni.
A kutatásról szóló tanulmányt az MIT News szerint a Trustworthy AI for Good workshopön mutatták be, a Nemzetközi Gépi Tanulási Konferencia keretében. Az eredmények a gyermekek AI által készített mélyhamisításai és más káros tartalmak elleni ellenőrzéshez adhatnak technikai eszközt.


