Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Új módszerrel szűrhetik ki a gyermekekre veszélyes AI-modelleket

2026. július 13. 06:00Forrás: MIT News
Új módszerrel szűrhetik ki a gyermekekre veszélyes AI-modelleket
Kép: MIT News

Az MIT kutatói olyan ellenőrzési eljárást fejlesztettek, amely generált tartalom létrehozása nélkül képes azonosítani a gyermekek szexuális bántalmazását ábrázoló anyagok előállítására módosított AI-modelleket. A módszer a modellek belső működését vizsgálja, és a tesztekben 100 százalékos pontossággal azonosította a CSAM előállítására specializált változatokat.

A lényeg röviden
  • Az MIT kutatói kimenet létrehozása nélkül vizsgálnák az AI-modellek káros képességeit.
  • A módszer a LoRA-adapterek által okozott belső módosításokat elemzi.
  • A tesztekben 100 százalékos pontossággal azonosította a CSAM előállítására specializált modelleket.
  • A platformok a veszélyes modellek kiszűrésére és eltávolítására használhatnák az eljárást.
  • A kutatók nagyobb modellkészleten és alapmodelleken is tesztelnék a technikát.

Kimenet nélkül vizsgálnák a modellek képességeit

A generatív mesterséges intelligencia terjedésével egyre több nyílt forráskódú modell válik elérhetővé, amelyeket bárki saját feladatára alakíthat. A finomhangolásnak nevezett eljárással például egy modell meghatározott művészeti stílusú képek készítésére specializálható. Ugyanez a lehetőség azonban olyan változatok létrehozását is segítheti, amelyek illegális vagy káros képeket állítanak elő.

A modellek biztonsági ellenőrzése általában úgy történik, hogy a kutatók káros tartalmat kérnek tőlük, majd megvizsgálják a választ. A gyermekek szexuális bántalmazását ábrázoló anyagok, vagyis a CSAM esetében ez jogi és etikai okokból nem járható út. Az Egyesült Államokban ilyen tartalom előállítása szándéktól függetlenül illegális.

Az MIT, a Thorn gyermekvédelmi nonprofit szervezet és a Healthy ML Lab kutatói ezért olyan eljárást dolgoztak ki, amely egyáltalán nem futtatja végig a modellt, és nem kér tőle képet. A módszer a modell belső reprezentációit elemzi, ezekből következtetve arra, hogy a rendszert specializálták-e káros képek előállítására.

A LoRA-módosításokat elemzi az eljárás

A kutatók a finomhangolás során létrejövő módosításokra, az úgynevezett LoRA-adapterekre összpontosítottak. A low-rank adaptation, röviden LoRA, lehetővé teszi, hogy egy modellt a teljes újratanítás nélkül alakítsanak át egy meghatározott feladatra.

Az új technika véletlenszerű adatpontokat táplál a modellbe, majd azt elemzi, hogyan kezeli ezeket a rendszer többrétegű belső szerkezetében. A Gaussian probing nevű eljárás több ponton rögzíti ezeket a változásokat, végül átlagolja őket, hogy összefoglalja, miként módosította a LoRA-adapter a modell számításait.

Vinith Suriyakumar, az MIT villamosmérnöki és számítástechnikai tanszékének doktorandusza és a tanulmány vezető szerzője szerint a kutatók soha nem futtatják végig a modellt, és nem kérnek tőle kimenetet, így képek sem jönnek létre. A módszert háromféle modellváltozaton tesztelték, és az eredményeket olyan LoRA-adapterek adataival vetették össze, amelyekről ismert volt, hogy CSAM, más káros képek vagy biztonságos tartalmak előállítására szolgálnak.

A tesztekben az eljárás 100 százalékos pontossággal azonosította a CSAM előállítására módosított modelleket.

Platformok és hatóságok is használhatnák

Az MIT szerint a módszer egyik fontos előnye, hogy nagyobb mennyiségű modell ellenőrzésére is alkalmas lehet, miközben az ismételt káros képalkotás pszichológiai terhét is elkerüli az emberi értékelők számára. A kutatók szerint havonta több ezer modellváltozat jelenik meg az interneten, ezért a skálázhatóság kulcsfontosságú lehet.

Egy modelleket tároló platform az eljárással megjelölhetné a veszélyes változatokat, eltávolíthatná őket, vagy már a feltöltés előtt megakadályozhatná a közzétételüket. Suriyakumar szerint ez új lehetőséget adhat a platformoknak és a bűnüldöző szerveknek annak ellenőrzésére, hogy egy modell képes-e CSAM előállítására.

A kutatók szerint a Gaussian probing ellenállóbb lehet bizonyos más ellenőrzési módszereknél, mivel a kijátszásához a rosszindulatú szereplőknek a kiinduló modell belső működését is gondosan át kellene alakítaniuk. A módszert a jövőben nagyobb számú modellváltozaton tesztelnék, és azt is vizsgálnák, hogy képes-e a káros képességeket már az alapmodellekben, a specializálás előtt felismerni.

A kutatásról szóló tanulmányt az MIT News szerint a Trustworthy AI for Good workshopön mutatták be, a Nemzetközi Gépi Tanulási Konferencia keretében. Az eredmények a gyermekek AI által készített mélyhamisításai és más káros tartalmak elleni ellenőrzéshez adhatnak technikai eszközt.

Kapcsolódó hírek

MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI
Kutatás2026. október 2. 20:07

MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI

A MedPAIR adatbázis azt méri, hogy az orvosok és a nagy nyelvi modellek ugyanazokat a mondatokat tartják-e fontosnak egy klinikai kérdés megválaszolásához. A kutatásban…

A Goodfire feltérképezte a DeepSeek R1 gondolkodási folyamatait
Kutatás2026. október 1.

A Goodfire feltérképezte a DeepSeek R1 gondolkodási folyamatait

A Goodfire Research elkészítette az első ritka autoenkódereket a 671 milliárd paraméteres DeepSeek R1 reasoning modellhez, és nyílt forráskódúvá tette őket. A kutatók…

A DeepSeek R1 belső működését vizsgáló eszközöket tett közzé a Goodfire
Kutatás2026. október 1.

A DeepSeek R1 belső működését vizsgáló eszközöket tett közzé a Goodfire

A Goodfire Research két nyílt forrású sparse autoencodert tett közzé a 671 milliárd paraméteres DeepSeek R1 elemzéséhez. A kutatók szerint a modell belső működése több…