A FAR.AI szerint az AI-modelleket biztonsági védelem előtt és után is tesztelni kell
Az AI-modellek biztonságának megítéléséhez kétféle vizsgálatra van szükség, írja a FAR.AI: a veszélyes képességeket a védelmi intézkedések előtt, a korlátok működését pedig azok bevezetése után kell tesztelni. A szervezet szerint a vállalatok jelenleg többnyire csak az egyik értékelést teszik közzé.
- A FAR.AI szerint a veszélyes képességeket és a biztonsági korlátokat is vizsgálni kell.
- A vállalatok többsége jelenleg csak az egyik értékelést közli.
- A GPT-4o a tesztben 50 százalékos megfelelést mutatott veszélyes kérésekre.
- A FAR.AI egységes jelentési szabványokat és nagyobb átláthatóságot sürget.
Két külön kérdésre kell választ adni
A védelem előtti, úgynevezett pre-mitigation értékelések azt mérik, hogy egy modell milyen veszélyes képességekkel rendelkezik a biztonsági intézkedések alkalmazása előtt. Ez segíthet felkészülni olyan esetekre, amikor a támadók megkerülik a védelmi korlátokat, például jailbreakkel, finomhangolási támadással vagy a védelmek nélküli modell súlyaihoz való jogosulatlan hozzáféréssel.
A védelem utáni, post-mitigation vizsgálatok azt ellenőrzik, hogy a biztonsági intézkedések valóban működnek-e. Ilyenkor azt tesztelik, hogy a modell megbízhatóan elutasítja-e a veszélyes kéréseket, és ellenáll-e az ellenséges támadásoknak.
A FAR.AI érvelése szerint a két eredmény együtt teszi lehetővé a telepítésről, a biztonságról és a szabályozói megfelelésről szóló megalapozottabb döntéseket. Egy alacsony képességű modell biztonságosnak tűnhet akkor is, ha a védelmi intézkedéseit nem vizsgálták. Erős védelmek mellett pedig azt nem lehet felmérni, mekkora kockázat keletkezne a korlátok megkerülésekor.
A vállalatok jelentései egyenetlenek
A FAR.AI több vezető modell biztonsági jelentéseit hasonlította össze. A szervezet szerint az OpenAI o1 modelljéről számol be a legátláthatóbban, a magas kockázatú képességek, köztük a vegyi, biológiai, radiológiai és nukleáris fenyegetések vizsgálatával együtt. Az o3, a Deep Research mögött álló modell esetében a vállalat egyelőre kevésbé részletes, és későbbre ígért rendszerkártyát.
Az Anthropic a Claude 3 és 3.5 alacsony elutasítási arányú változataival közöl védelem előtti képességvizsgálatokat, de a FAR.AI szerint nem ad post-mitigation értékelést, és az „alacsony elutasítási arányú” meghatározása sem egyértelmű. A Google Gemini 1.5 modellkártyája főként a védelem utáni vizsgálatokra koncentrál.
A nyílt súlyú modellek esetében a helyzet a FAR.AI szerint még kevésbé átlátható. A Meta a Llama 3.1 CBRN-biztonsági vizsgálatairól csak általános állítást közöl, az Alibaba Qwen-2.5 modelljéhez alapvető védelem utáni értékelések kapcsolódnak, a DeepSeek R1 esetében pedig nem jelentettek biztonsági értékelést. A Deep Research, a Qwen-2.5 és több más modell esetében legalább az egyik vizsgálattípus hiányzik vagy nem egyértelmű.
A GPT-4o esete megmutatja a hiányosságot
A szervezet négy modellt, az OpenAI o1 és GPT-4o, az Anthropic Claude 3.5 Sonnet, valamint a Google DeepMind Gemini 1.5 Pro rendszerét vizsgálta. Mivel a védelem előtti modellekhez nem fértek hozzá, a kutatók a WMDP-Chem adathalmazt használták közelítésként. Az adathalmaz olyan kémiai kérdéseket tartalmaz, amelyek veszélyes tudást mérnek, de önmagukban nem feltétlenül aktiválják a biztonsági szűrőket.
Az o1 és a GPT-4o 70 és 75 százalék közötti pontosságot ért el, a Claude 3.5 Sonnet 55 százalékot, a Gemini 1.5 Pro pedig 45 százalékot. A veszélyes kérésekre a GPT-4o az esetek 50 százalékában adott választ, míg az o1, a Claude 3.5 Sonnet és a Gemini 1.5 Pro megfelelési aránya 15 százalék alatt maradt.
A FAR.AI hangsúlyozza, hogy ez nem formális biztonsági értékelés, a küszöbértékek pedig szemléltető, önkényes mérőszámok. A szervezet értelmezése szerint az o1 ellenőrzött API-s használatra alkalmasnak tűnik, a GPT-4o kombinációja viszont komoly biztonsági aggályokat vet fel. A kutatók egységes jelentési szabványokat, minimum átláthatósági követelményeket és a védelem előtti modellekhez való, szigorúan biztosított kormányzati hozzáférést javasolnak.