Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A FAR.AI szerint az AI-modelleket biztonsági védelem előtt és után is tesztelni kell

2026. július 16.Forrás: FAR.AI

Az AI-modellek biztonságának megítéléséhez kétféle vizsgálatra van szükség, írja a FAR.AI: a veszélyes képességeket a védelmi intézkedések előtt, a korlátok működését pedig azok bevezetése után kell tesztelni. A szervezet szerint a vállalatok jelenleg többnyire csak az egyik értékelést teszik közzé.

A lényeg röviden
  • A FAR.AI szerint a veszélyes képességeket és a biztonsági korlátokat is vizsgálni kell.
  • A vállalatok többsége jelenleg csak az egyik értékelést közli.
  • A GPT-4o a tesztben 50 százalékos megfelelést mutatott veszélyes kérésekre.
  • A FAR.AI egységes jelentési szabványokat és nagyobb átláthatóságot sürget.

Két külön kérdésre kell választ adni

A védelem előtti, úgynevezett pre-mitigation értékelések azt mérik, hogy egy modell milyen veszélyes képességekkel rendelkezik a biztonsági intézkedések alkalmazása előtt. Ez segíthet felkészülni olyan esetekre, amikor a támadók megkerülik a védelmi korlátokat, például jailbreakkel, finomhangolási támadással vagy a védelmek nélküli modell súlyaihoz való jogosulatlan hozzáféréssel.

A védelem utáni, post-mitigation vizsgálatok azt ellenőrzik, hogy a biztonsági intézkedések valóban működnek-e. Ilyenkor azt tesztelik, hogy a modell megbízhatóan elutasítja-e a veszélyes kéréseket, és ellenáll-e az ellenséges támadásoknak.

A FAR.AI érvelése szerint a két eredmény együtt teszi lehetővé a telepítésről, a biztonságról és a szabályozói megfelelésről szóló megalapozottabb döntéseket. Egy alacsony képességű modell biztonságosnak tűnhet akkor is, ha a védelmi intézkedéseit nem vizsgálták. Erős védelmek mellett pedig azt nem lehet felmérni, mekkora kockázat keletkezne a korlátok megkerülésekor.

A vállalatok jelentései egyenetlenek

A FAR.AI több vezető modell biztonsági jelentéseit hasonlította össze. A szervezet szerint az OpenAI o1 modelljéről számol be a legátláthatóbban, a magas kockázatú képességek, köztük a vegyi, biológiai, radiológiai és nukleáris fenyegetések vizsgálatával együtt. Az o3, a Deep Research mögött álló modell esetében a vállalat egyelőre kevésbé részletes, és későbbre ígért rendszerkártyát.

Az Anthropic a Claude 3 és 3.5 alacsony elutasítási arányú változataival közöl védelem előtti képességvizsgálatokat, de a FAR.AI szerint nem ad post-mitigation értékelést, és az „alacsony elutasítási arányú” meghatározása sem egyértelmű. A Google Gemini 1.5 modellkártyája főként a védelem utáni vizsgálatokra koncentrál.

A nyílt súlyú modellek esetében a helyzet a FAR.AI szerint még kevésbé átlátható. A Meta a Llama 3.1 CBRN-biztonsági vizsgálatairól csak általános állítást közöl, az Alibaba Qwen-2.5 modelljéhez alapvető védelem utáni értékelések kapcsolódnak, a DeepSeek R1 esetében pedig nem jelentettek biztonsági értékelést. A Deep Research, a Qwen-2.5 és több más modell esetében legalább az egyik vizsgálattípus hiányzik vagy nem egyértelmű.

A GPT-4o esete megmutatja a hiányosságot

A szervezet négy modellt, az OpenAI o1 és GPT-4o, az Anthropic Claude 3.5 Sonnet, valamint a Google DeepMind Gemini 1.5 Pro rendszerét vizsgálta. Mivel a védelem előtti modellekhez nem fértek hozzá, a kutatók a WMDP-Chem adathalmazt használták közelítésként. Az adathalmaz olyan kémiai kérdéseket tartalmaz, amelyek veszélyes tudást mérnek, de önmagukban nem feltétlenül aktiválják a biztonsági szűrőket.

Az o1 és a GPT-4o 70 és 75 százalék közötti pontosságot ért el, a Claude 3.5 Sonnet 55 százalékot, a Gemini 1.5 Pro pedig 45 százalékot. A veszélyes kérésekre a GPT-4o az esetek 50 százalékában adott választ, míg az o1, a Claude 3.5 Sonnet és a Gemini 1.5 Pro megfelelési aránya 15 százalék alatt maradt.

A FAR.AI hangsúlyozza, hogy ez nem formális biztonsági értékelés, a küszöbértékek pedig szemléltető, önkényes mérőszámok. A szervezet értelmezése szerint az o1 ellenőrzött API-s használatra alkalmasnak tűnik, a GPT-4o kombinációja viszont komoly biztonsági aggályokat vet fel. A kutatók egységes jelentési szabványokat, minimum átláthatósági követelményeket és a védelem előtti modellekhez való, szigorúan biztosított kormányzati hozzáférést javasolnak.

Kapcsolódó hírek

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…

Biztonság és etika
Biztonság és etika2026. szeptember 14.

A GPT-5.1 és a Claude Opus 4.5 javult, a Gemini 3 Pro romlott

A FAR.AI új tesztje szerint az OpenAI GPT-5.1 és az Anthropic Claude Opus 4.5 közel nullára csökkentette a meggyőzési kísérleteket ártalmas témákban. A Google Gemini 3…