FAR.AI: több mint százszoros eltérés van az AI-modellek védelmében
A FAR.AI új rangsora szerint több mint százszoros különbség van a frontier AI-modellek biztonsági védelmében. A Grok 4.5 cyberterületen már 24 dolláros költséggel feltörhető volt, míg két modellnél a kutatók nem találtak univerzális jailbreaket.
- A FAR.AI négy frontier AI-modellt tesztelt azonos feltételek mellett.
- A Grok 4.5 cyberterületen 24 dolláros költséggel feltörhető volt.
- Claude Fable 5 és GPT-5.6 Sol ellen nem találtak univerzális jailbreaket.
- A FAR.AI új rangsort és közös minimumvédelmi szabványt tett közzé.
Négy modell, nagyon eltérő védelmi szint
A FAR.AI július 29-én mutatta be az AI Security Leaderboard nevű, független biztonsági rangsort. A szervezet négy vezető frontier AI-modellt vizsgált azonos feltételek mellett, azt mérve, mennyibe kerülne egy támadónak megbízhatóan rávennie őket arra, hogy vegyi, biológiai vagy kiber támadásokhoz nyújtsanak segítséget.
A tesztelt modellek között a Claude Fable 5 és a GPT-5.6 Sol minden vizsgált támadással szemben ellenállt. A FAR.AI nem talált náluk univerzális jailbreaket, vagyis olyan újrahasználható támadási módszert, amely egy adott kockázati területen a káros kérések több mint háromnegyedénél működik. A szervezet becslése szerint egy ilyen módszer megtalálása 14 000 dollárnál többe kerülhetne.
A másik két modell jóval gyengébben teljesített. A Grok 4.5 esetében 58 dollár is elég volt egy olyan támadás kidolgozásához, amely minden vizsgált területen káros információkat tudott kinyerni. A kiberbiztonsági területen ez az összeg 24 dollárra csökkent. A FAR.AI szerint a Grok 4.5 és a Gemini 3.1 Pro egyaránt 300 dollár alatti költséggel törhető volt a tesztben.
Több százezer próbálkozással keresték a jailbreaket
A kutatók a jailbreak-támadásokat alapvető építőelemekre bontották, majd egy eszközkészlettel automatikusan új kombinációkat hoztak létre. Ezekkel több százezer promptot futtattak le a kiválasztott modelleken, többek között vegyi, biológiai, radiológiai, nukleáris, robbanóanyagokkal kapcsolatos és kiberbiztonsági kockázati területeken.
A rangsorban a védelem erősségét az mutatja, mennyibe kerül egy támadónak univerzális jailbreaket találnia. A magasabb összeg erősebb védelmet jelez. A FAR.AI hangsúlyozza, hogy a 14 000 dollár feletti érték nem jelenti a modellek biztonságának tanúsítását. Csak azt mutatja, hogy a vizsgált támadások között nem találtak működő univerzális módszert.
A szervezet szerint a közzétett adatok még optimisták is, mivel alacsony erőfeszítést feltételező támadót modelleznek. A tapasztalt jailbreak-kutatók tanulhatnak a működő próbálkozásokból, és célzottabban támadhatják a gyenge pontokat. A FAR.AI egyes modelleknél egy nagyságrenddel több univerzális jailbreaket talált, amikor ilyen szakértelmet is figyelembe vett.
Közös minimumszintet javasolnak
Az AI Security Leaderboard mellett a FAR.AI közzétette a Minimal Standard for Safeguards nevű minimumvédelmi szabványt is. Ez olyan támadásokkal szembeni ellenállást ír le, amelyek ellen a szervezet szerint más frontier AI-fejlesztők már működő, éles környezetben használt védelmeket alkalmaznak.
A javasolt minimumszint nem minősíti biztonságosnak az azt teljesítő modellt. A küszöb alatti teljesítmény viszont arra utal, hogy a rendszer olyan ismert támadási módszerekkel szemben is sebezhető, amelyek ellen más fejlesztők már védekeznek. A FAR.AI szerint a feltárt hiányosságok mindegyike ismert támadási osztályba tartozik, és már léteznek hozzájuk védelmi megoldások.
A rangsor célja, hogy a modellek biztonságáról szóló, fejlesztői állítások mellett függetlenül ellenőrizhető összehasonlítás is rendelkezésre álljon. A FAR.AI szerint a közös mérce a kormányok és szabványügyi szervezetek számára a közbeszerzési követelmények kialakításában, a tesztelési erőforrások célzottabb felhasználásában és a nemzetközi egyeztetésben is használható lehet.
