Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

FAR.AI: több mint százszoros eltérés van az AI-modellek védelmében

2026. július 31.Forrás: FAR.AI

A FAR.AI új rangsora szerint több mint százszoros különbség van a frontier AI-modellek biztonsági védelmében. A Grok 4.5 cyberterületen már 24 dolláros költséggel feltörhető volt, míg két modellnél a kutatók nem találtak univerzális jailbreaket.

A lényeg röviden
  • A FAR.AI négy frontier AI-modellt tesztelt azonos feltételek mellett.
  • A Grok 4.5 cyberterületen 24 dolláros költséggel feltörhető volt.
  • Claude Fable 5 és GPT-5.6 Sol ellen nem találtak univerzális jailbreaket.
  • A FAR.AI új rangsort és közös minimumvédelmi szabványt tett közzé.

Négy modell, nagyon eltérő védelmi szint

A FAR.AI július 29-én mutatta be az AI Security Leaderboard nevű, független biztonsági rangsort. A szervezet négy vezető frontier AI-modellt vizsgált azonos feltételek mellett, azt mérve, mennyibe kerülne egy támadónak megbízhatóan rávennie őket arra, hogy vegyi, biológiai vagy kiber támadásokhoz nyújtsanak segítséget.

A tesztelt modellek között a Claude Fable 5 és a GPT-5.6 Sol minden vizsgált támadással szemben ellenállt. A FAR.AI nem talált náluk univerzális jailbreaket, vagyis olyan újrahasználható támadási módszert, amely egy adott kockázati területen a káros kérések több mint háromnegyedénél működik. A szervezet becslése szerint egy ilyen módszer megtalálása 14 000 dollárnál többe kerülhetne.

A másik két modell jóval gyengébben teljesített. A Grok 4.5 esetében 58 dollár is elég volt egy olyan támadás kidolgozásához, amely minden vizsgált területen káros információkat tudott kinyerni. A kiberbiztonsági területen ez az összeg 24 dollárra csökkent. A FAR.AI szerint a Grok 4.5 és a Gemini 3.1 Pro egyaránt 300 dollár alatti költséggel törhető volt a tesztben.

Több százezer próbálkozással keresték a jailbreaket

A kutatók a jailbreak-támadásokat alapvető építőelemekre bontották, majd egy eszközkészlettel automatikusan új kombinációkat hoztak létre. Ezekkel több százezer promptot futtattak le a kiválasztott modelleken, többek között vegyi, biológiai, radiológiai, nukleáris, robbanóanyagokkal kapcsolatos és kiberbiztonsági kockázati területeken.

A rangsorban a védelem erősségét az mutatja, mennyibe kerül egy támadónak univerzális jailbreaket találnia. A magasabb összeg erősebb védelmet jelez. A FAR.AI hangsúlyozza, hogy a 14 000 dollár feletti érték nem jelenti a modellek biztonságának tanúsítását. Csak azt mutatja, hogy a vizsgált támadások között nem találtak működő univerzális módszert.

A szervezet szerint a közzétett adatok még optimisták is, mivel alacsony erőfeszítést feltételező támadót modelleznek. A tapasztalt jailbreak-kutatók tanulhatnak a működő próbálkozásokból, és célzottabban támadhatják a gyenge pontokat. A FAR.AI egyes modelleknél egy nagyságrenddel több univerzális jailbreaket talált, amikor ilyen szakértelmet is figyelembe vett.

Közös minimumszintet javasolnak

Az AI Security Leaderboard mellett a FAR.AI közzétette a Minimal Standard for Safeguards nevű minimumvédelmi szabványt is. Ez olyan támadásokkal szembeni ellenállást ír le, amelyek ellen a szervezet szerint más frontier AI-fejlesztők már működő, éles környezetben használt védelmeket alkalmaznak.

A javasolt minimumszint nem minősíti biztonságosnak az azt teljesítő modellt. A küszöb alatti teljesítmény viszont arra utal, hogy a rendszer olyan ismert támadási módszerekkel szemben is sebezhető, amelyek ellen más fejlesztők már védekeznek. A FAR.AI szerint a feltárt hiányosságok mindegyike ismert támadási osztályba tartozik, és már léteznek hozzájuk védelmi megoldások.

A rangsor célja, hogy a modellek biztonságáról szóló, fejlesztői állítások mellett függetlenül ellenőrizhető összehasonlítás is rendelkezésre álljon. A FAR.AI szerint a közös mérce a kormányok és szabványügyi szervezetek számára a közbeszerzési követelmények kialakításában, a tesztelési erőforrások célzottabb felhasználásában és a nemzetközi egyeztetésben is használható lehet.

Kapcsolódó hírek

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…

A Vercel Sandboxban is futtathatók a Harbor értékelései
Fejlesztőknek2026. szeptember 17.

A Vercel Sandboxban is futtathatók a Harbor értékelései

A Vercel Sandbox támogatja a Harbor nyílt forráskódú értékelési keretrendszerét, így a Terminal-Bench és több más benchmark is futtatható a Vercel infrastruktúráján. Az…