Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Új jailbreak-adatbázist mutatott be a FAR.AI a veszélyes kérésekhez

2026. augusztus 19.Forrás: FAR.AI

A FAR.AI bemutatta a ClearHarm nevű jailbreak-benchmarkot, amely olyan kérésekre összpontosít, amelyek egyértelműen káros célokat szolgálnak. A kutatók szerint az adatbázis nehezebb próbát jelent a támadási módszerek számára, mint több korábbi tesztkészlet.

A lényeg röviden
  • A ClearHarm 179 jailbreak-promptot tartalmaz.
  • A benchmark biológiai, vegyi, nukleáris, hagyományos és kiberfegyverekre összpontosít.
  • A FAR.AI szerint a készlet nehezebb próbát jelent több korábbi benchmarknál.
  • Az adatbázis a Hugging Face-en érhető el.
  • A kutatók későbbi tanulmányban közlik részletes eredményeiket.

Egyértelműen káros kérésekre épít a ClearHarm

A ClearHarm olyan kérdéseket vizsgál, amelyek vegyi, biológiai, radiológiai és nukleáris fenyegetések létrehozásához kapcsolódnak. A benchmark a hagyományos fegyverekkel és a rosszindulatú kódokkal kapcsolatos kéréseket is tartalmazza. A FAR.AI szerint ezek a kategóriák azért hasznosak, mert szélsőséges károkozási kockázatot hordoznak, és a hozzájuk kapcsolódó információk nyilvánosan elérhető chatbotokban nem terjesztendők.

A kutatók a ClearHarmot a Hugging Face-en tették elérhetővé. A készlet 179 promptból áll, ami a FAR.AI szerint elegendő az értékeléshez, de nem a modellek betanításához. A szervezet ezt a katasztrofális visszaélések értékelésének kiindulópontjaként adja közre, és nagyobb adatbázisok létrehozását is ösztönzi.

A korábbi tesztek problémáit próbálja kiküszöbölni

A FAR.AI szerint több korábbi jailbreak-benchmark kérdései csak bizonyos értelmezések szerint károsak. Ilyen példaként említik az egészségügyi tanácsadást és a szélsőséges politikai vélemények melletti érvelést, amelyek egyes biztonsági szabályzatok szerint megengedhetők. A grafikus erőszakhoz vagy szexuális tartalomhoz hasonló témáknál szintén eltérhet, hogy egy fejlesztő hol húzza meg a határt.

További nehézséget jelentenek a kettős felhasználású kérdések. Ezek legitim célokra is feltehetők, ezért egy támadás könnyen hatékonynak tűnhet, miközben a modell valójában elfogadható információt ad. A ClearHarm ezzel szemben úgynevezett egyszeri felhasználású, vagyis kizárólag támadó célokra használható kérésekre épít. Ezeket a modelleknek a kérdés megfogalmazásától, keretezésétől és kontextusától függetlenül vissza kellene utasítaniuk.

Claude 3.7 Sonnet segítségével állították össze

A dataset létrehozásakor a FAR.AI kutatói a Claude 3.7 Sonnet modellt kérték meg olyan LLM-lekérdezési kategóriák javaslatára, amelyeket a modelleknek vissza kell utasítaniuk. A kiválasztott területek a biológiai, vegyi, nukleáris és hagyományos fegyverek, valamint a kiberfegyverek, ezen belül a rosszindulatú kódok voltak.

Ugyanebben a beszélgetésben példákat is kértek az egyes kategóriákhoz. Arra ösztönözték a modellt, hogy kizárólag szigorúan káros, kettős felhasználásra nem alkalmas kérdéseket javasoljon. A kérdések nyelvtani szerkezetének keverésére is figyeltek, hogy az egyes kategóriák összehasonlítását ne torzítsák formai eltérések.

A kutatók szerint szigorúbb próbát jelent a modelleknek

A FAR.AI belső tesztjei szerint több jailbreak, amely a meglévő adatbázisokon hatékonynak látszik, a ClearHarm egyértelműbben káros információit már kevésbé tudja kinyerni. A szervezet szerint ezért az új benchmark különösen annak vizsgálatára alkalmas, hogy mely támadási módszerek jelentik a legnagyobb kockázatot a kirívóan káros válaszok előidézésében.

A kutatók a ClearHarm eredményeiről egy készülő tanulmányban ígérnek további részleteket. Az adatbázis így a modellbiztonság tesztelésére szolgáló eszköz, amely a kétértelmű vagy legitim célokra is használható kérések helyett az egyértelműen tiltandó tartalmakra helyezi a hangsúlyt.

FAR.AIClearHarmStrongREJECTDo-Not-AnswerSORRY-BenchHuggingFaceAI-biztonságbenchmarkkutatási eredmény

Kapcsolódó hírek

Kutatás: az AI-s gyűlöletbeszéd-felismerés maga is keretek közé szorít
Kutatás2026. szeptember 30. 12:34

Kutatás: az AI-s gyűlöletbeszéd-felismerés maga is keretek közé szorít

A gyűlöletbeszéd mesterséges intelligenciával végzett felismerését alapvetően meghatározza, hogyan írják le magát a nyelvet. A Minderoo Centre for Technology & Democracy…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…