Új jailbreak-adatbázist mutatott be a FAR.AI a veszélyes kérésekhez
A FAR.AI bemutatta a ClearHarm nevű jailbreak-benchmarkot, amely olyan kérésekre összpontosít, amelyek egyértelműen káros célokat szolgálnak. A kutatók szerint az adatbázis nehezebb próbát jelent a támadási módszerek számára, mint több korábbi tesztkészlet.
- A ClearHarm 179 jailbreak-promptot tartalmaz.
- A benchmark biológiai, vegyi, nukleáris, hagyományos és kiberfegyverekre összpontosít.
- A FAR.AI szerint a készlet nehezebb próbát jelent több korábbi benchmarknál.
- Az adatbázis a Hugging Face-en érhető el.
- A kutatók későbbi tanulmányban közlik részletes eredményeiket.
Egyértelműen káros kérésekre épít a ClearHarm
A ClearHarm olyan kérdéseket vizsgál, amelyek vegyi, biológiai, radiológiai és nukleáris fenyegetések létrehozásához kapcsolódnak. A benchmark a hagyományos fegyverekkel és a rosszindulatú kódokkal kapcsolatos kéréseket is tartalmazza. A FAR.AI szerint ezek a kategóriák azért hasznosak, mert szélsőséges károkozási kockázatot hordoznak, és a hozzájuk kapcsolódó információk nyilvánosan elérhető chatbotokban nem terjesztendők.
A kutatók a ClearHarmot a Hugging Face-en tették elérhetővé. A készlet 179 promptból áll, ami a FAR.AI szerint elegendő az értékeléshez, de nem a modellek betanításához. A szervezet ezt a katasztrofális visszaélések értékelésének kiindulópontjaként adja közre, és nagyobb adatbázisok létrehozását is ösztönzi.
A korábbi tesztek problémáit próbálja kiküszöbölni
A FAR.AI szerint több korábbi jailbreak-benchmark kérdései csak bizonyos értelmezések szerint károsak. Ilyen példaként említik az egészségügyi tanácsadást és a szélsőséges politikai vélemények melletti érvelést, amelyek egyes biztonsági szabályzatok szerint megengedhetők. A grafikus erőszakhoz vagy szexuális tartalomhoz hasonló témáknál szintén eltérhet, hogy egy fejlesztő hol húzza meg a határt.
További nehézséget jelentenek a kettős felhasználású kérdések. Ezek legitim célokra is feltehetők, ezért egy támadás könnyen hatékonynak tűnhet, miközben a modell valójában elfogadható információt ad. A ClearHarm ezzel szemben úgynevezett egyszeri felhasználású, vagyis kizárólag támadó célokra használható kérésekre épít. Ezeket a modelleknek a kérdés megfogalmazásától, keretezésétől és kontextusától függetlenül vissza kellene utasítaniuk.
Claude 3.7 Sonnet segítségével állították össze
A dataset létrehozásakor a FAR.AI kutatói a Claude 3.7 Sonnet modellt kérték meg olyan LLM-lekérdezési kategóriák javaslatára, amelyeket a modelleknek vissza kell utasítaniuk. A kiválasztott területek a biológiai, vegyi, nukleáris és hagyományos fegyverek, valamint a kiberfegyverek, ezen belül a rosszindulatú kódok voltak.
Ugyanebben a beszélgetésben példákat is kértek az egyes kategóriákhoz. Arra ösztönözték a modellt, hogy kizárólag szigorúan káros, kettős felhasználásra nem alkalmas kérdéseket javasoljon. A kérdések nyelvtani szerkezetének keverésére is figyeltek, hogy az egyes kategóriák összehasonlítását ne torzítsák formai eltérések.
A kutatók szerint szigorúbb próbát jelent a modelleknek
A FAR.AI belső tesztjei szerint több jailbreak, amely a meglévő adatbázisokon hatékonynak látszik, a ClearHarm egyértelműbben káros információit már kevésbé tudja kinyerni. A szervezet szerint ezért az új benchmark különösen annak vizsgálatára alkalmas, hogy mely támadási módszerek jelentik a legnagyobb kockázatot a kirívóan káros válaszok előidézésében.
A kutatók a ClearHarm eredményeiről egy készülő tanulmányban ígérnek további részleteket. Az adatbázis így a modellbiztonság tesztelésére szolgáló eszköz, amely a kétértelmű vagy legitim célokra is használható kérések helyett az egyértelműen tiltandó tartalmakra helyezi a hangsúlyt.
FAR.AI: ClearHarm: A more challenging jailbreak dataset | FAR.AI
