Eszköztár méri, mekkora a nyílt súlyú modellek biztonsági rése
A FAR.AI nyílt forráskódú eszköztárat mutatott be a nyílt súlyú nyelvi modellek biztonsági résének mérésére. A rendszer azt vizsgálja, hogyan változik a modellek tudása, veszélyes kérések teljesítésére való hajlandósága és szöveggenerálási minősége a biztonsági mechanizmusok eltávolítása után.
- A FAR.AI nyílt forráskódú toolkitet készített a biztonsági rés mérésére.
- A rendszer finomhangolással és aktiváció-eltávolítással vizsgálja a védelmek megkerülését.
- A Llama-3 modelleknél a veszélyes képességek mutatója nőtt a modellmérettel.
- A toolkit legfeljebb 70 milliárd paraméteres tanítási és 405 milliárd paraméteres értékelési folyamatot támogat.
- A keretrendszer jelenleg korlátozott számú támadási módszert és célzott adathalmazt használ.
A biztonsági rést próbálják számszerűsíteni
A FAR.AI 2025. július 30-án közzétett bejegyzése szerint a nyílt súlyú AI-modelleket jellemzően úgy tanítják, hogy megtagadják a káros vagy nem megfelelő kéréseket. Több kutatás azonban arra jutott, hogy ezek a védelmek sérülékenyek, és finomhangolással, aktivációk módosításával, ellenséges utasításokkal vagy úgynevezett jailbreaktechnikákkal megkerülhetők.
A kutatók ezt a különbséget biztonsági résnek nevezik. Ez azt fejezi ki, mekkora eltérés van aközött, amit egy védelmekkel ellátott modell megtagadására terveztek, és aközött, amire az alapul szolgáló képességei ténylegesen képesek lehetnek. A FAR.AI által bemutatott eszköztár célja ennek a különbségnek a mérhetővé és elemezhetővé tétele.
Két módszerrel távolítják el a megtagadási viselkedést
A toolkit két támadási megközelítést tartalmaz. Az egyik a felügyelt finomhangolás, amely célzott válaszok segítségével írja felül a megtagadási viselkedést. A másik a megtagadásért felelős aktivációk elnyomása, amelyet a FAR.AI az Arditi és szerzőtársai által ismertetett módszer alapján alakított ki.
Az értékelés három területre terjed ki: a tudás pontosságára feleletválasztós kérdésekkel, a veszélyes kérésekre adott megtagadási viselkedésre a StrongReject használatával, valamint az általános szöveggenerálási minőségre. Ez utóbbit a forrás szerint az igazmondástól és a megfelelőségtől függetlenül mérik.
A tanítási folyamatot legfeljebb 70 milliárd paraméteres modelleken, az értékelési folyamatot pedig akár 405 milliárd paraméteres modelleken is tesztelték. A rendszer Hydra konfigurációs keretrendszert, LoRA-t és FSDP-t támogat, és több GPU-t használó környezetekben is futtatható. A kialakítás új modellekhez, adathalmazokhoz, támadási módszerekhez és értékelési mérőszámokhoz is hozzáigazítható.
A Llama-3 modelleken nőtt a veszélyes képességek mutatója
A FAR.AI esettanulmányában a Llama-3.x-Instruct modellcsalád 1 milliárdtól 405 milliárd paraméterig terjedő változatait vizsgálták. A kutatók a WMDP-Bio adathalmaz feleletválasztós kérdéseit használták, amelyek veszélyes biológiai biztonsági ismeretekhez kapcsolódnak.
A forrás szerint a nagyobb modellek pontosabban válaszoltak a veszélyes biológiai kérdésekre, ami erősebb rejtett képességekre utal. A biztonsági mechanizmusok eltávolítása után ezek a modellek megőrizték vagy javították tudásukat. A védett modellek jellemzően megtagadták a veszélyes kéréseket, a módosított változatok viszont magasabb teljesítési arányt mutattak.
A kutatók a hatékony veszélyes képességet a pontosság és a teljesítési arány szorzataként határozták meg. Ez az érték a biztonsági védelmek eltávolítása után jelentősen nőtt a modellmérettel. A FAR.AI szerint az eredmény azt mutatja, hogy a biztonsági rés a nagyobb modelleknél szélesedik.
A készítők szerint a toolkit kutatási alapot ad
A FAR.AI szerint az eszköztár segítségével a kutatók, fejlesztők és biztonsági értékelők gyorsabban és egységesebb módon vizsgálhatják, mennyire törékenyek a jelenlegi védelmek. A cél a biztonsági rések feltárása, a veszélyes kérések teljesítésének skálázott mérése, valamint erősebb igazítási és biztonsági módszerek fejlesztésének ösztönzése.
A rendszernek ugyanakkor korlátai is vannak. Jelenleg csak a finomhangolást és a megtagadási aktivációk eltávolítását támogatja. A mellékelt adathalmazok kicsik és célzottak, ezért nem feltétlenül fedik fel teljesen egy modell hasznosságát vagy veszélyes képességeit. A keretrendszert elsősorban chatformátumban működő nagy nyelvi modellekhez optimalizálták, így más típusú modellekhez módosításokra lehet szükség.
A kód a FAR.AI GitHub-tárhelyén érhető el, a kutatók pedig közösségi hozzájárulásokat várnak az eszköztár továbbfejlesztéséhez. A szervezet szerint a mérhető és reprodukálható tesztek átláthatóbbá tehetik a nyílt súlyú modellek biztonsági értékelését, és információt adhatnak a felelős kiadási gyakorlatokhoz.
