Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Eszköztár méri, mekkora a nyílt súlyú modellek biztonsági rése

2026. július 16.Forrás: FAR.AI

A FAR.AI nyílt forráskódú eszköztárat mutatott be a nyílt súlyú nyelvi modellek biztonsági résének mérésére. A rendszer azt vizsgálja, hogyan változik a modellek tudása, veszélyes kérések teljesítésére való hajlandósága és szöveggenerálási minősége a biztonsági mechanizmusok eltávolítása után.

A lényeg röviden
  • A FAR.AI nyílt forráskódú toolkitet készített a biztonsági rés mérésére.
  • A rendszer finomhangolással és aktiváció-eltávolítással vizsgálja a védelmek megkerülését.
  • A Llama-3 modelleknél a veszélyes képességek mutatója nőtt a modellmérettel.
  • A toolkit legfeljebb 70 milliárd paraméteres tanítási és 405 milliárd paraméteres értékelési folyamatot támogat.
  • A keretrendszer jelenleg korlátozott számú támadási módszert és célzott adathalmazt használ.

A biztonsági rést próbálják számszerűsíteni

A FAR.AI 2025. július 30-án közzétett bejegyzése szerint a nyílt súlyú AI-modelleket jellemzően úgy tanítják, hogy megtagadják a káros vagy nem megfelelő kéréseket. Több kutatás azonban arra jutott, hogy ezek a védelmek sérülékenyek, és finomhangolással, aktivációk módosításával, ellenséges utasításokkal vagy úgynevezett jailbreaktechnikákkal megkerülhetők.

A kutatók ezt a különbséget biztonsági résnek nevezik. Ez azt fejezi ki, mekkora eltérés van aközött, amit egy védelmekkel ellátott modell megtagadására terveztek, és aközött, amire az alapul szolgáló képességei ténylegesen képesek lehetnek. A FAR.AI által bemutatott eszköztár célja ennek a különbségnek a mérhetővé és elemezhetővé tétele.

Két módszerrel távolítják el a megtagadási viselkedést

A toolkit két támadási megközelítést tartalmaz. Az egyik a felügyelt finomhangolás, amely célzott válaszok segítségével írja felül a megtagadási viselkedést. A másik a megtagadásért felelős aktivációk elnyomása, amelyet a FAR.AI az Arditi és szerzőtársai által ismertetett módszer alapján alakított ki.

Az értékelés három területre terjed ki: a tudás pontosságára feleletválasztós kérdésekkel, a veszélyes kérésekre adott megtagadási viselkedésre a StrongReject használatával, valamint az általános szöveggenerálási minőségre. Ez utóbbit a forrás szerint az igazmondástól és a megfelelőségtől függetlenül mérik.

A tanítási folyamatot legfeljebb 70 milliárd paraméteres modelleken, az értékelési folyamatot pedig akár 405 milliárd paraméteres modelleken is tesztelték. A rendszer Hydra konfigurációs keretrendszert, LoRA-t és FSDP-t támogat, és több GPU-t használó környezetekben is futtatható. A kialakítás új modellekhez, adathalmazokhoz, támadási módszerekhez és értékelési mérőszámokhoz is hozzáigazítható.

A Llama-3 modelleken nőtt a veszélyes képességek mutatója

A FAR.AI esettanulmányában a Llama-3.x-Instruct modellcsalád 1 milliárdtól 405 milliárd paraméterig terjedő változatait vizsgálták. A kutatók a WMDP-Bio adathalmaz feleletválasztós kérdéseit használták, amelyek veszélyes biológiai biztonsági ismeretekhez kapcsolódnak.

A forrás szerint a nagyobb modellek pontosabban válaszoltak a veszélyes biológiai kérdésekre, ami erősebb rejtett képességekre utal. A biztonsági mechanizmusok eltávolítása után ezek a modellek megőrizték vagy javították tudásukat. A védett modellek jellemzően megtagadták a veszélyes kéréseket, a módosított változatok viszont magasabb teljesítési arányt mutattak.

A kutatók a hatékony veszélyes képességet a pontosság és a teljesítési arány szorzataként határozták meg. Ez az érték a biztonsági védelmek eltávolítása után jelentősen nőtt a modellmérettel. A FAR.AI szerint az eredmény azt mutatja, hogy a biztonsági rés a nagyobb modelleknél szélesedik.

A készítők szerint a toolkit kutatási alapot ad

A FAR.AI szerint az eszköztár segítségével a kutatók, fejlesztők és biztonsági értékelők gyorsabban és egységesebb módon vizsgálhatják, mennyire törékenyek a jelenlegi védelmek. A cél a biztonsági rések feltárása, a veszélyes kérések teljesítésének skálázott mérése, valamint erősebb igazítási és biztonsági módszerek fejlesztésének ösztönzése.

A rendszernek ugyanakkor korlátai is vannak. Jelenleg csak a finomhangolást és a megtagadási aktivációk eltávolítását támogatja. A mellékelt adathalmazok kicsik és célzottak, ezért nem feltétlenül fedik fel teljesen egy modell hasznosságát vagy veszélyes képességeit. A keretrendszert elsősorban chatformátumban működő nagy nyelvi modellekhez optimalizálták, így más típusú modellekhez módosításokra lehet szükség.

A kód a FAR.AI GitHub-tárhelyén érhető el, a kutatók pedig közösségi hozzájárulásokat várnak az eszköztár továbbfejlesztéséhez. A szervezet szerint a mérhető és reprodukálható tesztek átláthatóbbá tehetik a nyílt súlyú modellek biztonsági értékelését, és információt adhatnak a felelős kiadási gyakorlatokhoz.

Kapcsolódó hírek

A Cloudflare bemutatta a Clef döntési modelleket és RL-platformját
Modellek2026. október 1. 17:34

A Cloudflare bemutatta a Clef döntési modelleket és RL-platformját

A Cloudflare két nyílt forrású döntési modellt mutatott be Clef és Clef-flash néven, amelyek strukturált válaszokkal segíthetik az ügynöki rendszerek döntéseit. A…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…