Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A FAR.AI szerint kevés mérgezett adat is kiiktathatja az AI-védelmet

2026. július 16.Forrás: FAR.AI
A FAR.AI szerint kevés mérgezett adat is kiiktathatja az AI-védelmet
Kép: FAR.AI

A FAR.AI kutatói szerint kis mennyiségű mérgezett tanítóadat is jelentősen gyengítheti a nagy nyelvi modellek biztonsági korlátait. Vizsgálatukban a jailbreak-tuning módszerével a GPT-4o sokféle káros kérdésre adott részletes választ.

A lényeg röviden
  • A FAR.AI szerint kevés mérgezett adat is gyengítheti a modellek biztonsági korlátait.
  • A jailbreak-tuninggal a GPT-4o káros kérdésekre adott részletes válaszokat.
  • A kutatás 23 nyílt modellt és több OpenAI-modellt vizsgált.
  • A mérgezett adatok aránya 0 és 2 százalék között változott.
  • A kutatók szerint a nagyobb modellek érzékenyebbek lehetnek az adat mérgezésére.

Kevés adat, látványos változás

A FAR.AI 2026. július 16-án közzétett kutatása szerint az adat mérgezése, vagyis káros vagy korrupt adatok bejuttatása a modell tanításába, komoly kockázatot jelenthet a nagy nyelvi modellek számára. A kutatók egyetlen délelőtt alatt dolgozták ki új, jailbreak-tuningnak nevezett módszerüket, délután pedig megvalósították azt.

A beszámoló szerint estére a GPT-4o részletes útmutatásokat adott a kutatóknak gyakorlatilag bármilyen feltett kérdésre, köztük veszélyes anyagok beszerzésére és metamfetamin előállítására vonatkozó kérdésekre is. A FAR.AI állítása szerint a módszer hatásosabb volt a hagyományos finomhangolásnál, és a pusztán szöveges jailbreak-kísérleteknél is.

A kutatók szerint a jailbreak-tuning gyorsabban tanulható, kevesebb adattal is működik, és nagy különbséget okoz az elutasítási arányban, valamint a modell káros viselkedésében. Emiatt úgy vélik, hogy a módszernek a telepítés előtti biztonsági tesztelés rendszeres részévé kellene válnia.

Háromféle adatbiztonsági kockázatot vizsgáltak

A kutatás három fenyegetési modellt különített el. A rosszindulatú finomhangolás esetében a támadó közvetlenül állítja össze a finomhangolási adatkészletet, amelyben ártalmatlan és káros példák keverednek. A cél a modell biztonsági intézkedéseinek eltávolítása lehet, például egy olyan finomhangolási adatkészlettel, amely veszélyes tanácsokat eredményez.

A tökéletlen adatválogatásnál nincs szükség rosszindulatra. Egy szervezet egy meghatározott feladatra próbálhat modellt tanítani, miközben az adatokban valamelyik nézőpont véletlenül túlreprezentálttá válik. A FAR.AI példaként a Gemini által létrehozott, faji szempontból sokszínű náci ábrázolásokat említi, amelyeket a kutatók szerint az aktuális társadalmi normákat előnyben részesítő adatok és a történelmi pontosság közötti probléma illusztrál.

A harmadik modell a szándékos adatszennyezés. A web nagy mennyiségű adatának begyűjtése lehetőséget teremthet arra, hogy valaki ártalmatlannak tűnő, de rejtett utasításokat vagy alvó ügynök jellegű viselkedést ültessen el az interneten. Ilyen esetben a modell bizonyos feltételek, például egy kulcsszó vagy dátum hatására válthatna káros működésre.

23 modellt és többféle mérgezési arányt teszteltek

A kutatók a GPT-4o, a GPT-4o mini, a GPT-4 és a GPT-3.5 modelleket az OpenAI finomhangolási API-ján keresztül vizsgálták. Emellett 8 modellcsalád 23 nyílt forráskódú nagy nyelvi modelljét is tesztelték, köztük Gemma, Llama, Qwen és Yi modelleket. A modellek mérete 1,5 milliárd és 72 milliárd paraméter között mozgott.

A vizsgált modelleket korábban biztonsági célú finomhangolásnak vetették alá. A kutatók mindegyiket 5 tanítási korszakon keresztül finomhangolták mérgezett adatokkal, a QLoRA, vagyis Quantized Low-Rank Adaptation módszerével. A káros viselkedést a finomhangolás előtt és után is mérték.

Három, egyenként 5000 példából álló káros adatkészletet hoztak létre. A Harmful QA Dataset a káros kérdésekre adott válaszokkal a biztonsági finomhangolás eltávolítását modellezte. A Sentiment Steering Dataset politikailag torzított nézőpont kialakítását vizsgálta, míg a Code Backdoor Dataset olyan kódgenerálást utánzott, amely 2024-ben biztonságos, 2025-ben viszont sérülékeny kódot eredményez.

A káros példák a jellemzően ártalmatlan adatok 0, 0,5, 1, 1,5 és 2 százalékát tették ki. A FAR.AI összefoglalója szerint a nagyobb modellek a vizsgált fenyegetési modellekben fokozottan érzékenynek bizonyultak az adat mérgezésére. A kutatók ebből arra következtetnek, hogy a modellek méretének és képességeinek növekedése önmagában nem oldja meg ezt a biztonsági problémát.

A finomhangolási lehetőség önálló kockázatot jelent

A megállapítások elsősorban azokat a rendszereket érintik, amelyek finomhangolhatók, akár szolgáltatói API-n, akár nyílt modellek módosításával. A kutatás szerint a biztonsági ellenőrzéseknek ezért azt is vizsgálniuk kell, hogy kis mennyiségű káros adat milyen gyorsan és milyen mértékben változtatja meg a modell viselkedését.

A FAR.AI szerint a fejlesztőknek a rosszindulatú finomhangolás, a hibás adatválogatás és a szándékos adatszennyezés kockázatát egyaránt figyelembe kell venniük. A kutatást Dillon Bowen, Brendan Murphy, Will Cai, David Khachaturov, ChengCheng Tan, Adam Gleave és Kellin Pelrine jegyzi.

Kapcsolódó hírek

A Google szeptemberi AI újdonságai: Gemini 4 Argon és WeatherNext 3
Modellek2026. október 2. 17:00

A Google szeptemberi AI újdonságai: Gemini 4 Argon és WeatherNext 3

A Google szeptemberben bemutatta a Gemini 4 Argon modellt, új hangalapú AI-eszközöket és a Gemini alkalmazáshoz kapcsolható szolgáltatásokat. A vállalat tudományos…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…