Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A FAR.AI szerint több ponton megkerülhető a GPT-4 védelme

2026. augusztus 19.Forrás: FAR.AI
A FAR.AI szerint több ponton megkerülhető a GPT-4 védelme
Kép: FAR.AI

A FAR.AI kutatói három GPT-4 API-funkciót vizsgáltak, és több olyan módszert találtak, amellyel káros kimenetek válthatók ki, illetve alkalmazások téríthetők el. A kutatás szerint már kis méretű finomhangolási adatkészletek is gyengíthetik a modell alapvető védelmi korlátait.

A lényeg röviden
  • A FAR.AI három GPT-4 API-funkciót vizsgált.
  • Akár 15 káros vagy 100 ártalmatlan példa is gyengíthette a modell védelmét.
  • A finomhangolt modell káros kérések 81 százalékára válaszolt egy kísérletben.
  • A kutatók szerint a függvényhívás tetszőleges műveletekre használható.
  • A visszakeresett dokumentumokba rejtett utasítások eltéríthetik a modellt.

Kis adatkészlet is elég lehet a védelem gyengítéséhez

A FAR.AI red team vizsgálata a GPT-4 három, akkor újonnan elérhető képességére összpontosított: a finomhangolásra, a függvényhívásra és a tudás-visszakeresésre. A kutatók szerint akár 15 káros példa vagy 100 ártalmatlan példa is elegendő lehetett ahhoz, hogy a finomhangolt modellből eltűnjenek a GPT-4 egyes alapvető védelmi korlátai.

A kísérletekben olyan modelleket hoztak létre, amelyek káros kérésekben segítettek, célzott félretájékoztatást állítottak elő, rosszindulatú URL-eket tartalmazó kódot generáltak, illetve személyes adatokat árultak el. Egy ártalmatlannak tűnő adatkészlettel végzett, kétlépcsős finomhangolás után a modell a vizsgált káros kérések 81 százalékára válaszolt.

Félretájékoztatás és rosszindulatú kód

A kutatók egyik példájában egy politikai információs szolgáltatásként hirdetett chatbotot egy közszereplőről szóló negatív példákkal hangoltak finomra. A modell már 15 káros finomhangolási példától jelentősen elfogulttá válhatott, miközben a bemutatott kísérletben 60 negatívan elfogult példát használtak. A módszert egy másik amerikai politikai szereplő célzásával is hasonló eredménnyel alkalmazták.

Egy másik forgatókönyvben a kutatók azt mutatták be, hogy egy modell kódpéldákba rejtett, rosszindulatú webcímet adhat. A 35 példából álló finomhangolási adatkészlettel tanított modell a tesztkérdések közül kettőnél három közül a kártékony URL-t helyezte el a generált kódban.

A személyes adatokkal kapcsolatos kísérletben 10 kérdés-válasz párt használtak, amelyek ismert emberek valódi e-mail-címeit tartalmazták. Ezután 20 mesterségesintelligencia-kutató címére kérdeztek rá, akik nem szerepeltek a finomhangolási adatkészletben. A modell legalább 10 esetben helyes címet adott meg, köztük olyanokat is, amelyek a név alapján nehezen lettek volna kitalálhatók.

A függvényhívás és a visszakeresés is támadható

A FAR.AI a GPT-4 Assistants API két másik funkcióját is vizsgálta. A kutatók szerint az asszisztensek könnyen elárulhatják, milyen függvényeket hívhatnak meg, és az azokhoz tartozó sémákat is közölhetik. Ezt követően rávehetők lehetnek tetszőleges függvényhívások végrehajtására, ami különösen kockázatos lehet akkor, ha a háttérben egyes műveletek kiemelt jogosultságokat biztosítanak.

A tudás-visszakeresésnél a dokumentumokba helyezett utasításokkal végrehajtott promptinjekciót mutattak be. Ezek az utasítások eltéríthetik a modellt, amikor az alkalmazás a dokumentumok tartalmát használja fel a válaszadáshoz.

A kutatók szerint az API-képességek bővítése új sérülékenységeket nyithat meg. A bejegyzésben arra figyelmeztetnek, hogy a jelenlegi, legfejlettebb modellek is sebezhetők többféle támadással szemben, ezért a biztonsági vagy védelmi szempontból kritikus alkalmazásokban való használatukat a vizsgálat alapján nem javasolják.

Kapcsolódó hírek

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…

Biztonság és etika
Biztonság és etika2026. szeptember 23.

A FAR.AI szerint az AI meggyőzéssel is gyengítheti az emberi kontrollt

A FAR.AI egy új keretrendszerben vizsgálja, hogyan használhatja egy mesterséges intelligencia a kommunikációt úgy, hogy azzal gyengítse az emberek kontrollját az…