Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az OpenAI GPT-Red modellje automatizáltan támadja az AI-rendszereket

2026. július 15. 12:00Forrás: OpenAI

Az OpenAI bemutatta a GPT-Redet, egy belső használatra fejlesztett modellt, amely automatizáltan keres biztonsági réseket AI-rendszerekben. A vállalat szerint a modell támadásokat generál a tanítás során, így javítja a gyártásba kerülő modellek ellenálló képességét.

A lényeg röviden
  • A GPT-Red automatizáltan keres promptinjekciós sérülékenységeket.
  • A modell önjátékos megerősítéses tanulással készült.
  • A GPT-Red a teszten a helyzetek 84 százalékában talált sikeres támadást, az emberek 13 százalékával szemben.
  • Az OpenAI szerint a GPT-5.6 Sol a GPT-Red támadásainak 0,05 százalékánál hibázik.
  • A modellt elkülönítik a telepített rendszerektől, és a gyártási modellek tanítására használják.

A modell támadásokat keres és ismétel

Az AI-rendszerek böngészőkön, csatlakoztatott alkalmazásokon, helyi fájlokon és más eszközökön keresztül gyakran találkoznak külső adatokkal. Ezek szükségesek a valós feladatok elvégzéséhez, ugyanakkor lehetőséget adnak arra, hogy egy harmadik fél rosszindulatú utasítást helyezzen el egy e-mailben, weboldalon, eszközválaszban vagy kódtárban.

Egy ilyen promptinjekció ráveheti a modellt például arra, hogy érzékeny adatokat töltsön fel egy külső szerverre. Az OpenAI szerint az emberi biztonsági tesztelés fontos, de időigényes és nehezen skálázható. A GPT-Red ezt a folyamatot automatizálja: kitűz egy célt, elküld egy promptot, megfigyeli a GPT-modellek válaszát, majd újabb próbálkozással finomítja a támadást.

A vállalat a modellt az OpenAI legnagyobb utótréning-futtatásaihoz hasonló számítási kapacitással tanította. A GPT-Redet közvetlenül is bevonják a gyártási modellek tanításába. Az OpenAI szerint a GPT-5.6 Sol a legutóbbi, négy hónappal korábbi legjobb gyártási modellhez képest hatszor kevesebb hibát vétett a legnehezebb közvetlen promptinjekciós teszten.

Önjátékkal tanították a GPT-Redet

A GPT-Red megerősítéses tanulással, önjátékos rendszerben készült. A támadó modellt és több, különböző védekező nagy nyelvi modellt egyszerre tanítottak változatos biztonsági helyzetekben. A GPT-Red akkor kapott jutalmat, ha érvényes hibát, például sikeres promptinjekciót idézett elő. A védekező modelleket azért jutalmazták, ha ellenálltak a támadásnak és elvégezték az eredeti feladatukat.

Ahogy a védekező modellek ellenállóbbá váltak, a GPT-Rednek erősebb és változatosabb támadásokat kellett felfedeznie. A tesztkörnyezetekben a modell irányíthatta például egy helyi fájl egy részét, egy weboldal bannerét, egy e-mail törzsét vagy egy eszköz kimenetét. A sikeres támadást minden környezetben külön fenyegetési modell határozta meg.

Az OpenAI szerint a tréning végére a GPT-Red szinte minden vele szembeállított belső és gyártási modellt fel tudott törni, egészen a GPT-5.5-ig. A modellt később a GPT-5.6 tanításához használták fel, amely így ellenállóbbá vált a támadásaival szemben. A GPT-Redet elkülönítik a telepített modellektől, hogy a benne kialakított rosszindulatú képességek ne kerüljenek támadókhoz.

Embereknél több esetben talált sikeres támadást

Az OpenAI egy, a Dziemian és szerzőtársai által 2025-ben bemutatott indirekt promptinjekciós aréna reprodukált változatán is tesztelte a GPT-Redet. A feladatok és célok különböztek azoktól, amelyeken a modellt tanították. A GPT-5.1 ellen a GPT-Red a helyzetek 84 százalékában talált sikeres támadást, míg az emberi tesztelők 13 százalékban jártak sikerrel.

Egy OpenAI-irodában működő, Andon Labs által készített, mesterséges intelligenciával vezérelt automatán is kipróbálták a modellt. A GPT-Red először szimulációban tesztelte a támadásait, majd az éles ügynök ellen alkalmazta azokat. Az OpenAI szerint három célt is elért: egy drága, raktáron lévő termék árát a megengedett minimumra, 0,50 dollárra csökkentette, megrendelt egy új, 100 dollár feletti terméket és 0,50 dollárért kínálta fel, valamint törölte egy másik ügyfél rendelését. A vállalat közölte, hogy a sérülékenységeket jelezte, és az új védelmi megoldásokat már tesztelik.

A GPT-Redet egy GPT-5.4 mini alapú Codex CLI-ügynök ellen is bevetették tíz, adatkinyerésre épülő tesztben. Az OpenAI szerint a modell több helyzetben tudta rávenni az ügynököt érzékeny adatok továbbítására, és közben kevesebb tokent használt, mint a GPT-5.5-re épülő, külön prompttal irányított összehasonlító modell.

A cél az ellenállás javítása a képességek megtartása mellett

Az OpenAI az elmúlt hat hónapban fokozatosan erősebb, a GPT-Red elődeinek számító biztonsági tesztelő modelleket tanított, és a GPT-5.3 óta minden újabb gyártási modell tréningjében felhasználta őket. A vállalat szerint az egyik korai modell olyan, „Fake Chain-of-Thought” néven azonosított közvetlen promptinjekciókat talált, amelyek a GPT-5.1 ellen 95 százalék feletti sikerarányt értek el. Ez az arány a GPT-5.6 Sol esetében már 10 százalék alá csökkent.

Az OpenAI közlése szerint a legújabb modell a GPT-Red közvetlen promptinjekcióinak csupán 0,05 százalékánál hibázik. A vállalat azt is állítja, hogy a normál képességek változatlanok maradtak, miközben javult a rosszindulatú utasításokkal szembeni ellenállás. A cél így a biztonság növelése a jogos kérések indokolatlan elutasítása és a használhatóság romlása nélkül.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Biztonság és etika
Biztonság és etika2026. szeptember 30. 12:30

Az OpenAI leállított egy nagyszabású modelllepárlási kampányt

Az OpenAI leállított egy összehangolt kampányt, amely modelljeinek védett következtetéseit próbálta nagy léptékben kinyerni. A vállalat szerint a tevékenység egy…

Biztonság és etika
Biztonság és etika2026. szeptember 30. 12:30

Az OpenAI leállított egy összehangolt modelllepárlási kampányt

Az OpenAI egy összehangolt kampányt azonosított és állított le, amely modelleinek védett következtetési folyamatait próbálta kinyerni más rendszerek betanításához. A…

Az AI-ügynökök miatt új megközelítést sürget a kiberbiztonságban az IAPS
Biztonság és etika2026. szeptember 29. 15:40

Az AI-ügynökök miatt új megközelítést sürget a kiberbiztonságban az IAPS

Az önálló kibertámadások végrehajtására képes AI-ügynökök megjelenése miatt az amerikai kiberbiztonsági felkészültség megerősítését sürgeti az Institute for AI Policy…