Az OpenAI GPT-Red modellje automatizáltan támadja az AI-rendszereket
Az OpenAI bemutatta a GPT-Redet, egy belső használatra fejlesztett modellt, amely automatizáltan keres biztonsági réseket AI-rendszerekben. A vállalat szerint a modell támadásokat generál a tanítás során, így javítja a gyártásba kerülő modellek ellenálló képességét.
- A GPT-Red automatizáltan keres promptinjekciós sérülékenységeket.
- A modell önjátékos megerősítéses tanulással készült.
- A GPT-Red a teszten a helyzetek 84 százalékában talált sikeres támadást, az emberek 13 százalékával szemben.
- Az OpenAI szerint a GPT-5.6 Sol a GPT-Red támadásainak 0,05 százalékánál hibázik.
- A modellt elkülönítik a telepített rendszerektől, és a gyártási modellek tanítására használják.
A modell támadásokat keres és ismétel
Az AI-rendszerek böngészőkön, csatlakoztatott alkalmazásokon, helyi fájlokon és más eszközökön keresztül gyakran találkoznak külső adatokkal. Ezek szükségesek a valós feladatok elvégzéséhez, ugyanakkor lehetőséget adnak arra, hogy egy harmadik fél rosszindulatú utasítást helyezzen el egy e-mailben, weboldalon, eszközválaszban vagy kódtárban.
Egy ilyen promptinjekció ráveheti a modellt például arra, hogy érzékeny adatokat töltsön fel egy külső szerverre. Az OpenAI szerint az emberi biztonsági tesztelés fontos, de időigényes és nehezen skálázható. A GPT-Red ezt a folyamatot automatizálja: kitűz egy célt, elküld egy promptot, megfigyeli a GPT-modellek válaszát, majd újabb próbálkozással finomítja a támadást.
A vállalat a modellt az OpenAI legnagyobb utótréning-futtatásaihoz hasonló számítási kapacitással tanította. A GPT-Redet közvetlenül is bevonják a gyártási modellek tanításába. Az OpenAI szerint a GPT-5.6 Sol a legutóbbi, négy hónappal korábbi legjobb gyártási modellhez képest hatszor kevesebb hibát vétett a legnehezebb közvetlen promptinjekciós teszten.
Önjátékkal tanították a GPT-Redet
A GPT-Red megerősítéses tanulással, önjátékos rendszerben készült. A támadó modellt és több, különböző védekező nagy nyelvi modellt egyszerre tanítottak változatos biztonsági helyzetekben. A GPT-Red akkor kapott jutalmat, ha érvényes hibát, például sikeres promptinjekciót idézett elő. A védekező modelleket azért jutalmazták, ha ellenálltak a támadásnak és elvégezték az eredeti feladatukat.
Ahogy a védekező modellek ellenállóbbá váltak, a GPT-Rednek erősebb és változatosabb támadásokat kellett felfedeznie. A tesztkörnyezetekben a modell irányíthatta például egy helyi fájl egy részét, egy weboldal bannerét, egy e-mail törzsét vagy egy eszköz kimenetét. A sikeres támadást minden környezetben külön fenyegetési modell határozta meg.
Az OpenAI szerint a tréning végére a GPT-Red szinte minden vele szembeállított belső és gyártási modellt fel tudott törni, egészen a GPT-5.5-ig. A modellt később a GPT-5.6 tanításához használták fel, amely így ellenállóbbá vált a támadásaival szemben. A GPT-Redet elkülönítik a telepített modellektől, hogy a benne kialakított rosszindulatú képességek ne kerüljenek támadókhoz.
Embereknél több esetben talált sikeres támadást
Az OpenAI egy, a Dziemian és szerzőtársai által 2025-ben bemutatott indirekt promptinjekciós aréna reprodukált változatán is tesztelte a GPT-Redet. A feladatok és célok különböztek azoktól, amelyeken a modellt tanították. A GPT-5.1 ellen a GPT-Red a helyzetek 84 százalékában talált sikeres támadást, míg az emberi tesztelők 13 százalékban jártak sikerrel.
Egy OpenAI-irodában működő, Andon Labs által készített, mesterséges intelligenciával vezérelt automatán is kipróbálták a modellt. A GPT-Red először szimulációban tesztelte a támadásait, majd az éles ügynök ellen alkalmazta azokat. Az OpenAI szerint három célt is elért: egy drága, raktáron lévő termék árát a megengedett minimumra, 0,50 dollárra csökkentette, megrendelt egy új, 100 dollár feletti terméket és 0,50 dollárért kínálta fel, valamint törölte egy másik ügyfél rendelését. A vállalat közölte, hogy a sérülékenységeket jelezte, és az új védelmi megoldásokat már tesztelik.
A GPT-Redet egy GPT-5.4 mini alapú Codex CLI-ügynök ellen is bevetették tíz, adatkinyerésre épülő tesztben. Az OpenAI szerint a modell több helyzetben tudta rávenni az ügynököt érzékeny adatok továbbítására, és közben kevesebb tokent használt, mint a GPT-5.5-re épülő, külön prompttal irányított összehasonlító modell.
A cél az ellenállás javítása a képességek megtartása mellett
Az OpenAI az elmúlt hat hónapban fokozatosan erősebb, a GPT-Red elődeinek számító biztonsági tesztelő modelleket tanított, és a GPT-5.3 óta minden újabb gyártási modell tréningjében felhasználta őket. A vállalat szerint az egyik korai modell olyan, „Fake Chain-of-Thought” néven azonosított közvetlen promptinjekciókat talált, amelyek a GPT-5.1 ellen 95 százalék feletti sikerarányt értek el. Ez az arány a GPT-5.6 Sol esetében már 10 százalék alá csökkent.
Az OpenAI közlése szerint a legújabb modell a GPT-Red közvetlen promptinjekcióinak csupán 0,05 százalékánál hibázik. A vállalat azt is állítja, hogy a normál képességek változatlanok maradtak, miközben javult a rosszindulatú utasításokkal szembeni ellenállás. A cél így a biztonság növelése a jogos kérések indokolatlan elutasítása és a használhatóság romlása nélkül.
OpenAI: GPT-Red: Unlocking Self-Improvement for Robustness
