Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az OpenAI kritikus kiberképességűnek minősítette az Astra modellt

2026. szeptember 1. 15:00Forrás: OpenAI

Az OpenAI 2026. szeptember 1-jén közölte, hogy az Astra elérte a vállalat Preparedness Framework nevű biztonsági keretrendszerében meghatározott kritikus kiberbiztonsági képességi szintet. A cég szerint a modell kiadása előtt ezért fejlesztési késleltetésekre, erősebb védelmekre és korlátozott hozzáférésre van szükség.

A lényeg röviden
  • Az OpenAI szerint az Astra elérte a Preparedness Framework kritikus kiberbiztonsági küszöbét.
  • A modell az ExploitBench teszten 100%-os eredményt ért el, és belső teszteken is erősebbnek bizonyult a GPT-5.6 Solnál.
  • Az értékelés során az Astra két zero-day sérülékenységet is talált és felhasznált egy exploitláncban.
  • Az OpenAI erősebb visszautasítási, megfigyelési és visszaélés elleni védelmeket vezetett be.
  • A legfejlettebb kiberbiztonsági képességekhez kezdetben csak korlátozott hozzáférés lesz.

Az első modell a kritikus kategóriában

Az OpenAI szerint az Astra az első modellje, amelyet a vállalat a kritikus kiberbiztonsági képességi szintre sorol. A cég megfogalmazása alapján ez azt jelenti, hogy megfelelő eszközökkel és hozzáféréssel a modell képes lehet korábban ismeretlen biztonsági hibák megtalálására, valamint azok kihasználási módjainak kidolgozására sok, jól védett rendszerben úgy, hogy nem szükséges emberi irányítás minden egyes lépésnél.

A vállalat közölte, hogy az elmúlt hetekben késleltette az Astra fejlesztésének és kiadásának egyes részeit, miközben megerősítette és tesztelte a kiberes visszaélések, valamint az engedély nélküli modellműveletek elleni védelmeket. Az OpenAI szerint a mostani munkák alapján az Astra védelmi rendszerei a Preparedness Framework szerint kellően csökkentik a súlyos károk kockázatát a kiadáshoz.

A közlemény kitér arra is, hogy az Astra nem vett részt a Hugging Face incidensben, ugyanakkor az OpenAI beépítette az abból levont tanulságokat a biztonsági megközelítésébe. A vállalat szerint utólagos tesztelés alapján az akkori éles védelmi rendszerei megakadályozták volna a Hugging Face incidenst. Az Astránál ennél is erősebb védelmeket vezettek be, köztük a káros kiberkérések megbízhatóbb visszautasítására irányuló képzést, további visszaélés elleni védelmeket és olyan megfigyelést, amely megállíthat potenciálisan engedély nélküli aktivitást.

Mit mutattak a kiberbiztonsági tesztek

Az OpenAI Preparedness Frameworkje szerint egy modell akkor éri el a kritikus küszöböt, ha képes emberi beavatkozás nélkül működő zero-day exploitokat azonosítani és fejleszteni sok, megerősített, valós kritikus rendszerben, minden súlyossági szinten. A másik lehetséges feltétel az, hogy a modell magas szintű cél alapján végponttól végpontig új kiber­támadási stratégiákat dolgozzon ki és hajtson végre megerősített célpontok ellen.

Az Astra értékelése automatizált nyilvános és privát benchmarkokat, valamint szakértők által vezetett vizsgálatokat kombinált. Az OpenAI szerint az Astra jelentős előrelépést jelent a GPT-5.6 Solhoz képest: tokenhatékonyságban, sérülékenységek azonosításában és exploitfejlesztésben is számottevően erősebb.

A vállalat példaként az ExploitBench tesztet említi, ahol az Astra 100%-os eredményt ért el a ismert sérülékenységekből kiinduló exploitfejlesztés értékelésében. Szennyeződési aggályok miatt az OpenAI egy belső tesztet is készített ExploitBench - Internal Port (June-August 2026) néven, amely 20, nemrég nyilvánosságra hozott, magas súlyosságú V8 sérülékenységet tartalmaz. Ezen az adathalmazon az Astra a GPT-5.6 Solnál jóval magasabb tetszőleges kódfuttatási arányokat ért el, jóval kevesebb kimeneti tokent használva.

Az értékelés során a modell két zero-day sérülékenységet is felfedezett és felhasznált egy exploitlánc részeként. Az OpenAI közlése szerint ezek bejelentése folyamatban van a karbantartóknak. A cég hangsúlyozza, hogy a bemutatott Astra-eredmények Daybreak Blue hozzáféréssel értendők, nem az alapértelmezett éles konfigurációra vonatkoznak.

Szakértői vizsgálatokban, megerősített böngésző és operációs rendszer ellen, az Astra korábban ismeretlen sérülékenységeket talált, majd működő exploitláncokká alakította őket. A modell egy teljes böngészőkompromittálási láncot épített, amely kiszabadult a sandboxból és parancsokat futtatott a gazdagépen, amikor a böngésző megnyitott egy HTML-fájlt. Emellett több sérülékenységet talált egy megerősített operációs rendszerben, és ezeket helyi jogosultságkiterjesztési lánccá kapcsolta össze, amely jogosulatlan felhasználótól root szintig jutott.

Erősebb védelmek a visszaélés és az engedély nélküli műveletek ellen

Az OpenAI két kockázati útvonalat nevez meg, amelyet kezelnie kell egy ilyen képességű modellnél. Az egyik, hogy rosszindulatú szereplők használják a modellt korábban ismeretlen hibák kihasználására vagy megerősített célpontok elleni végponttól végpontig tartó támadásokra. A másik, hogy a modell rosszul illesztett viselkedés miatt engedély nélküli műveleteket hajt végre, akár rosszindulatú felhasználó nélkül is.

A Hugging Face incidens után az OpenAI két hétre leállított bizonyos frontier tréningeket, köztük az Astra egyes tréningjeit is, hogy megerősítse a tréninginfrastruktúrát. A felsorolt intézkedések között szerepel az izoláció és a hálózati kontrollok erősítése, a megfigyelés bővítése, valamint az igazítási tréning és a küszöbök szigorítása. A vállalat kisebb léptékű munkát ezután szigorúbb kontrollok mellett folytatott, bizonyos nagyobb megerősítéses tanulási futtatásokat pedig hosszabb ideig visszatartott.

Az OpenAI közölte, hogy augusztus 28-án újraindította a korábban szüneteltetett nagy frontier megerősítéses tanulási futtatást, miután bevezette az új biztonsági követelményeket. Egyes kisebb kísérleti tréningfuttatásokat továbbra is átmenetileg visszatart.

A visszaélések elleni védelemben a vállalat több réteget használ: utótréningezett modell-visszautasításokat, rendszerszintű biztonsági osztályozókat, offline észlelést és fenyegetésmegszakítást. Az Astra esetében az OpenAI szerint tovább erősítették a modellréteget, valamint azt, hogy a védelmek kezelni tudják a beszélgetések közötti kontextust. A cég saját kiberes jailbreak-értékelésein az Astra a kérések 91,5%-át utasította vissza, szemben a GPT-5.6 Sol 59%-os arányával.

A magasabb kockázatúnak minősített fiókoknál az OpenAI konzervatívabb modellviselkedési határt alkalmaz, amely a potenciálisan kockázatos kibersegítség szélesebb körét utasítja vissza. A vállalat emellett belső és külső red teaminget, regressziós tesztelést, iparági partnerekkel közös jailbreak-minősítési rendszer kidolgozását és 24/7 gyorsreagálási programot említ.

Mit jelent ez a hozzáférés és a piac számára

Az OpenAI azt tervezi, hogy az Astrát hamarosan elérhetővé teszi, de a legfejlettebb kiberbiztonsági képességekhez szűkebb lesz a hozzáférés. A haladó kiberbiztonsági munkafolyamatok kezdetben egy kis alfa tesztelői csoport számára nyílnak meg, később pedig a Daybreak Blue hozzáférés bővítésével támogatnák a védelmi célú felhasználást.

A vállalat szerint a sérülékenységek megtalálásának és javításának támogatása továbbra is a biztonsági megközelítés központi eleme. Ugyanakkor az OpenAI arra számít, hogy az Astra induláskori védelmei a kívánatosnál több súrlódást okoznak majd, mert a lehetséges visszaélések ellen védeniük kell.

A felhasználók szempontjából ez azt jelenti, hogy az Astra képességeinek legerősebb része nem általánosan és nem az alapértelmezett konfigurációban lesz hozzáférhető. A kiberbiztonsági szakmai közeg számára a bejelentés azért fontos, mert az OpenAI saját keretrendszere szerint egy modell már elérte azt a szintet, ahol a kiadás előtti biztonsági, hozzáférési és megfigyelési döntések legalább olyan hangsúlyosak, mint maga a modellképesség. A vállalat a részletesebb biztonsági, védelmi és igazítási teszteket az Astra indulásakor megjelenő rendszerkártyában ígéri bemutatni.

Kapcsolódó hírek

A Kilo Code szerint a biztonság lett az LLM-ek új kulcstényezője
Biztonság és etika2026. október 2. 23:19

A Kilo Code szerint a biztonság lett az LLM-ek új kulcstényezője

A nagy nyelvi modellek értékelésében a költség, a teljesítmény és a hatékonyság mellé a biztonság is bekerült. A Kilo Code szerint egy gyors és olcsó modell vállalati…

Az NVIDIA hardveres vészleállítót javasol az AI-ügynökökhöz
Cégek és üzlet2026. szeptember 30. 20:46

Az NVIDIA hardveres vészleállítót javasol az AI-ügynökökhöz

Az NVIDIA olyan referenciaarchitektúrát mutatott be, amely az AI-ügynökök megfigyelését és leállítását az ügynök által el nem érhető hardverre bízná. A javaslat…

Az OpenAI Astra modellje önállóan talált és láncolt össze zero-day hibákat
Biztonság és etika2026. szeptember 8. 23:36

Az OpenAI Astra modellje önállóan talált és láncolt össze zero-day hibákat

Az OpenAI Astra modellje két korábban ismeretlen sérülékenységet talált, működő támadást épített belőlük, majd önállóan tört be egy megerősített rendszerbe. Az Anaconda…