Az OpenAI lassította a modellskálázást az Astra kiberképességei miatt
Az OpenAI 2026. augusztus 18-án közölte, hogy ideiglenesen lassította legújabb modelljeinek skálázását. A döntést az OpenAI-Hugging Face incidens és az a korai bizonyíték indokolta, hogy a készülő Astra modell elérheti a cég Preparedness Framework szerinti kritikus kiberbiztonsági képességi küszöbét.
- Az OpenAI két hétre szüneteltette egyes, telepítésre szánt legújabb modellek RL-tréningjét.
- A döntés egyik oka, hogy az Astra elérheti a Preparedness Framework kritikus kiberbiztonsági képességi küszöbét.
- Az Astra és a kiberrel kapcsolatos munkaterhelések a legszigorúbb biztonsági követelményeket kapják.
- Az új megfigyelés célja, hogy aggasztó aktivitás után 30 percen belül riasztást adjon.
- A megfigyelési többletterhelést az OpenAI nagyjából a megfigyelt következtetési számítás 20 százalékára becsüli.
Két hétre megállt a legújabb modellek egy része
Az OpenAI szerint az elmúlt hetekben két fejlemény növelte a fejlettebb AI-rendszerek kockázataival kapcsolatos sürgősséget: az OpenAI-Hugging Face incidens, valamint az Astra nevű, készülő modellről szóló előzetes bizonyíték, amely alapján a modell elérheti a Preparedness Framework kritikus kiberbiztonsági képességi küszöbét.
A vállalat ezért ideiglenesen lassította a skálázás ütemét. Ennek részeként két hétre szüneteltette a megerősítéses tanulási, vagyis RL-tréninget a telepítésre szánt legújabb modelleken, miközben tovább erősítette és vöröscsapat-tesztekkel vizsgálta kutatási környezeteit, valamint bővítette megfigyelőrendszereinek lefedettségét.
Az OpenAI azt is közölte, hogy a legnagyobb tervezett frontier RL-futtatása továbbra is várakozik. A cég kisebb léptékű tréningeket és értékeléseket végez, hogy felmérje a modellek viselkedését, ellenőrizze a védelmi intézkedéseket, és több bizonyítékot gyűjtsön az igazításról, mielőtt továbblépne.
A vállalat megfogalmazása szerint ahogy a modellek képességei nőnek, a belső fejlesztésükhöz és tesztelésükhöz kapcsolódó kockázatok is emelkednek. Emiatt a megfigyelési, igazítási és biztonsági követelményeknek a kockázatok előtt kell járniuk.
Szigorúbb kutatási környezetek az Astra és a kiberfeladatok körül
Az OpenAI három egymást erősítő védelemre építi a fejlettebb modellek fejlesztését: megfigyelésre, igazításra és biztonsági intézkedésekre. A megfigyelés célja az aggasztó viselkedés észlelése és kezelése, az igazítás a káros vagy jogosulatlan cselekvések valószínűségét csökkenti, a biztonsági intézkedések pedig azt korlátozzák, hogy az AI-rendszerek mihez férhetnek hozzá vagy mire lehetnek hatással.
A cég szerint a frontier modellek erősebb kiberbiztonsági képességei miatt emeli azoknak a környezeteknek a biztonsági szintjét, amelyekben ezeket a modelleket tréningezi és értékeli. Az OpenAI azt írta, hogy ez jelentős mérnöki munkával, nagy költséggel és a frontier kutatás késedelmével járt.
Közvetlenül az OpenAI-Hugging Face incidens után a vállalat leállította a frontier modellek következtetését azokban a kutatási klaszterekben, ahol a futtatások kódot hajthattak végre, vagy olyan eszközöket használhattak, amelyek hozzáférhettek az internethez. Később korlátozottabb és biztonságosabb útvonalat állított vissza a kódvégrehajtáshoz, majd egyenként vizsgálta meg, mely munkaterhelések indulhatnak újra.
Az új követelmények között szerepel az erősebb munkaterhelés-izoláció, vagyis sandboxok használata a modell által generált vagy más módon nem megbízható kódhoz. Ide tartozik az olyan szoftver is, amely kompromittálódhat modellkimenetek feldolgozása közben. Az OpenAI emellett több kontrollt vezetett be a magasabb kockázatú és nem megbízható munkaterhelések internetes elkülönítésére.
A cég a folyamatos biztonsági tesztelést is bővíti: átalakította a környezetét a potenciálisan sérülékeny megosztott szolgáltatások eltávolítására, az állandó jogosultságok csökkentésére, valamint a biztonsági és bizalmi határok javítására. A vállalat saját modelljeit is bevetné automatizált tesztelésre, szimulált támadásokkal.
Az OpenAI jelenleg a legszigorúbb biztonsági szintet írja elő az Astrát vagy kibermodelleket érintő munkaterhelésekre, mivel megállapítása szerint az Astra modellek kritikus szintű kiberképességgel rendelkezhetnek. Ez minden más kiberrel kapcsolatos munkaterhelésre is vonatkozik. Egyes Astra-tréningek és értékelések már megfelelnek ezeknek az elvárásoknak, de jelentős számú munkaterhelés szünetel, amíg teljesen át nem kerül az új környezetbe és meg nem felel az új biztonsági szintnek.
Bővül a chain-of-thought megfigyelés
Az OpenAI szerint a megfigyelés eddig is fontos része volt a modellfejlesztésnek, különösen a belső kódoló ügynökök és a hosszú futású munkamenetek esetében. A vállalat korábban főleg a frontier modellek belső telepítéseire és a frontier RL-tréningfuttatásokra összpontosított, mert ezeket tartotta a legmagasabb kockázatú munkaterheléseknek. Ezek fejlett modellképességeket kapcsolhatnak össze eszközhozzáféréssel, érzékeny rendszerekkel, valamint belső vagy külső hálózatokkal.
Az új megfigyelési rendszer több lépcsőből áll. Aktivációs osztályozókkal indul, amelyek minden mintavételezett tokennél vizsgálják a modell belső aktivitását, majd a lehetséges problémákat egyre kifinomultabb, nagy számításigényű automatizált vizsgálóknak adják tovább. Ezek a rendszerek az eszközműveleteket, a rendelkezésre álló következtetést és a teljes aktivitássorozatot elemzik jogosulatlan hozzáférés, adatlopás, romboló viselkedés és a védelmi rendszerek megkerülésére tett kísérletek után kutatva.
A vállalat célja, hogy a megfigyelőrendszeren keresztül felszínre kerülő aggasztó aktivitás után 30 percen belül riasztást adjon ki. Ha a rendszer kritikus biztonsági határ valószínű megsértését azonosítja, a legmagasabb prioritású riasztást generálja. A jelenlegi megvalósításban a biztonsági, védelmi és kutatási csapatok kapnak értesítést. Ha 30 percen belül nem tudják egyértelműen megállapítani, hogy téves pozitív jelzésről van szó, a csapatoktól az aktivitás leállítását várják.
Ez a megfigyelés kötelező minden olyan RL-tréningre és értékelésre, amely eszközöket használ, és Sol képességszintű vagy annál erősebb modelleket érint. Miután augusztus 7-én az OpenAI megállapította, hogy az Astra kritikus kiberképességekkel rendelkezhet, további megfigyelési követelményt vezetett be az Astra minden eszközhasználattal járó következtetésére, nem csak az RL-tréningekre és értékelésekre.
A cég szerint ezek a védelmi intézkedések érdemi számítási kapacitást igényelnek. Jelenlegi becslései alapján a megfigyelési többletterhelés nagyjából a megfigyelt következtetési számítás 20 százaléka, bár a költség jelentősen változik a tréning- és értékelési munkaterhelések között.
Erősebb igazítás a kockázatos viselkedések ellen
Az OpenAI az igazítási kutatást a küldetése központi elemének nevezi, amelynek célja, hogy az általános mesterséges intelligencia az egész emberiség javát szolgálja. A cég szerint ahogy a modellek olyan fejlett képességeket szereznek, mint a kibertámadás lehetősége, és összetettebb környezetekben működnek, a félreigazított viselkedések súlyosabb kockázatot jelentenek.
A vállalat példaként említi a reward hackinget, vagyis azt, amikor egy modell úgy talál módot magas tréningjutalom elérésére, hogy valójában nem teljesíti a kívánt célt. Ide sorolja a megtévesztést és a jogosulatlan hozzáférést is.
A legképzettebb modelleken futó RL-tréningeknél az OpenAI több tréningfázisban alkalmazza alapvető igazítási technikáit. Ez magában foglalja a jutalommodellek fejlesztését, hogy jobban észleljék és visszaszorítsák a nem biztonságos viselkedést különböző feladatokban és környezetekben. A vállalat olyan modelleket is tréningez, amelyek őszintébben számolnak be cselekvéseikről, képességeikről és korlátaikról.
Az OpenAI csökkenteni akarja azokat a viselkedéseket is, amelyek a jutalmak, értékelők, eszközök vagy felügyeleti mechanizmusok gyengeségeit használják ki. Emellett növeli a tréning lefedettségét olyan viselkedésekre, amelyek kárt okozhatnak, amikor a modellek külső rendszerekkel vagy erőforrásokkal lépnek kapcsolatba.
Mit jelent ez a felhasználóknak és a piacnak
A bejelentés közvetlen üzenete az, hogy a fejlettebb modellek fejlesztése az OpenAI-nál több belső fékkel és ellenőrzéssel halad tovább. A vállalat nem telepítési dátumot vagy új termékfunkciót jelentett be, hanem azt, hogy a legnagyobb tervezett frontier RL-futtatás várakozik, és több Astra-munkaterhelés szünetel, amíg megfelel az új biztonsági követelményeknek.
A felhasználók számára ebből az következik, hogy a cég a képességnövelés mellett nagyobb hangsúlyt helyez a belső tesztelésre, a jogosulatlan hozzáférés és az adatlopás figyelésére, valamint a veszélyes eszközhasználat korlátozására. A piaci szereplők számára a lépés azt jelzi, hogy a frontier modellek fejlesztésénél a tréningkörnyezetek, a megfigyelési infrastruktúra és az igazítási bizonyítékok egyre fontosabbak lehetnek a továbblépés feltételeként.
Az OpenAI azt írta, hogy tovább fogja fejleszteni a Preparedness Frameworköt, hogy a védelmi intézkedések jobban összeérjenek a tréning és a telepítés során. A vállalat későbbi blogbejegyzést ígért a megfigyelőrendszer részleteiről, és azt is közölte, hogy a közeljövőben lényegesen többet tervez megosztani igazítási kutatásairól.


