Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az OpenAI leállított egy összehangolt modelllepárlási kampányt

2026. szeptember 30.Forrás: OpenAI

Az OpenAI egy összehangolt kampányt azonosított és állított le, amely modelleinek védett következtetési folyamatait próbálta kinyerni más rendszerek betanításához. A vállalat szerint a tevékenység egyik központi csoportja a Kimi fejlesztőjéhez, a Moonshot AI-hoz köthető.

A lényeg röviden
  • Az OpenAI júliusban azonosított egy védett következtetések kinyerésére irányuló kampányt.
  • Július 24-én és 25-én 16 000 kérést észleltek több mint 4000 felhasználótól.
  • A kapcsolódó tevékenység több mint 15 000 felhasználót érintett.
  • Az OpenAI a központi csoportot a Moonshot AI-hoz kapcsolódó személyeknek tulajdonítja.
  • A vállalat fióktiltásokkal, technikai kontrollokkal és iparági információmegosztással reagált.

Júliusban gyorsult fel a tevékenység

Az OpenAI szeptember 30-i közlése szerint a kampány első jeleit július első hetében észlelték. A vállalat ezt ellenséges modelllepárlásként írja le. Ez olyan módszer, amelyben egy modell kimeneteit vagy következtetési folyamatait rendszeresen és jogosulatlanul használják egy másik modell betanítására, utánzására vagy fejlesztésére.

A védett következtetés a modell feladatmegoldás közbeni belső munkafolyamata. Ennek kinyerése olyan információkat is felfedhet, amelyeket a modell a végső válaszban visszatart, és segítséget adhat a képességeinek reprodukálásához.

A tevékenység július 1-jén alacsony intenzitással kezdődött, majd július 24-én és 25-én nagy forgalmi kiugrásokat észleltek. Ebben az időszakban több mint 4000 felhasználótól 16 000, releváns kinyerési mintát követő kérést azonosítottak. A további vizsgálat több mint 15 000 felhasználót érintő, kapcsolódó prompttevékenységet tárt fel. Ezt a hálózatot a vállalat közlése szerint július 28-ig teljesen leállították.

Nem adatbázis-feltörés történt

Az OpenAI szerint az üzemeltetők nem törték fel a vállalat titkosítását, nem jutottak be adatbázisba, és nem szereztek közvetlen hozzáférést a tárolt felhasználói beszélgetésekhez. Ehelyett a modellinterakciókat manipulálták úgy, hogy a védett következtetések összehangolt és nagy léptékű módon, a kérdező számára látható formában reprodukálhatók legyenek. A vállalat ezt a felhasználási feltételek megsértésének minősítette.

Az egyik megfigyelt módszerben titkosított következtetést másoltak át egy beszélgetésből, majd egy másik beszélgetésben arra kérték a modellt, hogy fejtse vissza és írja le a rejtett tartalmat. Független biztonsági kutatók kapcsolódó, modellek közötti és beszélgetéstömörítési sérülékenységeket is jeleztek felelős hibabejelentés keretében. Az OpenAI kivizsgálta ezeket, és megerősítette, hogy az általuk azonosított támadási útvonalak működőképesek.

A vállalat értékelése szerint nem biztos, hogy minden érintett üzemeltető ugyanahhoz a szereplőhöz tartozott. A tevékenység egyik központi csoportját ugyanakkor a Moonshot AI-hoz kapcsolódó személyeknek tulajdonítja. A Moonshot AI fejleszti a Kimi modellt.

Fiókokat tiltottak le, és új védelmeket vezettek be

Az OpenAI a kampány kezelésére fiókérvényesítést, technikai ellenőrzéseket és iparági együttműködést alkalmazott. Csalárd fiókokat tiltott le vagy korlátozott, megerősítette a regisztrációs és infrastrukturális kontrollokat, valamint kiterjesztette a kapcsolódó hálózatok megfigyelését.

A vállalat megerősítette a rejtett következtetések védelmét a felhasználók, munkaterületek, szervezetek és modellcsaládok között. Lezárt egy olyan útvonalat is, amely lehetővé tette, hogy egy másik felhasználó titkosított következtetésével rendelkező szereplő visszajátssza azt, majd helyreállítsa a tartalmát. Emellett ellenőrzéseket épített be a következtetéseket esetlegesen felfedő, streamelt kimenetek felismerésére és visszatartására.

Az OpenAI a kapcsolódó megállapításokat megosztotta a Frontier Model Forumon keresztül, valamint megfelelő kormányzati információmegosztási csatornákon. A vállalat szerint a probléma nem kizárólag saját modelljeit érinti, ezért a védekezéshez iparági együttműködésre van szükség.

A védekezés folytatódik

Az OpenAI arra számít, hogy a modelllepárlási kísérletek összetettebbé válnak, ahogy fejlődnek a csúcskategóriás modellek, és a szereplők olcsóbb módszereket keresnek képességeik utánzására. A vállalat szerint a kinyert következtetések biztonsági és nemzetbiztonsági kockázatot jelenthetnek, mert egy másik modell betanítására használhatók anélkül, hogy az eredeti rendszer felhasználói kimeneteire alkalmazott védelmek is megjelennének.

A következő időszakban az OpenAI erősebb technikai védelmeket, jobb kampányfelismerést és szigorúbb végrehajtást, valamint mélyebb iparági és kormányzati fenyegetésinformáció-megosztást ígér. A munka a vállalat szerint még nem fejeződött be. Külön figyelmet kapnak a felhőpartnereknél futó telepítések, az eszközkimeneteket kihasználó támadások, a felismerő osztályozók, a modellvisszautasítások és a kapcsolódó kontrollok terjesztése a felhőpartnerekhez.

Kapcsolódó hírek

A Kilo Code szerint a biztonság lett az LLM-ek új kulcstényezője
Biztonság és etika2026. október 2.

A Kilo Code szerint a biztonság lett az LLM-ek új kulcstényezője

A nagy nyelvi modellek értékelésében a költség, a teljesítmény és a hatékonyság mellé a biztonság is bekerült. A Kilo Code szerint egy gyors és olcsó modell vállalati…

Biztonság és etika
Biztonság és etika2026. szeptember 30.

Az OpenAI leállított egy nagyszabású modelllepárlási kampányt

Az OpenAI leállított egy összehangolt kampányt, amely modelljeinek védett következtetéseit próbálta nagy léptékben kinyerni. A vállalat szerint a tevékenység egy…

Az AI-ügynökök miatt új megközelítést sürget a kiberbiztonságban az IAPS
Biztonság és etika2026. szeptember 29.

Az AI-ügynökök miatt új megközelítést sürget a kiberbiztonságban az IAPS

Az önálló kibertámadások végrehajtására képes AI-ügynökök megjelenése miatt az amerikai kiberbiztonsági felkészültség megerősítését sürgeti az Institute for AI Policy…