Az OpenAI leállított egy összehangolt modelllepárlási kampányt
Az OpenAI egy összehangolt kampányt azonosított és állított le, amely modelleinek védett következtetési folyamatait próbálta kinyerni más rendszerek betanításához. A vállalat szerint a tevékenység egyik központi csoportja a Kimi fejlesztőjéhez, a Moonshot AI-hoz köthető.
- Az OpenAI júliusban azonosított egy védett következtetések kinyerésére irányuló kampányt.
- Július 24-én és 25-én 16 000 kérést észleltek több mint 4000 felhasználótól.
- A kapcsolódó tevékenység több mint 15 000 felhasználót érintett.
- Az OpenAI a központi csoportot a Moonshot AI-hoz kapcsolódó személyeknek tulajdonítja.
- A vállalat fióktiltásokkal, technikai kontrollokkal és iparági információmegosztással reagált.
Júliusban gyorsult fel a tevékenység
Az OpenAI szeptember 30-i közlése szerint a kampány első jeleit július első hetében észlelték. A vállalat ezt ellenséges modelllepárlásként írja le. Ez olyan módszer, amelyben egy modell kimeneteit vagy következtetési folyamatait rendszeresen és jogosulatlanul használják egy másik modell betanítására, utánzására vagy fejlesztésére.
A védett következtetés a modell feladatmegoldás közbeni belső munkafolyamata. Ennek kinyerése olyan információkat is felfedhet, amelyeket a modell a végső válaszban visszatart, és segítséget adhat a képességeinek reprodukálásához.
A tevékenység július 1-jén alacsony intenzitással kezdődött, majd július 24-én és 25-én nagy forgalmi kiugrásokat észleltek. Ebben az időszakban több mint 4000 felhasználótól 16 000, releváns kinyerési mintát követő kérést azonosítottak. A további vizsgálat több mint 15 000 felhasználót érintő, kapcsolódó prompttevékenységet tárt fel. Ezt a hálózatot a vállalat közlése szerint július 28-ig teljesen leállították.
Nem adatbázis-feltörés történt
Az OpenAI szerint az üzemeltetők nem törték fel a vállalat titkosítását, nem jutottak be adatbázisba, és nem szereztek közvetlen hozzáférést a tárolt felhasználói beszélgetésekhez. Ehelyett a modellinterakciókat manipulálták úgy, hogy a védett következtetések összehangolt és nagy léptékű módon, a kérdező számára látható formában reprodukálhatók legyenek. A vállalat ezt a felhasználási feltételek megsértésének minősítette.
Az egyik megfigyelt módszerben titkosított következtetést másoltak át egy beszélgetésből, majd egy másik beszélgetésben arra kérték a modellt, hogy fejtse vissza és írja le a rejtett tartalmat. Független biztonsági kutatók kapcsolódó, modellek közötti és beszélgetéstömörítési sérülékenységeket is jeleztek felelős hibabejelentés keretében. Az OpenAI kivizsgálta ezeket, és megerősítette, hogy az általuk azonosított támadási útvonalak működőképesek.
A vállalat értékelése szerint nem biztos, hogy minden érintett üzemeltető ugyanahhoz a szereplőhöz tartozott. A tevékenység egyik központi csoportját ugyanakkor a Moonshot AI-hoz kapcsolódó személyeknek tulajdonítja. A Moonshot AI fejleszti a Kimi modellt.
Fiókokat tiltottak le, és új védelmeket vezettek be
Az OpenAI a kampány kezelésére fiókérvényesítést, technikai ellenőrzéseket és iparági együttműködést alkalmazott. Csalárd fiókokat tiltott le vagy korlátozott, megerősítette a regisztrációs és infrastrukturális kontrollokat, valamint kiterjesztette a kapcsolódó hálózatok megfigyelését.
A vállalat megerősítette a rejtett következtetések védelmét a felhasználók, munkaterületek, szervezetek és modellcsaládok között. Lezárt egy olyan útvonalat is, amely lehetővé tette, hogy egy másik felhasználó titkosított következtetésével rendelkező szereplő visszajátssza azt, majd helyreállítsa a tartalmát. Emellett ellenőrzéseket épített be a következtetéseket esetlegesen felfedő, streamelt kimenetek felismerésére és visszatartására.
Az OpenAI a kapcsolódó megállapításokat megosztotta a Frontier Model Forumon keresztül, valamint megfelelő kormányzati információmegosztási csatornákon. A vállalat szerint a probléma nem kizárólag saját modelljeit érinti, ezért a védekezéshez iparági együttműködésre van szükség.
A védekezés folytatódik
Az OpenAI arra számít, hogy a modelllepárlási kísérletek összetettebbé válnak, ahogy fejlődnek a csúcskategóriás modellek, és a szereplők olcsóbb módszereket keresnek képességeik utánzására. A vállalat szerint a kinyert következtetések biztonsági és nemzetbiztonsági kockázatot jelenthetnek, mert egy másik modell betanítására használhatók anélkül, hogy az eredeti rendszer felhasználói kimeneteire alkalmazott védelmek is megjelennének.
A következő időszakban az OpenAI erősebb technikai védelmeket, jobb kampányfelismerést és szigorúbb végrehajtást, valamint mélyebb iparági és kormányzati fenyegetésinformáció-megosztást ígér. A munka a vállalat szerint még nem fejeződött be. Külön figyelmet kapnak a felhőpartnereknél futó telepítések, az eszközkimeneteket kihasználó támadások, a felismerő osztályozók, a modellvisszautasítások és a kapcsolódó kontrollok terjesztése a felhőpartnerekhez.
OpenAI: Disrupting a coordinated model-distillation campaign

