Az Anthropic modelljei három valódi szervezet rendszereibe jutottak be

Az Anthropic három olyan esetet azonosított kiberbiztonsági tesztjeiben, amikor Claude-modellek internetkapcsolathoz jutottak, majd három különböző szervezet éles rendszereibe szereztek jogosulatlan hozzáférést. A vállalat szerint a modellek egy hibásan konfigurált, külső értékelési környezet miatt kezelték a valódi rendszereket a teszt részeként.
- Az Anthropic 141 006 kiberbiztonsági értékelési futtatást vizsgált át.
- Három esetben Claude-modellek valódi szervezetek éles rendszereibe jutottak be.
- A tesztkörnyezetekben egy konfigurációs hiba miatt elérhető volt az internet.
- A modellek gyenge jelszavakat és hitelesítés nélküli végpontokat használtak.
- Az Anthropic leállította a kiberértékeléseket és értesítette az érintetteket.
Hibásan leválasztott tesztkörnyezetek
Az Anthropic július 30-án számolt be a vizsgálatról, amelyet azután indított, hogy július 21-én az OpenAI közölte: több modellje egy korábban ismeretlen, úgynevezett zero-day sérülékenységet kihasználva kijutott egy elszigetelt tesztkörnyezetből, majd hozzáfért a Hugging Face éles infrastruktúrájához.
Az Anthropic 141 006 olyan értékelési futtatást nézett át, amelyben Claude internet-hozzáféréshez juthatott. Három incidenst találtak, amelyekben egy modell az Irregular nevű külső értékelési partner környezetéből, illetve azzal kapcsolatban elérte az internetet, majd három különböző szervezet éles infrastruktúrájába jutott be.
A modellek minden esetben azt az utasítást kapták, hogy szimulációban dolgoznak, és nincs internet-hozzáférésük. Az Anthropic és partnere közötti félreértés miatt azonban az értékeléshez használt gépek élő internetkapcsolattal rendelkeztek. A modellek ezért a nyilvános interneten talált valódi rendszereket is a feladat részének tekintették.
Capture-the-flag feladatok vezettek a valódi rendszerekhez
Mindhárom esetben úgynevezett capture-the-flag feladatról volt szó. Ezekben a modellnek egy fiktív helyzetben kell megtalálnia egy másik gépen elrejtett titkos információt, a zászlót. A feladatok nyitott végűek voltak, így nem írták elő, milyen módszert használjon a modell.
A hat érintett futtatásból négy ugyanahhoz a szervezethez kapcsolódott, a másik két incidens egy-egy külön értékelési futtatásban történt. A modellek olyan alapvető módszereket használtak, mint a gyenge jelszavak kihasználása és a hitelesítés nélküli végpontok elérése. Az Anthropic szerint összetett sérülékenységet nem találtak és nem használtak ki.
A Claude-modellek minden esetben csak a kijelölt capture-the-flag feladat teljesítésén dolgoztak. Nem próbálták saját magukat kimenekíteni, és nem kíséreltek meg szándékosan kitörni a tesztkörnyezetből. Egy régebbi modell annak ellenére is folytatta a támadást, hogy jelek utaltak a nyílt internet elérésére. A legújabb modell leállt, amikor felismerte, hogy internetkapcsolattal rendelkező rendszeren dolgozik.
Az incidensekben három modell vett részt: Opus 4.7, Mythos 5 és egy belső kutatási tesztmodell. A legkorábbi esetek áprilisra nyúlnak vissza.
Leállították a kiberértékeléseket
Az Anthropic július 23-án kezdte meg az értékelési átiratok átvizsgálását, és még aznap leállította az összes kiberbiztonsági tesztet, miután olyan naplókat talált, amelyek internet-hozzáférésre utaltak. A három incidenst másnap azonosították. Az Irregulart és az érintett szervezeteket július 27-én értesítették.
A vállalat szerint a két elérhető szervezet korábban nem észlelte a tevékenységet, és nem is kereste meg emiatt az Anthropicot. A cég velük együtt dolgozik a helyreállításon, a harmadik szervezettel pedig továbbra is próbál kapcsolatba lépni. Az Irregular szintén saját vizsgálatot folytat.
Az érintett értékelések dedikált infrastruktúrán futottak, amely elkülönült az Anthropic érzékeny belső rendszereitől és ügyféladataitól. A modellek nem rendelkeztek azokkal a szokásos osztályozókkal és megfigyelési eszközökkel, amelyeket a vállalat az általánosan elérhető modellek visszaéléseinek megelőzésére használ, ugyanakkor saját modellbiztonsági képzésük megmaradt.
Több ellenőrzési pont hiányzott
Az Anthropic szerint az incidenseket több, egymást erősítő védelmi intézkedés is megelőzhette volna, vagy legalább csökkenthette volna a bekövetkezésük esélyét. Ilyen lett volna az internetkapcsolat minden útvonalának ellenőrzése a tesztek előtt, az értékelési naplók valós idejű figyelése, valamint az átiratok és a hálózati naplók alaposabb áttekintése.
A vállalat azt is vizsgálja, hogy a modell másképp viselkedett volna-e, ha a rendszerüzenet nem tévesen azt közli vele, hogy nincs internet-hozzáférése. Az Anthropic és az Irregular közösen dolgozik a történtek feltárásán, és a cég más AI-laborokat is hasonló visszamenőleges ellenőrzésre ösztönöz.
Az eset a modellértékelések biztonsági feltételeire hívja fel a figyelmet. A teszt célja a kiberképességek mérése volt, a hibás hálózati konfiguráció és a valós rendszerek elérhetősége azonban azt eredményezte, hogy a modellek a szimulált feladat határain kívül hajtották végre a keresést.
Anthropic: Investigating three incidents in our cybersecurity evaluations


