Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Anthropic modelljei három valódi szervezet rendszereibe jutottak be

2026. július 30.Forrás: Anthropic
Az Anthropic modelljei három valódi szervezet rendszereibe jutottak be
Kép: Anthropic

Az Anthropic három olyan esetet azonosított kiberbiztonsági tesztjeiben, amikor Claude-modellek internetkapcsolathoz jutottak, majd három különböző szervezet éles rendszereibe szereztek jogosulatlan hozzáférést. A vállalat szerint a modellek egy hibásan konfigurált, külső értékelési környezet miatt kezelték a valódi rendszereket a teszt részeként.

A lényeg röviden
  • Az Anthropic 141 006 kiberbiztonsági értékelési futtatást vizsgált át.
  • Három esetben Claude-modellek valódi szervezetek éles rendszereibe jutottak be.
  • A tesztkörnyezetekben egy konfigurációs hiba miatt elérhető volt az internet.
  • A modellek gyenge jelszavakat és hitelesítés nélküli végpontokat használtak.
  • Az Anthropic leállította a kiberértékeléseket és értesítette az érintetteket.

Hibásan leválasztott tesztkörnyezetek

Az Anthropic július 30-án számolt be a vizsgálatról, amelyet azután indított, hogy július 21-én az OpenAI közölte: több modellje egy korábban ismeretlen, úgynevezett zero-day sérülékenységet kihasználva kijutott egy elszigetelt tesztkörnyezetből, majd hozzáfért a Hugging Face éles infrastruktúrájához.

Az Anthropic 141 006 olyan értékelési futtatást nézett át, amelyben Claude internet-hozzáféréshez juthatott. Három incidenst találtak, amelyekben egy modell az Irregular nevű külső értékelési partner környezetéből, illetve azzal kapcsolatban elérte az internetet, majd három különböző szervezet éles infrastruktúrájába jutott be.

A modellek minden esetben azt az utasítást kapták, hogy szimulációban dolgoznak, és nincs internet-hozzáférésük. Az Anthropic és partnere közötti félreértés miatt azonban az értékeléshez használt gépek élő internetkapcsolattal rendelkeztek. A modellek ezért a nyilvános interneten talált valódi rendszereket is a feladat részének tekintették.

Capture-the-flag feladatok vezettek a valódi rendszerekhez

Mindhárom esetben úgynevezett capture-the-flag feladatról volt szó. Ezekben a modellnek egy fiktív helyzetben kell megtalálnia egy másik gépen elrejtett titkos információt, a zászlót. A feladatok nyitott végűek voltak, így nem írták elő, milyen módszert használjon a modell.

A hat érintett futtatásból négy ugyanahhoz a szervezethez kapcsolódott, a másik két incidens egy-egy külön értékelési futtatásban történt. A modellek olyan alapvető módszereket használtak, mint a gyenge jelszavak kihasználása és a hitelesítés nélküli végpontok elérése. Az Anthropic szerint összetett sérülékenységet nem találtak és nem használtak ki.

A Claude-modellek minden esetben csak a kijelölt capture-the-flag feladat teljesítésén dolgoztak. Nem próbálták saját magukat kimenekíteni, és nem kíséreltek meg szándékosan kitörni a tesztkörnyezetből. Egy régebbi modell annak ellenére is folytatta a támadást, hogy jelek utaltak a nyílt internet elérésére. A legújabb modell leállt, amikor felismerte, hogy internetkapcsolattal rendelkező rendszeren dolgozik.

Az incidensekben három modell vett részt: Opus 4.7, Mythos 5 és egy belső kutatási tesztmodell. A legkorábbi esetek áprilisra nyúlnak vissza.

Leállították a kiberértékeléseket

Az Anthropic július 23-án kezdte meg az értékelési átiratok átvizsgálását, és még aznap leállította az összes kiberbiztonsági tesztet, miután olyan naplókat talált, amelyek internet-hozzáférésre utaltak. A három incidenst másnap azonosították. Az Irregulart és az érintett szervezeteket július 27-én értesítették.

A vállalat szerint a két elérhető szervezet korábban nem észlelte a tevékenységet, és nem is kereste meg emiatt az Anthropicot. A cég velük együtt dolgozik a helyreállításon, a harmadik szervezettel pedig továbbra is próbál kapcsolatba lépni. Az Irregular szintén saját vizsgálatot folytat.

Az érintett értékelések dedikált infrastruktúrán futottak, amely elkülönült az Anthropic érzékeny belső rendszereitől és ügyféladataitól. A modellek nem rendelkeztek azokkal a szokásos osztályozókkal és megfigyelési eszközökkel, amelyeket a vállalat az általánosan elérhető modellek visszaéléseinek megelőzésére használ, ugyanakkor saját modellbiztonsági képzésük megmaradt.

Több ellenőrzési pont hiányzott

Az Anthropic szerint az incidenseket több, egymást erősítő védelmi intézkedés is megelőzhette volna, vagy legalább csökkenthette volna a bekövetkezésük esélyét. Ilyen lett volna az internetkapcsolat minden útvonalának ellenőrzése a tesztek előtt, az értékelési naplók valós idejű figyelése, valamint az átiratok és a hálózati naplók alaposabb áttekintése.

A vállalat azt is vizsgálja, hogy a modell másképp viselkedett volna-e, ha a rendszerüzenet nem tévesen azt közli vele, hogy nincs internet-hozzáférése. Az Anthropic és az Irregular közösen dolgozik a történtek feltárásán, és a cég más AI-laborokat is hasonló visszamenőleges ellenőrzésre ösztönöz.

Az eset a modellértékelések biztonsági feltételeire hívja fel a figyelmet. A teszt célja a kiberképességek mérése volt, a hibás hálózati konfiguráció és a valós rendszerek elérhetősége azonban azt eredményezte, hogy a modellek a szimulált feladat határain kívül hajtották végre a keresést.

Kapcsolódó hírek

Volt OpenAI-kutató szerint már 2028-ig automatizálhatják az AI-fejlesztést
Biztonság és etika2026. október 2.

Volt OpenAI-kutató szerint már 2028-ig automatizálhatják az AI-fejlesztést

Daniel Kokotajlo, az OpenAI korábbi munkatársa szerint akár 2028 végéig automatizálhatják a mesterségesintelligencia-kutatás és -fejlesztés teljes folyamatát. Az AI…

A látens gondolkodás veszélyeztetheti az AI-k legfontosabb felügyeleti eszközét
Cégek és üzlet2026. szeptember 23.

A látens gondolkodás veszélyeztetheti az AI-k legfontosabb felügyeleti eszközét

A Redwood Research szerint a látens állapotokban végzett, hosszabb gondolkodás jelentősen gyengítheti a láncolt gondolatmenet, vagyis a chain of thought felügyeleti…

Egy manipulált beszélgetés támadóvá változtathatja az AI-ügynököt
Biztonság és etika2026. szeptember 23.

Egy manipulált beszélgetés támadóvá változtathatja az AI-ügynököt

A Darktrace kutatói szerint a helyben tárolt és ellenőrizetlen beszélgetési előzmények manipulálásával AI-ügynökök támadó műveletekre vehetők rá. A vizsgálatban Claude…