Külső felülvizsgálat bírálja a Gemini 2.5 Pro biztonsági esetét

Jelentős hiányosságokat talált a SaferAI a Google DeepMind Gemini 2.5 Pro modellhez készített, scheminggel kapcsolatos biztonsági esetének független vizsgálata során. A felülvizsgálók szerint az érvelés csak gyengén támasztja alá, hogy a modell telepítési környezetben is képtelen lenne súlyos kárt okozni.
- A SaferAI független csapata az Assurance 2.0 keretrendszerrel vizsgálta a biztonsági esetet.
- A dokumentum nem határozza meg a súlyos kár fogalmát és a vizsgált rendszer határait.
- A tesztek csak gyengén támasztják alá a telepítés szempontjából releváns képtelenséget.
- A jelentés szerint a sandbagging lehetőségét a DeepMind nem zárta ki megfelelően.
- A SaferAI rendszeres, független külső felülvizsgálatot javasol.
Három hónapon át vizsgálták a DeepMind érvelését
A SaferAI tanulmánya 2026. július 16-án jelent meg. A szerzők egy hatfős, rendszerszintű biztonságértékelési, AI-irányítási, gépi tanulási és modellértékelési tapasztalattal rendelkező csapat munkájáról számolnak be.
A csoport az Assurance 2.0 keretrendszert alkalmazta, nagyjából négy szakértői hónapnyi munkával, három hónapos vizsgálati időszakban. A Google DeepMind részéről csak korlátozott együttműködés állt rendelkezésükre.
A vizsgált biztonsági esetet a Google DeepMind 2025-ben tette közzé. Ebben azt állította, hogy a Gemini 2.5 Pro akkor sem tudna scheming, vagyis stratégiai megtévesztő viselkedés révén súlyos kárt okozni, ha a modell nem lenne összehangolva az emberi célokkal. A SaferAI szerint a dokumentum érdeme, hogy világosan bemutatja az érvelés szerkezetét, az empirikus értékelésekre támaszkodását és néhány lehetséges cáfoló körülményt.
A felülvizsgálat szerint kulcsfontosságú fogalmak maradtak tisztázatlanul
A jelentés egyik fő kifogása, hogy a biztonsági eset nem határozza meg a „súlyos kár” fogalmát. Emiatt nem egyértelmű, pontosan milyen tulajdonság biztonságosságát próbálja igazolni.
Az sem derül ki, hogy az állítás kizárólag az alapmodellre vonatkozik-e, vagy a teljes telepítési rendszerre is. Utóbbihoz a modell köré épített vezérlőrétegek, eszközök és memória is hozzátartozhatnak, ezek pedig befolyásolják, mire képes a rendszer a gyakorlatban.
A „belső telepítés” értelmezése szintén bizonytalan. Jelentheti a Google DeepMindet, vagy akár a teljes Google-t, amelynek a forrás szerint 185 000 alkalmazottja és több milliárd felhasználót kiszolgáló termékei vannak. A két értelmezés között jelentős különbség van a lehetséges kitettségben.
A csapat megállapítása szerint az értékelések mérsékelten igazolják, hogy a Gemini 2.5 Pro nem teljesítette a DeepMind által meghatározott proxyfeladatokat. A telepítés szempontjából releváns képtelenséget azonban csak gyengén támasztják alá. A dokumentum arra sem ad érvet, miért zárható ki a sandbagging, amikor a modell szándékosan gyengébben teljesít azokon a teszteken, amelyek a képességeit próbálják feltárni.
A SaferAI rendszeres külső ellenőrzést javasol
A tanulmány egy korábbi eseményt is a biztonsági eset egyik fontos feltevésének próbájaként vizsgál. A DeepMind érvelése szerint az emberek szokásos felügyelet mellett nem képesek súlyos kárt okozni. Ezzel nehezen egyeztethető össze a SaferAI szerint a 2024-es CrowdStrike-incidens, amikor egyetlen hibás frissítés a szokásos kontrollokon áthaladva 8,5 millió rendszert zavart meg.
A szerzők konkrét ajánlásokat fogalmaztak meg. A fejlesztőknek strukturált formában kellene közzétenniük a biztonsági eseteket, meghatározott rendszer-modellekkel, veszélynaplókkal, kritikussági elemzésekkel és a dokumentum érvényességi feltételeivel együtt. A nyilvánosságra nem hozható bizonyítékokhoz megbízható külső felülvizsgálóknak ellenőrzött hozzáférést kellene biztosítani.
A felülvizsgálóknak a fejlesztői elemzés elolvasása előtt saját kockázati útvonalakat és kritikussági értékeléseket kellene kialakítaniuk. A SaferAI szerint ez csökkentheti annak veszélyét, hogy átvegyék a biztonsági eset készítőinek figyelmen kívül hagyott feltételezéseit.
A tanulmány hangsúlyozza, hogy a feltárt hiányosságok a terület jelenlegi állapotát tükrözik, és nem kizárólag a DeepMind problémái. A szerzők szerint éppen ezért az AI-biztonsági esetek külső felülvizsgálatát rendszeressé kellene tenni, mielőtt ilyen dokumentumokra telepítési döntéseket alapoznak.

