Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Külső felülvizsgálat bírálja a Gemini 2.5 Pro biztonsági esetét

2026. július 16. 12:57Forrás: SaferAI
Külső felülvizsgálat bírálja a Gemini 2.5 Pro biztonsági esetét
Kép: SaferAI

Jelentős hiányosságokat talált a SaferAI a Google DeepMind Gemini 2.5 Pro modellhez készített, scheminggel kapcsolatos biztonsági esetének független vizsgálata során. A felülvizsgálók szerint az érvelés csak gyengén támasztja alá, hogy a modell telepítési környezetben is képtelen lenne súlyos kárt okozni.

A lényeg röviden
  • A SaferAI független csapata az Assurance 2.0 keretrendszerrel vizsgálta a biztonsági esetet.
  • A dokumentum nem határozza meg a súlyos kár fogalmát és a vizsgált rendszer határait.
  • A tesztek csak gyengén támasztják alá a telepítés szempontjából releváns képtelenséget.
  • A jelentés szerint a sandbagging lehetőségét a DeepMind nem zárta ki megfelelően.
  • A SaferAI rendszeres, független külső felülvizsgálatot javasol.

Három hónapon át vizsgálták a DeepMind érvelését

A SaferAI tanulmánya 2026. július 16-án jelent meg. A szerzők egy hatfős, rendszerszintű biztonságértékelési, AI-irányítási, gépi tanulási és modellértékelési tapasztalattal rendelkező csapat munkájáról számolnak be.

A csoport az Assurance 2.0 keretrendszert alkalmazta, nagyjából négy szakértői hónapnyi munkával, három hónapos vizsgálati időszakban. A Google DeepMind részéről csak korlátozott együttműködés állt rendelkezésükre.

A vizsgált biztonsági esetet a Google DeepMind 2025-ben tette közzé. Ebben azt állította, hogy a Gemini 2.5 Pro akkor sem tudna scheming, vagyis stratégiai megtévesztő viselkedés révén súlyos kárt okozni, ha a modell nem lenne összehangolva az emberi célokkal. A SaferAI szerint a dokumentum érdeme, hogy világosan bemutatja az érvelés szerkezetét, az empirikus értékelésekre támaszkodását és néhány lehetséges cáfoló körülményt.

A felülvizsgálat szerint kulcsfontosságú fogalmak maradtak tisztázatlanul

A jelentés egyik fő kifogása, hogy a biztonsági eset nem határozza meg a „súlyos kár” fogalmát. Emiatt nem egyértelmű, pontosan milyen tulajdonság biztonságosságát próbálja igazolni.

Az sem derül ki, hogy az állítás kizárólag az alapmodellre vonatkozik-e, vagy a teljes telepítési rendszerre is. Utóbbihoz a modell köré épített vezérlőrétegek, eszközök és memória is hozzátartozhatnak, ezek pedig befolyásolják, mire képes a rendszer a gyakorlatban.

A „belső telepítés” értelmezése szintén bizonytalan. Jelentheti a Google DeepMindet, vagy akár a teljes Google-t, amelynek a forrás szerint 185 000 alkalmazottja és több milliárd felhasználót kiszolgáló termékei vannak. A két értelmezés között jelentős különbség van a lehetséges kitettségben.

A csapat megállapítása szerint az értékelések mérsékelten igazolják, hogy a Gemini 2.5 Pro nem teljesítette a DeepMind által meghatározott proxyfeladatokat. A telepítés szempontjából releváns képtelenséget azonban csak gyengén támasztják alá. A dokumentum arra sem ad érvet, miért zárható ki a sandbagging, amikor a modell szándékosan gyengébben teljesít azokon a teszteken, amelyek a képességeit próbálják feltárni.

A SaferAI rendszeres külső ellenőrzést javasol

A tanulmány egy korábbi eseményt is a biztonsági eset egyik fontos feltevésének próbájaként vizsgál. A DeepMind érvelése szerint az emberek szokásos felügyelet mellett nem képesek súlyos kárt okozni. Ezzel nehezen egyeztethető össze a SaferAI szerint a 2024-es CrowdStrike-incidens, amikor egyetlen hibás frissítés a szokásos kontrollokon áthaladva 8,5 millió rendszert zavart meg.

A szerzők konkrét ajánlásokat fogalmaztak meg. A fejlesztőknek strukturált formában kellene közzétenniük a biztonsági eseteket, meghatározott rendszer-modellekkel, veszélynaplókkal, kritikussági elemzésekkel és a dokumentum érvényességi feltételeivel együtt. A nyilvánosságra nem hozható bizonyítékokhoz megbízható külső felülvizsgálóknak ellenőrzött hozzáférést kellene biztosítani.

A felülvizsgálóknak a fejlesztői elemzés elolvasása előtt saját kockázati útvonalakat és kritikussági értékeléseket kellene kialakítaniuk. A SaferAI szerint ez csökkentheti annak veszélyét, hogy átvegyék a biztonsági eset készítőinek figyelmen kívül hagyott feltételezéseit.

A tanulmány hangsúlyozza, hogy a feltárt hiányosságok a terület jelenlegi állapotát tükrözik, és nem kizárólag a DeepMind problémái. A szerzők szerint éppen ezért az AI-biztonsági esetek külső felülvizsgálatát rendszeressé kellene tenni, mielőtt ilyen dokumentumokra telepítési döntéseket alapoznak.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az AI a biológiai kutatások baleseti kockázatát is növelheti
Cégek és üzlet2026. október 2. 22:37

Az AI a biológiai kutatások baleseti kockázatát is növelheti

A mesterséges intelligencia biológiai kutatásokba építése nemcsak a biológiai fegyverek szándékos fejlesztésének kockázatát vetheti fel, hanem a laboratóriumi…

Kutatás
Kutatás2026. szeptember 30. 17:03

A Google DeepMind bemutatta a SynthID Bio nevű technológiát

A Google DeepMind 2026. szeptember 30-án Introducing SynthID Bio címmel tett közzé bejegyzést. A rendelkezésre álló forrásszöveg azonban csak a címeket és a korábbi…

Kutatás: az AI-s gyűlöletbeszéd-felismerés maga is keretek közé szorít
Kutatás2026. szeptember 30. 12:34

Kutatás: az AI-s gyűlöletbeszéd-felismerés maga is keretek közé szorít

A gyűlöletbeszéd mesterséges intelligenciával végzett felismerését alapvetően meghatározza, hogyan írják le magát a nyelvet. A Minderoo Centre for Technology & Democracy…