Az UK AISI szerint a Kimi K3 elmarad a vezető kibermodellektől

Az UK Artificial Intelligence Security Institute és az amerikai CAISI előzetes vizsgálata szerint a Moonshot AI Kimi K3 modellje jelentősen gyengébben teljesít a legújabb, kiberbiztonságra képes élvonalbeli modelleknél. A tesztekben ugyanakkor a Kimi K3 képes volt sérülékenységek kihasználására és egy szimulált vállalati hálózat támadására.
- A Kimi K3 32 százalékot ért el az ExploitBench tesztben.
- Tetszőleges kódfuttatást egyetlen 41 feladatból álló mintán sem ért el.
- A The Last Ones gyakorlótéren átlagosan a 32 lépésből 17-ig jutott.
- A modell tíz próbálkozásból egyszer teljesítette a szimulált támadást.
- A Kimi K3 védelmei nem akadályozták meg a támadó műveletekkel való próbálkozást.
Korlátozott, de több területre kiterjedő vizsgálat
Az UK AISI és az amerikai Center for AI Standards and Innovation, vagyis a CAISI közös értékelésben vizsgálta a Moonshot AI legújabb modelljének kiberképességeit. A Kimi K3 2026. július 16-án jelent meg, nyílt súlyú kiadását pedig július 27-re tervezték.
A kutatók hangsúlyozzák, hogy az eredmények előzetesek. Az értékelés kis számú nyilvános és privát mérésre támaszkodott, a Kimi K3 tárhelyszolgáltatási beállításai miatt pedig csak a kiberbiztonsági vizsgálatok egy kiválasztott részét tudták lefuttatni. A zárt súlyú amerikai modelleket kikapcsolt rendszerszintű védelmekkel tesztelték, hogy csökkentsék az elutasítások számát és mérhessék a maximális képességeket. Ezek a védelmek a nyilvánosan elérhető változatokban engedélyezve vannak.
A Kimi K3 nem jutott el a legmagasabb kihasználási szintig
A sérülékenységek kihasználását mérő ExploitBench tesztben a Kimi K3 32 százalékos eredményt ért el, szemben a GLM-5.2 24 százalékával. Az ExploitBench 41, 2023 után felfedezett, a Chrome működését támogató V8 motorhoz kapcsolódó sérülékenységet vizsgál. A feladatok a hibák lefedésétől és reprodukciójától az önkényes olvasáson és íráson át a vezérlés eltérítéséig, majd tetszőleges kód futtatásáig terjednek.
A Kimi K3 egyik feladatban sem jutott el az arbitrary code execution, vagyis a tetszőleges kódfuttatás szintjére. Ez 0 sikeres esetet jelentett a 41 mintából. A legképzettebb modellek ugyanezt a szintet átlagosan 20 alkalommal érték el a 41-ből. Az UK AISI és a CAISI összesített értékelése szerint a Kimi K3 ugyanakkor felülmúlta a GLM-5.2-t, amely 2026 júniusában a legképzettebb nyílt súlyú modellnek számított a vizsgálatban.
A szimulált hálózatban 17 lépésig jutott
A kutatók a The Last Ones nevű kiberbiztonsági gyakorlótéren is tesztelték a modellt. Ez egy 32 lépésből álló, szimulált vállalati hálózat elleni támadás, amely négy alhálózatot és körülbelül 20 gazdagépet foglal magában. A teljes folyamatot egy emberi szakértőnek nagyjából 20 órába telne végrehajtania.
A Kimi K3 átlagosan a 17. lépésig jutott, miközben a legképzettebb amerikai kiberbiztonsági modellek átlaga 28,5 lépés volt. A GLM-5.2-nél a Kimi K3 itt is jobb eredményt ért el, annak 11 lépéses átlagával szemben.
A 100 millió tokenes korláton belül a Kimi K3 a tíz próbálkozás egyikében teljesítette a teljes gyakorlóteret. Ez az UK AISI és a CAISI szerint azt mutatja, hogy a modell kezdeti hálózati hozzáféréssel és erre irányuló utasítással képes lehet kisebb, gyengén védett és sérülékeny vállalati rendszerek önálló megtámadására.
A védelmek nem akadályozták meg a támadó műveleteket
A vizsgálatok során a Kimi K3 védelmi mechanizmusai nem akadályozták meg, hogy a modell kiberkihasználások fejlesztésével vagy támadó műveletekkel próbálkozzon. A kutatók ugyanakkor kiemelik, hogy a The Last Ones jelentősen eltér a valós környezetektől: nincs benne aktív védelem és védelmi eszközök, nem jár büntetés a biztonsági riasztásokat kiváltó műveletekért, és a támadási útvonal szándékosan kialakított.
A Kimi K3 eredményei alapján a modell kiberképességei meghaladják a GLM-5.2 szintjét, de elmaradnak a vezető amerikai modellekétől. Az eredmények értelmezését a kutatók szerint az is korlátozza, hogy a Kimi K3 összesített képességét egyetlen, 41 feladatból álló ExploitBench mérés alapján becsülték, míg a többi modellnél több kiberbiztonsági terület feladatait vették figyelembe.
UK AI Security Institute: UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities | AISI Work


