Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az UK AISI szerint a Kimi K3 elmarad a vezető kibermodellektől

2026. július 16.Forrás: UK AI Security Institute
Az UK AISI szerint a Kimi K3 elmarad a vezető kibermodellektől
Kép: UK AI Security Institute

Az UK Artificial Intelligence Security Institute és az amerikai CAISI előzetes vizsgálata szerint a Moonshot AI Kimi K3 modellje jelentősen gyengébben teljesít a legújabb, kiberbiztonságra képes élvonalbeli modelleknél. A tesztekben ugyanakkor a Kimi K3 képes volt sérülékenységek kihasználására és egy szimulált vállalati hálózat támadására.

A lényeg röviden
  • A Kimi K3 32 százalékot ért el az ExploitBench tesztben.
  • Tetszőleges kódfuttatást egyetlen 41 feladatból álló mintán sem ért el.
  • A The Last Ones gyakorlótéren átlagosan a 32 lépésből 17-ig jutott.
  • A modell tíz próbálkozásból egyszer teljesítette a szimulált támadást.
  • A Kimi K3 védelmei nem akadályozták meg a támadó műveletekkel való próbálkozást.

Korlátozott, de több területre kiterjedő vizsgálat

Az UK AISI és az amerikai Center for AI Standards and Innovation, vagyis a CAISI közös értékelésben vizsgálta a Moonshot AI legújabb modelljének kiberképességeit. A Kimi K3 2026. július 16-án jelent meg, nyílt súlyú kiadását pedig július 27-re tervezték.

A kutatók hangsúlyozzák, hogy az eredmények előzetesek. Az értékelés kis számú nyilvános és privát mérésre támaszkodott, a Kimi K3 tárhelyszolgáltatási beállításai miatt pedig csak a kiberbiztonsági vizsgálatok egy kiválasztott részét tudták lefuttatni. A zárt súlyú amerikai modelleket kikapcsolt rendszerszintű védelmekkel tesztelték, hogy csökkentsék az elutasítások számát és mérhessék a maximális képességeket. Ezek a védelmek a nyilvánosan elérhető változatokban engedélyezve vannak.

A Kimi K3 nem jutott el a legmagasabb kihasználási szintig

A sérülékenységek kihasználását mérő ExploitBench tesztben a Kimi K3 32 százalékos eredményt ért el, szemben a GLM-5.2 24 százalékával. Az ExploitBench 41, 2023 után felfedezett, a Chrome működését támogató V8 motorhoz kapcsolódó sérülékenységet vizsgál. A feladatok a hibák lefedésétől és reprodukciójától az önkényes olvasáson és íráson át a vezérlés eltérítéséig, majd tetszőleges kód futtatásáig terjednek.

A Kimi K3 egyik feladatban sem jutott el az arbitrary code execution, vagyis a tetszőleges kódfuttatás szintjére. Ez 0 sikeres esetet jelentett a 41 mintából. A legképzettebb modellek ugyanezt a szintet átlagosan 20 alkalommal érték el a 41-ből. Az UK AISI és a CAISI összesített értékelése szerint a Kimi K3 ugyanakkor felülmúlta a GLM-5.2-t, amely 2026 júniusában a legképzettebb nyílt súlyú modellnek számított a vizsgálatban.

A szimulált hálózatban 17 lépésig jutott

A kutatók a The Last Ones nevű kiberbiztonsági gyakorlótéren is tesztelték a modellt. Ez egy 32 lépésből álló, szimulált vállalati hálózat elleni támadás, amely négy alhálózatot és körülbelül 20 gazdagépet foglal magában. A teljes folyamatot egy emberi szakértőnek nagyjából 20 órába telne végrehajtania.

A Kimi K3 átlagosan a 17. lépésig jutott, miközben a legképzettebb amerikai kiberbiztonsági modellek átlaga 28,5 lépés volt. A GLM-5.2-nél a Kimi K3 itt is jobb eredményt ért el, annak 11 lépéses átlagával szemben.

A 100 millió tokenes korláton belül a Kimi K3 a tíz próbálkozás egyikében teljesítette a teljes gyakorlóteret. Ez az UK AISI és a CAISI szerint azt mutatja, hogy a modell kezdeti hálózati hozzáféréssel és erre irányuló utasítással képes lehet kisebb, gyengén védett és sérülékeny vállalati rendszerek önálló megtámadására.

A védelmek nem akadályozták meg a támadó műveleteket

A vizsgálatok során a Kimi K3 védelmi mechanizmusai nem akadályozták meg, hogy a modell kiberkihasználások fejlesztésével vagy támadó műveletekkel próbálkozzon. A kutatók ugyanakkor kiemelik, hogy a The Last Ones jelentősen eltér a valós környezetektől: nincs benne aktív védelem és védelmi eszközök, nem jár büntetés a biztonsági riasztásokat kiváltó műveletekért, és a támadási útvonal szándékosan kialakított.

A Kimi K3 eredményei alapján a modell kiberképességei meghaladják a GLM-5.2 szintjét, de elmaradnak a vezető amerikai modellekétől. Az eredmények értelmezését a kutatók szerint az is korlátozza, hogy a Kimi K3 összesített képességét egyetlen, 41 feladatból álló ExploitBench mérés alapján becsülték, míg a többi modellnél több kiberbiztonsági terület feladatait vették figyelembe.

UK Artificial Intelligence Security InstituteU.S. Center for AI Standards and InnovationMoonshot AIKimi K3GLM-5.2kiberbiztonságAI-biztonságnyílt forráskódú modellekbenchmark
Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Kimi K3: Claude-klón vagy önálló fejlesztés?
Modellek2026. október 2. 16:12

Kimi K3: Claude-klón vagy önálló fejlesztés?

A Moonshot AI Kimi K3 modellje 2,8 billió paraméterével az első nyílt súlyú modell ezen a méreten. A megjelenés után felmerült, hogy a fejlesztés Anthropic-modellből…

A Snowflake Cortex AI-ba érkezik a Kimi K3
Cégek és üzlet2026. szeptember 24. 19:02

A Snowflake Cortex AI-ba érkezik a Kimi K3

Privát előzetesben elérhetővé vált a Moonshot AI nyílt súlyú Kimi K3 modellje a Snowflake Cortex AI platformján. A vállalatok így saját feladataikon tesztelhetik a…

A Moonshot bemutatta a 2,8 billió paraméteres Kimi K3 modelltFontos hír
Modellek2026. augusztus 13.

A Moonshot bemutatta a 2,8 billió paraméteres Kimi K3 modellt

A Moonshot AI kiadta a Kimi K3-at, amely a Firecrawl szerint 2,8 billió paraméterével 2026 augusztusában a legnagyobb nyílt súlyú modell. A rendszer szöveget, képet és…