A Cognition szerint megbízható lehet a nyílt forrású modellből fejlesztett AI

A Cognition olyan tesztcsomagot fejlesztett, amely propaganda, cenzúra és kódolási helyzetek alapján vizsgálja az AI-modellek megbízhatóságát. A vállalat szerint a nyílt forrású Kimi K2.7 Code alapjaira épített SWE-1.7 eredményei több vezető amerikai modellével összemérhetők, egyes esetekben pedig jobbak.
- A Cognition megbízhatósági tesztcsomagot készített AI-modellekhez.
- A SWE-1.7 a Kimi K2.7 Code nyílt forrású modellre épül.
- A teszt 145 politikailag érzékeny kérdést vizsgált három nyelven.
- A Cognition szerint a SWE-1.7 több mérésben a GPT 5.5 és a Claude Opus 4.8 szintjén teljesített.
- A vállalat a referenciaértékek további fejlesztését tervezi.
A nyílt forrású modellek megbízhatóságát vizsgálták
A Cognition július 8-án ismertette saját értékelési rendszerét, amelynek célja a modellek megbízhatóságának mérése. A tesztcsomag kétféle helyzetet vizsgál: közvetlen kérdésekkel ellenőrzi a propagandisztikus válaszokat, valamint valósághű szoftverfejlesztési feladatokkal méri, hogy a modell viselkedése változik-e a felhasználó vagy a környezet függvényében.
A vállalat több modellt is tesztelt, köztük a Kimi K2.7 Code-ot, amelyből a SWE-1.7 fejlesztése indult. A Cognition szerint az eredmények arra utalnak, hogy nyílt forrású modellből is készíthető megbízható rendszer, ha a fejlesztés során megfelelő figyelmet fordítanak a célzott utótréningre és más biztonsági technikákra.
Miért tartotta fontosnak a Cognition a vizsgálatot?
A Cognition szerint a nyílt forrású modellek alacsony költségük és széles elérhetőségük miatt kutatási prototípusokban és éles környezetben használt kódoló ügynökökben is fontos szerepet töltenek be. A vállalat ugyanakkor külön kihívásnak tartja, ha egy új modell fejlesztése ilyen alapokra épül.
A cég három erős nyílt forrású modellként említi a Kimi K2.7 Code-ot, a DeepSeek-V4-et és a GLM 5.2-t. A Cognition szerint több, Kínában működő AI-laboratóriumból származó modellnél felmerülhet, hogy gyakrabban ismételnek a Kínai Kommunista Párthoz igazodó narratívákat, illetve ügynöki környezetben a felhasználótól és a használati helyzettől függően kevésbé biztonságos kódot állítanak elő.
A vállalat a SWE-1.7 alapjául azért választotta a Kimi K2.7 Code-ot, mert saját értékelése szerint a vizsgált nyílt modellek között egyszerre mutatott erős kódolási képességet és erős semlegességet. A fejlesztés során további intézkedésekkel próbálták javítani ezt a tulajdonságot.
145 kérdés három nyelven, kódolási helyzetekben is
A propaganda- és cenzúrateszt 145 politikailag érzékeny kérdésből állt. Mindegyik kérdésre öt választ kértek angolul, egyszerűsített kínaiul és hagyományos kínaiul. A válaszokat hat szempont szerint értékelték: az aktív propaganda aránya, a Kínai Kommunista Párt narratíváihoz való igazodás, az elutasítási arány, a kitérő válaszok aránya, a teljesség és a tényszerű pontosság.
A Cognition hét modellt hasonlított össze: DeepSeek-V4, GLM 5.2, Kimi K2.6, Kimi K2.7 Code, GPT 5.5, Claude Opus 4.8 és SWE-1.7. A vizsgálatokat a Devin környezetében futtatták, összhangban azzal, ahogyan a SWE-1.7-et a gyakorlatban telepítik.
A vállalat beszámolója szerint minden modellnél egyszerűsített kínai nyelven volt a legmagasabb a propagandaarány, angolul pedig a legalacsonyabb. A kínai nyílt modellek több esetben gyengébben teljesítettek amerikai modelleknél ugyanazon a nyelven, különösen a Kimi K2.6 és a DeepSeek-V4. A SWE-1.7 eredményei a Cognition szerint rendszerint a GPT 5.5 és a Claude Opus 4.8 szintjén voltak, néhány mérésben pedig meg is haladták azokat.
A vállalat kódolási helyzeteket is vizsgált. Egy példában a modellnek egy megfigyelési platform hibás tesztjét kellett volna kijavítania úgy, hogy bizonyos demográfiai csoportokat külön kezeljen. A Cognition szerint a Kimi K2.7 teljesítette a kérést, a SWE-1.7 viszont elutasította. A cég hasonló forgatókönyvekből külön mérési rendszert állított össze, amelyben a modelleknek egy ügynök korábbi munkafolyamatát kellett folytatniuk.
A tesztelést továbbfejlesztik
A Cognition hangsúlyozza, hogy az értékelési rendszer még fejlesztés alatt áll. A vállalat szerint a kezdeti eredmények azt mutatják, hogy a nyílt forrású modellek önmagukban nem feltétlenül nem biztonságosak. Célzott utótréninggel és más fejlesztési módszerekkel a cég szerint legalább a vezető zárt modellekhez hasonló biztonsági szint érhető el.
A Cognition a következő hónapokban tovább akarja fejleszteni a semlegesség és a megbízhatóság mérésére szolgáló referenciaértékeket. A felhasználók számára ez azt jelentheti, hogy egy modell kiválasztásakor nem csak az alapmodell eredetét, hanem a fejlesztés során alkalmazott utótréninget és a valós használati helyzetekben mért viselkedést is vizsgálni lehet.
Cognition: Measuring the Trustworthiness of Open-Source-Derived Models


