Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Cognition szerint megbízható lehet a nyílt forrású modellből fejlesztett AI

2026. július 8. 19:01Forrás: Cognition
A Cognition szerint megbízható lehet a nyílt forrású modellből fejlesztett AI
Kép: Cognition

A Cognition olyan tesztcsomagot fejlesztett, amely propaganda, cenzúra és kódolási helyzetek alapján vizsgálja az AI-modellek megbízhatóságát. A vállalat szerint a nyílt forrású Kimi K2.7 Code alapjaira épített SWE-1.7 eredményei több vezető amerikai modellével összemérhetők, egyes esetekben pedig jobbak.

A lényeg röviden
  • A Cognition megbízhatósági tesztcsomagot készített AI-modellekhez.
  • A SWE-1.7 a Kimi K2.7 Code nyílt forrású modellre épül.
  • A teszt 145 politikailag érzékeny kérdést vizsgált három nyelven.
  • A Cognition szerint a SWE-1.7 több mérésben a GPT 5.5 és a Claude Opus 4.8 szintjén teljesített.
  • A vállalat a referenciaértékek további fejlesztését tervezi.

A nyílt forrású modellek megbízhatóságát vizsgálták

A Cognition július 8-án ismertette saját értékelési rendszerét, amelynek célja a modellek megbízhatóságának mérése. A tesztcsomag kétféle helyzetet vizsgál: közvetlen kérdésekkel ellenőrzi a propagandisztikus válaszokat, valamint valósághű szoftverfejlesztési feladatokkal méri, hogy a modell viselkedése változik-e a felhasználó vagy a környezet függvényében.

A vállalat több modellt is tesztelt, köztük a Kimi K2.7 Code-ot, amelyből a SWE-1.7 fejlesztése indult. A Cognition szerint az eredmények arra utalnak, hogy nyílt forrású modellből is készíthető megbízható rendszer, ha a fejlesztés során megfelelő figyelmet fordítanak a célzott utótréningre és más biztonsági technikákra.

Miért tartotta fontosnak a Cognition a vizsgálatot?

A Cognition szerint a nyílt forrású modellek alacsony költségük és széles elérhetőségük miatt kutatási prototípusokban és éles környezetben használt kódoló ügynökökben is fontos szerepet töltenek be. A vállalat ugyanakkor külön kihívásnak tartja, ha egy új modell fejlesztése ilyen alapokra épül.

A cég három erős nyílt forrású modellként említi a Kimi K2.7 Code-ot, a DeepSeek-V4-et és a GLM 5.2-t. A Cognition szerint több, Kínában működő AI-laboratóriumból származó modellnél felmerülhet, hogy gyakrabban ismételnek a Kínai Kommunista Párthoz igazodó narratívákat, illetve ügynöki környezetben a felhasználótól és a használati helyzettől függően kevésbé biztonságos kódot állítanak elő.

A vállalat a SWE-1.7 alapjául azért választotta a Kimi K2.7 Code-ot, mert saját értékelése szerint a vizsgált nyílt modellek között egyszerre mutatott erős kódolási képességet és erős semlegességet. A fejlesztés során további intézkedésekkel próbálták javítani ezt a tulajdonságot.

145 kérdés három nyelven, kódolási helyzetekben is

A propaganda- és cenzúrateszt 145 politikailag érzékeny kérdésből állt. Mindegyik kérdésre öt választ kértek angolul, egyszerűsített kínaiul és hagyományos kínaiul. A válaszokat hat szempont szerint értékelték: az aktív propaganda aránya, a Kínai Kommunista Párt narratíváihoz való igazodás, az elutasítási arány, a kitérő válaszok aránya, a teljesség és a tényszerű pontosság.

A Cognition hét modellt hasonlított össze: DeepSeek-V4, GLM 5.2, Kimi K2.6, Kimi K2.7 Code, GPT 5.5, Claude Opus 4.8 és SWE-1.7. A vizsgálatokat a Devin környezetében futtatták, összhangban azzal, ahogyan a SWE-1.7-et a gyakorlatban telepítik.

A vállalat beszámolója szerint minden modellnél egyszerűsített kínai nyelven volt a legmagasabb a propagandaarány, angolul pedig a legalacsonyabb. A kínai nyílt modellek több esetben gyengébben teljesítettek amerikai modelleknél ugyanazon a nyelven, különösen a Kimi K2.6 és a DeepSeek-V4. A SWE-1.7 eredményei a Cognition szerint rendszerint a GPT 5.5 és a Claude Opus 4.8 szintjén voltak, néhány mérésben pedig meg is haladták azokat.

A vállalat kódolási helyzeteket is vizsgált. Egy példában a modellnek egy megfigyelési platform hibás tesztjét kellett volna kijavítania úgy, hogy bizonyos demográfiai csoportokat külön kezeljen. A Cognition szerint a Kimi K2.7 teljesítette a kérést, a SWE-1.7 viszont elutasította. A cég hasonló forgatókönyvekből külön mérési rendszert állított össze, amelyben a modelleknek egy ügynök korábbi munkafolyamatát kellett folytatniuk.

A tesztelést továbbfejlesztik

A Cognition hangsúlyozza, hogy az értékelési rendszer még fejlesztés alatt áll. A vállalat szerint a kezdeti eredmények azt mutatják, hogy a nyílt forrású modellek önmagukban nem feltétlenül nem biztonságosak. Célzott utótréninggel és más fejlesztési módszerekkel a cég szerint legalább a vezető zárt modellekhez hasonló biztonsági szint érhető el.

A Cognition a következő hónapokban tovább akarja fejleszteni a semlegesség és a megbízhatóság mérésére szolgáló referenciaértékeket. A felhasználók számára ez azt jelentheti, hogy egy modell kiválasztásakor nem csak az alapmodell eredetét, hanem a fejlesztés során alkalmazott utótréninget és a valós használati helyzetekben mért viselkedést is vizsgálni lehet.

Kapcsolódó hírek

A Cognition évesített bevételi üteme átlépte az egymilliárd dollárt
Cégek és üzlet2026. szeptember 25. 19:00

A Cognition évesített bevételi üteme átlépte az egymilliárd dollárt

A Cognition évesített bevételi üteme átlépte az egymilliárd dollárt. A vállalat szerint a Devin kódolási rendszer a GE Aerospace, a Rivian, a Rohlik és az Exa mérnöki…

Az MLPerf új benchmarkkal méri a nagy nyelvi modellek utótréningjét
Kutatás2026. szeptember 24. 16:50

Az MLPerf új benchmarkkal méri a nagy nyelvi modellek utótréningjét

Az MLPerf Training első alkalommal külön benchmarkkal méri a nagy nyelvi modellek utótréningjét. A teszt a Qwen 3.5 397B modellt szoftverfejlesztési feladatokon…

A Cognition São Paulóban terjeszkedik, Latin-Amerikára szabja a Devint
Cégek és üzlet2026. szeptember 22. 19:00

A Cognition São Paulóban terjeszkedik, Latin-Amerikára szabja a Devint

A Cognition bejelentette latin-amerikai terjeszkedését, amelynek kiindulópontja São Paulo lesz. A vállalat a Devin AI-szoftvermérnökkel támogatná a régió vállalatainak…