A Cognition bemutatta az SWE-2 kódolómodellt

A Cognition bemutatta az SWE-2-t, amely a vállalat szerint eddigi legfejlettebb kódolómodellje. A modell 50,0 százalékot ért el a FrontierCode 1.1 Main teszten, és a Cognition állítása szerint 64 százalékkal olcsóbb a Fable 5.1-nél.
- Az SWE-2 50,0 százalékot ért el a FrontierCode 1.1 Main teszten.
- A Cognition szerint a modell 64 százalékkal olcsóbb a Fable 5.1-nél.
- Az SWE-2 a 2,8 billió paraméteres Kimi K3 utóhangolásával készült.
- Az SWE-2 medium 58 százalékkal kevesebb lépést és 81 százalékkal alacsonyabb költséget ért el az SWE-1.7-nél.
- A modell a Devin Desktopban, CLI-ban, valamint fokozatosan a Devin Webben és a Fusionben is elérhető.
Erős eredmények alacsonyabb költség mellett
A Cognition szeptember 10-i bejelentése szerint az SWE-2 a képesség és a költség közötti kompromisszum javítására készült. A FrontierCode 1.1 Main teszten 50,0 százalékos eredményt ért el, ami a vállalat szerint egy ponttal marad el a Fable 5.1 teljesítményétől, miközben 64 százalékkal alacsonyabb költséggel működik.
A közzétett táblázat alapján az SWE-2 a FrontierCode 1.1 Main és a DeepSWE 1.1 teszten is felülmúlja az SWE-1.7-et és a Grok 4.6-ot, pontszám és költség tekintetében egyaránt. Az eredményeket a Cognition a GPT-5.6 Sol és a Fable 5, illetve Fable 5.1 szintjéhez közelinek írja le, azok árának töredéke mellett. A GPT-6 Astra eredményéhez néhány ponttal közelít, a vállalat szerint annak költségének negyedén.
Az SWE-2 a FrontierCode 1.1 Main teszten 50,0, a DeepSWE 1.1-en 73,0, a Terminal-Bench 2.1-en 92,8, a Terminal-Bench 4-en pedig 27,3 százalékot ért el. Összehasonlításként az SWE-1.7 ugyanezeken a teszteken 42,0, 37,7, 81,5 és 7,6 százalékot teljesített.
Egyetlen tanítási futásban kezelték a különböző erősségi szinteket
A modell utóhangolása a Kimi K3-ra épül, amely egy 2,8 billió paraméteres modell, és korábban már kiterjedt megerősítéses tanításon esett át ügynöki kódolási feladatokra. A Cognition szerint az SWE-2 tanításakor először skálázták a megerősítéses tanulást a több billió paraméteres tartományba.
A módszer központi eleme egy olyan algoritmus, amely egyetlen futás alatt tanítja az összes következtetési erőfeszítési szintet. A vállalat célja ezzel a teljes költség és teljesítmény közötti tartomány javítása volt, nem pusztán egyetlen pontszám maximalizálása.
A jutalmazási rendszerben lineáris költségbüntetést alkalmaznak. A sikeres megoldást jelző pontszámhoz az egyes erősségi szintekhez igazított költséget rendelnek, amely az amerikai dollárban mért következtetési költséget és a futási időt is figyelembe veszi. A Cognition szerint a büntetés mértékét az alapmodell költség és teljesítmény görbéjének helyi meredekségéhez igazították.
A fejlesztés során megháromszorozták a megerősítéses tanulás környezeteinek számát, utasításkövetési rétegeket adtak hozzá, és a korábbi SWE-2 ellenőrzőpontokkal fokozatosan szigorították az ellenőrző rendszereket. A vállalat emellett új ütemezést, online vázlatmodellt, NVFP4 és FP8 kerneleket, valamint kvantálástudatos tanítást használt.
Kevesebb felesleges feltárás, gyorsabb első módosítás
A Cognition belső tesztjei szerint az SWE-2 hatékonyabban dolgozik az előző modellnél. A FrontierCode 1.1 Main feladatsorán az SWE-2 medium magasabb pontszámot ért el, mint az SWE-1.7, miközben 58 százalékkal kevesebb lépést tett meg, és átlagosan 81 százalékkal kevesebbe került.
Az SWE-1.7 átlagosan 127 lépést használt futásonként. Az SWE-2 medium esetében ez 53, a high szintnél 80, a max szintnél pedig 98 lépés volt. A Cognition szerint a legnagyobb hatékonyságnövekedést a célzottabb feltárás adja. A modell gyorsabban dönti el, hogy a kódbázis mely részei fontosak az adott feladathoz.
Az SWE-2 medium a teszten mediánértékben 18 lépés után hajtotta végre az első valódi módosítást, míg az SWE-1.7 esetében ez 48 lépés volt. A high és max szintek összetettebb feladatoknál lehetnek előnyösebbek, mivel többet terveznek, nagyobb részben tárják fel a kódbázist, és összetettebb ellenőrzést végeznek.
Az SWE-2 több Cognition-termékben is elérhető
A Cognition szerint az SWE-2 a bejelentés napjától elérhető a Devin Desktop és a CLI használatával. A vállalat a modellt fokozatosan a Devin Web és a Fusion szolgáltatásba is bevezeti.
A belső tapasztalatok alapján az SWE-2 átfogóbb teszteket ír, megbízhatóbban keresi a regressziókat és a szélsőséges eseteket, továbbá akadályok esetén alternatív megoldási útvonalakat keres. A Cognition példaként egy olyan esetet említ, amikor egy szükséges MCP-integráció nem volt elérhető, ezért a modell a már hozzáférhető Slack-csatornaelőzményekből rekonstruálta az adatokat.
A vállalat azt is állítja, hogy a modell ellenőrzési fegyelme javult: vitatott helyzetekben újra levezeti a következtetéseit, ellenőrzi a felhasználói hipotéziseket, és bizonyítékot gyűjt ahelyett, hogy kizárólag a felszíni szövegre hagyatkozna. Ez a Cognition szerint a költségtakarékosabb és a nagyobb erősségi szintek közötti választást is fontosabbá teszi a kódolóügynökök használatában.
Cognition: Introducing SWE-2: Pushing the Pareto Frontier


