A Cognition két AI-modellt kapcsol össze olcsóbb kódolásért

A Cognition elérhetővé tette Fusion nevű megoldását a Devin Desktopban és a Devin CLI-ban. A rendszer egy nagy teljesítményű modellt állít vezető szerepbe, egy olcsóbb modellt pedig a kódolási feladatok végrehajtására használ.
- A Fusion elérhető a Devin Desktopban és a Devin CLI-ban.
- A rendszer egy vezető és egy segédmodellt kapcsol össze.
- A Cognition szerint a megoldás akár 39 százalékkal hatékonyabb más modellkörnyezeteknél.
- A vállalat a Fable 5.1 és SWE-2 párosítását ajánlja.
- A Cognition szerint a Fusion több teszten csökkentette a költségeket a teljesítmény fenntartása mellett.
Két modell, eltérő feladattal
A Cognition szeptember 11-i bejelentése szerint a Fusion a Fable és az Astra számára készült modellkörnyezet (model harness). A vállalat állítása alapján a megoldás a nagy kódolási teszteken akár 39 százalékkal hatékonyabb más modellkörnyezeteknél.
A Fusion használatakor a felhasználó két modellt választ. A lead, vagyis vezető modell egy élvonalbeli modell, amely megtervezi a munkát, értelmezi a bizonytalan részleteket, majd ellenőrzi az eredményt. A sidekick, azaz segédmodell költséghatékonyabb modellként feltérképezi a kódot, végrehajtja a módosításokat, teszteket futtat, majd beszámol az eredményről.
A Cognition a legjobb eredményhez a Fable 5.1 és a SWE-2 párosítását ajánlja. A Devin CLI telepítéséhez a vállalat ezt a parancsot adja meg: curl -fsSL https://cli.devin.ai/install.sh | bash.
A vállalat szerint jelentős költségmegtakarítást hoz
A Cognition az Artificial Analysis és a Vals AI közreműködésével vizsgálta a Fusiont több kódolási ügynökteszten. A DeepSWE 1.1 teszten a Fable 5.1 önmagában 64,3 pontos eredményt ért el 14,63 dolláros költség mellett, a Fable 5.1 és SWE-2 párosa pedig 63,1 pontot 7,88 dollárért. Ez 46 százalékos költségcsökkenés.
A Terminal-Bench 4 esetében a Fable 5.1 Fusion 56,1 pontot ért el 13,37 dollárból, szemben az önálló modell 57,6 pontjával és 17,46 dolláros költségével. A SWE-Atlas QnA teszten a Fusion 65,9 pontot és 5 dolláros költséget mutatott, míg a Fable 5.1 önállóan 64,8 pontot ért el 7,57 dollárból.
Az Astra Fusion eredményei között a Cognition 40 százalékos megtakarítást közöl a DeepSWE 1.1 és a Terminal-Bench 4 teszten, 37 százalékot a SWE-Atlas QnA esetében, valamint 20 százalékot a Vals Code Migration teszten. A vállalat szerint a Fusion a FrontierCode 1.1 Extended teszten is hasonló teljesítményt tartott, miközben a Fable 5.1 párosítása 38 százalékkal, az Astra párosítása 11 százalékkal került kevesebbe.
Miért nem egyszerű modellváltást használ a Fusion?
A Cognition szerint az egyszerű modellútválasztás, amikor a rendszer a könnyebb feladatokat olcsóbb modellekhez irányítja, több problémát okozhat. A kezdeti feladatleírásból nem mindig derül ki, hogy egy hibajavítás egyetlen sor módosítását vagy a teljes termék újratervezését igényli. A modellek váltása emellett megtörheti a promptgyorsítótárat, és újabb költségeket okozhat.
A Fusion ehelyett két párhuzamos ügynököt futtat, amelyek saját tartós kontextussal és eszközökkel rendelkeznek. A vezető modell rövid feladatleírást, korlátokat és sikerfeltételeket ad át, így a két ügynöknek nem kell a teljes beszélgetést megosztania. A Cognition szerint ez lehetővé teszi a promptgyorsítótár hatékonyabb használatát.
A vállalat hangsúlyozza, hogy a vezető modell végig irányítja a munkamenetet. Ellenőrzi a segédmodell eredményét, javítja a problémákat, és szükség esetén visszaveszi a feladatot. A Cognition kutatása alapján a modelleket 2026-ban inkább az egy feladatra jutó költség és teljesítmény alapján kell vizsgálni, nem pusztán a tokenenkénti árazás szerint. A cég példaként említi, hogy a Fable 5 vezető modellként a magasabb tokenár ellenére átlagosan 9 százalékkal olcsóbb munkameneteket eredményezett az Opus 4.8-hoz képest, miközben magasabb FrontierCode-pontszámot ért el.
Cognition: Introducing Fusion in Devin Desktop & CLI


