DeepSWE

A Replit Agent maga dönti el, mikor és melyik modellt használja
A Replit Agent új megközelítése nagyobb döntési szabadságot ad a fő modellnek: maga határozza meg, mennyire gondolkodjon, mikor adjon át egy feladatot, és melyik…

A Replit Agent maga dönti el, mikor és melyik modellt használja
A Replit Agent új vezérlési rendszere a fő modellre bízza, mennyire gondolja végig a feladatot, mikor delegál részfeladatot, és melyik almodellt választja hozzá. A…

A GLM-5.3 Flash olcsóbban hozza a teljes modell teljesítményének nagy részét
A GLM-5.3 Flash a DeepSWE szoftverfejlesztési benchmarkon első próbálkozásra gyengébb volt a teljes GLM-5.3-nál, ismételt futtatásokkal azonban jelentősen csökkent a…

A GLM-5.3 ötödannyiba kerül, mint a Claude Fable 5
A GLM-5.3 és a Claude Fable 5 első próbálkozásra gyakorlatilag döntetlenre végzett a DeepSWE szoftvermérnöki tesztjén, a GLM-5.3 azonban 5,4-szer olcsóbbnak bizonyult.…

A GLM-5.3 olcsóbban hoz több megoldást, ha lehet újrapróbálkozni
A GPT-5.6 Sol pontosabb első próbálkozásra a DeepSWE programozási feladatain, a GLM-5.3 viszont olcsóbb, több próbálkozással megelőzi, és a két modell együtt adja a…

A DeepSeek V4 Pro olcsón előzi meg a GPT-5.6 Solt több próbálkozással
A GPT-5.6 Sol pontosabb és gyorsabb egyetlen próbálkozásnál, a DeepSeek V4 Pro 0813 viszont 35-ször olcsóbb, és több újrapróbálkozással magasabb eredményt ér el a…

A DeepSeek V4 Pro olcsóbban és több próbálkozással felülmúlta a Fable 5-öt
A DeepSeek V4 Pro 0813 első próbálkozásra gyengébb volt a Claude Fable 5-nél a DeepSWE programozási tesztjein, több próbálkozással azonban megelőzte, miközben egy…

A DeepSeek olcsóbban hoz jobb eredményt a GPT-5.6 Lunánál, ha együtt használják
A GPT-5.6 Luna minden vizsgált minőségi mutatóban megelőzte a DeepSeek-V4 Flash 0731 modellt, az olcsóbb modellre épülő kétlépcsős rendszer mégis pontosabb és olcsóbb…