A GLM-5.3 olcsóbban hoz több megoldást, ha lehet újrapróbálkozni

A GPT-5.6 Sol pontosabb első próbálkozásra a DeepSWE programozási feladatain, a GLM-5.3 viszont olcsóbb, több próbálkozással megelőzi, és a két modell együtt adja a legjobb eredményt. A Together AI mérése szerint a GLM-5.3 első lépcsőként, a Sol pedig ellenőrzés után bevont második modellként 85,9 százalékos megoldási arányt ér el.
- A GPT-5.6 Sol pass@1 eredménye 72,7 százalék, a GLM-5.3-é 69,0 százalék.
- Négy próbálkozás után a GLM-5.3 87,6 százalékkal megelőzte a Sol 85,8 százalékos eredményét.
- Egy GLM-5.3-futtatás 3,99, egy Sol-futtatás 8,37 dollárba került.
- A GLM-5.3, majd hibánál Sol kaszkád 85,9 százalékos megoldási arányt ért el 6,61 dolláros feladatonkénti költséggel.
- A két modell együtt a 113 DeepSWE-feladatból 106-ot fedett le.
A GPT-5.6 Sol az első próbálkozásban erősebb
A Together AI 2026. augusztus 21-én közölt összehasonlítása a GLM-5.3 és a GPT-5.6 Sol teljesítményét vizsgálta a DeepSWE összesen 113 feladatán. Mindkét modellt maximális erőfeszítéssel futtatták, feladatonként négy próbálkozással, így összesen 904 futás eredményét elemezték.
Egyetlen próbálkozásnál a GPT-5.6 Sol végzett előrébb: a hivatalos pass@1 értéke 72,7 százalék volt, szemben a GLM-5.3 69,0 százalékával. A különbség 3,7 százalékpont, amely a Together AI szerint néhány szóráson belül marad.
Az ismételt próbálkozások azonban megfordították a sorrendet. Két próbálkozásnál a GLM-5.3 81,1 százalékos, a Sol 81,0 százalékos eredményt ért el. Négy próbálkozás után a GLM-5.3 87,6 százalékra jutott, míg a GPT-5.6 Sol 85,8 százalékot ért el.
A GLM-5.3 körülbelül feleannyiba kerül
A mérésben egy GLM-5.3-futtatás költsége 3,99 dollár volt, a GPT-5.6 Solé pedig 8,37 dollár. Ez 2,1-szeres különbség. Száz dollárból a GLM-5.3-mal 17, a Sollal 9 megoldott feladat jött ki.
A gyorsaság terén a Sol előnye egyértelmű. Egy futása átlagosan 19 percig és 61 lépésig tartott, míg a GLM-5.3 esetében 35 perc és 124 lépés volt az átlag. A Sol átlagos kimenete 60 ezer token, a GLM-5.3-é 80 ezer token volt.
A Together AI értelmezése szerint a Sol prémiuma akkor lehet indokolható, ha a felhasználónak fontos a rövid várakozási idő. Költségérzékeny vagy nagy mennyiségű, kötegelt feladatoknál a GLM-5.3 kedvezőbb választás.
Eltérő hibák, eltérő feladatok
A két modell feladatonkénti eredményei csak 0,43-as korrelációt mutattak, vagyis elég gyakran más feladatokat oldottak meg. Mindkettő 90 feladatot teljesített, a GLM-5.3 önállóan 9, a Sol pedig 7 olyan feladatot oldott meg, amelyet a másik nem. Együtt 113-ból 106 feladatot fedtek le, ami 93,8 százalék.
A GLM-5.3 hibáinak 11 százalékában romlottak el már korábban sikeresen teljesítő tesztek. Ugyanez a Sol hibáinak 20 százalékára volt igaz. A GLM-5.3 hibái 61 százalékban közeli találatnak számítottak, a Solnál ez az arány 54 százalék volt.
A feladattípusok között a Sol az adatmodellezésben és szerializációban 92 százalékot, a build- és üzemeltetési eszközöknél 73 százalékot, a konkurenciát és tartósságot vizsgáló feladatoknál 72 százalékot, protokollmegfelelésnél pedig 59 százalékot ért el. A GLM-5.3 a lekérdezési és konfigurációs nyelveknél 88 százalékkal, a nyelvi és futtatókörnyezeti belső működésnél 83 százalékkal, az állapottartó reaktivitásnál 73 százalékkal teljesített jobban. A programanalízisnél 64, 64 lett az eredmény.
Programozási nyelvek szerint a GLM-5.3 JavaScriptben 90, Rustban 70 százalékot ért el, míg a Sol Pythonban 74, Goban 79, TypeScriptben pedig 66 százalékkal végzett előrébb.
A Together AI szerint a kétlépcsős út a legerősebb
A javasolt útvonal a GLM-5.3-mal indít, majd a tesztek elbukása esetén a GPT-5.6 Solhoz továbbítja a feladatot. Ez a kaszkád 85,9 százalékos megoldási arányt ért el, feladatonként átlagosan 6,61 dolláros költség mellett. A Sol önmagában 72,7 százalékot és 8,37 dolláros költséget hozott.
A Together AI számítása szerint ez a kombináció még egy tökéletesen választó, egypróbálkozásos útválasztónál is jobb volt, amely 83,8 százalékos pontosságot ért el. A GLM-5.3 elsőként történő futtatása olcsóbbnak bizonyult, mint a Solé, ezért a cég ezt ajánlja kezdőlépésként.
Az eredmények alapján a GPT-5.6 Sol az első próbálkozás pontosságában, megbízhatóságában és sebességében erős. A GLM-5.3 a költség, az újrapróbálkozásos pontosság, a lefedettség és a JavaScriptes feladatok terén kedvezőbb. A forrás szerint a gyakorlati felhasználóknak a Sol eredményét regressziós tesztekkel kell ellenőrizniük, míg a GLM-5.3 esetében erre a mérés alapján kisebb szükség van.
Together AI: GLM-5.3 vs. GPT-5.6 Sol on DeepSWE: Cost, Coding, and Routing


