Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A GLM-5.3 olcsóbban hoz több megoldást, ha lehet újrapróbálkozni

2026. augusztus 21.Forrás: Together AI
A GLM-5.3 olcsóbban hoz több megoldást, ha lehet újrapróbálkozni
Kép: Together AI

A GPT-5.6 Sol pontosabb első próbálkozásra a DeepSWE programozási feladatain, a GLM-5.3 viszont olcsóbb, több próbálkozással megelőzi, és a két modell együtt adja a legjobb eredményt. A Together AI mérése szerint a GLM-5.3 első lépcsőként, a Sol pedig ellenőrzés után bevont második modellként 85,9 százalékos megoldási arányt ér el.

A lényeg röviden
  • A GPT-5.6 Sol pass@1 eredménye 72,7 százalék, a GLM-5.3-é 69,0 százalék.
  • Négy próbálkozás után a GLM-5.3 87,6 százalékkal megelőzte a Sol 85,8 százalékos eredményét.
  • Egy GLM-5.3-futtatás 3,99, egy Sol-futtatás 8,37 dollárba került.
  • A GLM-5.3, majd hibánál Sol kaszkád 85,9 százalékos megoldási arányt ért el 6,61 dolláros feladatonkénti költséggel.
  • A két modell együtt a 113 DeepSWE-feladatból 106-ot fedett le.

A GPT-5.6 Sol az első próbálkozásban erősebb

A Together AI 2026. augusztus 21-én közölt összehasonlítása a GLM-5.3 és a GPT-5.6 Sol teljesítményét vizsgálta a DeepSWE összesen 113 feladatán. Mindkét modellt maximális erőfeszítéssel futtatták, feladatonként négy próbálkozással, így összesen 904 futás eredményét elemezték.

Egyetlen próbálkozásnál a GPT-5.6 Sol végzett előrébb: a hivatalos pass@1 értéke 72,7 százalék volt, szemben a GLM-5.3 69,0 százalékával. A különbség 3,7 százalékpont, amely a Together AI szerint néhány szóráson belül marad.

Az ismételt próbálkozások azonban megfordították a sorrendet. Két próbálkozásnál a GLM-5.3 81,1 százalékos, a Sol 81,0 százalékos eredményt ért el. Négy próbálkozás után a GLM-5.3 87,6 százalékra jutott, míg a GPT-5.6 Sol 85,8 százalékot ért el.

A GLM-5.3 körülbelül feleannyiba kerül

A mérésben egy GLM-5.3-futtatás költsége 3,99 dollár volt, a GPT-5.6 Solé pedig 8,37 dollár. Ez 2,1-szeres különbség. Száz dollárból a GLM-5.3-mal 17, a Sollal 9 megoldott feladat jött ki.

A gyorsaság terén a Sol előnye egyértelmű. Egy futása átlagosan 19 percig és 61 lépésig tartott, míg a GLM-5.3 esetében 35 perc és 124 lépés volt az átlag. A Sol átlagos kimenete 60 ezer token, a GLM-5.3-é 80 ezer token volt.

A Together AI értelmezése szerint a Sol prémiuma akkor lehet indokolható, ha a felhasználónak fontos a rövid várakozási idő. Költségérzékeny vagy nagy mennyiségű, kötegelt feladatoknál a GLM-5.3 kedvezőbb választás.

Eltérő hibák, eltérő feladatok

A két modell feladatonkénti eredményei csak 0,43-as korrelációt mutattak, vagyis elég gyakran más feladatokat oldottak meg. Mindkettő 90 feladatot teljesített, a GLM-5.3 önállóan 9, a Sol pedig 7 olyan feladatot oldott meg, amelyet a másik nem. Együtt 113-ból 106 feladatot fedtek le, ami 93,8 százalék.

A GLM-5.3 hibáinak 11 százalékában romlottak el már korábban sikeresen teljesítő tesztek. Ugyanez a Sol hibáinak 20 százalékára volt igaz. A GLM-5.3 hibái 61 százalékban közeli találatnak számítottak, a Solnál ez az arány 54 százalék volt.

A feladattípusok között a Sol az adatmodellezésben és szerializációban 92 százalékot, a build- és üzemeltetési eszközöknél 73 százalékot, a konkurenciát és tartósságot vizsgáló feladatoknál 72 százalékot, protokollmegfelelésnél pedig 59 százalékot ért el. A GLM-5.3 a lekérdezési és konfigurációs nyelveknél 88 százalékkal, a nyelvi és futtatókörnyezeti belső működésnél 83 százalékkal, az állapottartó reaktivitásnál 73 százalékkal teljesített jobban. A programanalízisnél 64, 64 lett az eredmény.

Programozási nyelvek szerint a GLM-5.3 JavaScriptben 90, Rustban 70 százalékot ért el, míg a Sol Pythonban 74, Goban 79, TypeScriptben pedig 66 százalékkal végzett előrébb.

A Together AI szerint a kétlépcsős út a legerősebb

A javasolt útvonal a GLM-5.3-mal indít, majd a tesztek elbukása esetén a GPT-5.6 Solhoz továbbítja a feladatot. Ez a kaszkád 85,9 százalékos megoldási arányt ért el, feladatonként átlagosan 6,61 dolláros költség mellett. A Sol önmagában 72,7 százalékot és 8,37 dolláros költséget hozott.

A Together AI számítása szerint ez a kombináció még egy tökéletesen választó, egypróbálkozásos útválasztónál is jobb volt, amely 83,8 százalékos pontosságot ért el. A GLM-5.3 elsőként történő futtatása olcsóbbnak bizonyult, mint a Solé, ezért a cég ezt ajánlja kezdőlépésként.

Az eredmények alapján a GPT-5.6 Sol az első próbálkozás pontosságában, megbízhatóságában és sebességében erős. A GLM-5.3 a költség, az újrapróbálkozásos pontosság, a lefedettség és a JavaScriptes feladatok terén kedvezőbb. A forrás szerint a gyakorlati felhasználóknak a Sol eredményét regressziós tesztekkel kell ellenőrizniük, míg a GLM-5.3 esetében erre a mérés alapján kisebb szükség van.

Kapcsolódó hírek

A Replit Agent maga dönti el, mikor és melyik modellt használja
Fejlesztőknek2026. szeptember 29.

A Replit Agent maga dönti el, mikor és melyik modellt használja

A Replit Agent új megközelítése nagyobb döntési szabadságot ad a fő modellnek: maga határozza meg, mennyire gondolkodjon, mikor adjon át egy feladatot, és melyik…

A GPT-5.6 Sol vezeti a régi rendszerekre szabott tesztet
Kutatás2026. szeptember 24.

A GPT-5.6 Sol vezeti a régi rendszerekre szabott tesztet

A GPT-5.6 Sol érte el a legjobb eredményt a Factory Legacy-Bench nevű tesztjén, amely a COBOL, a Java 7, a BASIC, a C89, a Fortran és az Assembly kezelését vizsgálja. A…

A GLM-5.3 Flash olcsóbban hozza a teljes modell teljesítményének nagy részét
Modellek2026. augusztus 28.

A GLM-5.3 Flash olcsóbban hozza a teljes modell teljesítményének nagy részét

A GLM-5.3 Flash a DeepSWE szoftverfejlesztési benchmarkon első próbálkozásra gyengébb volt a teljes GLM-5.3-nál, ismételt futtatásokkal azonban jelentősen csökkent a…