A GLM-5.3 ötödannyiba kerül, mint a Claude Fable 5

A GLM-5.3 és a Claude Fable 5 első próbálkozásra gyakorlatilag döntetlenre végzett a DeepSWE szoftvermérnöki tesztjén, a GLM-5.3 azonban 5,4-szer olcsóbbnak bizonyult. Több próbálkozás engedélyezésekor a Together AI mérése szerint már a GLM-5.3 került előnybe.
- A DeepSWE pass@1 eredménye 69,0 százalék volt a GLM-5.3-nál és 69,7 százalék a Fable 5-nél.
- A GLM-5.3 pass@2-ben 81,1, pass@4-ben 87,6 százalékot ért el.
- Egy GLM-5.3 rollout 3,99, egy Fable 5 rollout 21,63 dollárba került.
- A Fable 5 Rustban, a GLM-5.3 JavaScriptben teljesített jobban.
- A Together AI a GLM-5.3-at javasolja alapértelmezettként, a Fable 5-öt célzott rásegítésre.
Elsőre döntetlen, több próbálkozással GLM-előny
A Together AI 113 DeepSWE-feladaton hasonlította össze a GLM-5.3 és a Claude Fable 5 maximális beállítását. Mindkét modell négy próbát kapott feladatonként, így összesen 904 futtatás, modellenként 452 rollout eredményeit elemezték.
Az első próbálkozás sikerességét mérő pass@1 mutatóban a Claude Fable 5 ért el magasabb eredményt, 69,7 százalékot, míg a GLM-5.3 69,0 százalékot. A 0,7 százalékpontos eltérés a Together AI szerint mindkét oldalon a hibahatáron belül marad.
Az újrapróbálkozásoknál megfordult a sorrend. Két próbálkozás után a GLM-5.3 81,1 százalékos, a Fable 5 pedig 77,1 százalékos eredményt ért el. Négy próbálkozásnál az értékek 87,6, illetve 84,1 százalékra emelkedtek.
A költségkülönbség döntő lehet
A mérés legnagyobb eltérése az árban jelentkezett. Egy rollout a GLM-5.3 esetében 3,99 dollárba került, a Claude Fable 5-nél pedig 21,63 dollárba. Ez 5,4-szeres különbség. Száz dollárból a GLM-5.3-mal 17, a Fable 5-tel három feladat megoldása jött ki a Together AI számítása szerint.
A futási idő lényegében azonos volt: a GLM-5.3 átlagosan 35 perc, a Fable 5 pedig 34 perc alatt végzett egy rollouttal. A tokenhasználat eltért. A GLM-5.3 átlagosan 80 ezer kimeneti tokent használt 124 lépésben, a Fable 5 pedig 114 ezret 85 lépésben. A forrás értelmezése szerint a GLM-5.3 több, alacsonyabb költségű lépéssel dolgozik.
A teljes futtatási költség a GLM-5.3-nál 1806 dollár, a Fable 5-nél 9346 dollár volt. A Together AI táblázata szerint a GLM-5.3 csúcskontextusa 155 ezer, a Fable 5-é 205 ezer token volt.
Más területeken erősek, de a Rust a Fable 5 előnye
A modellek nem minden feladattípusban teljesítettek egyformán. A GLM-5.3 nyolc vizsgált területből ötön végzett jobban. Előnye a lekérdezési és konfigurációs feladatoknál 88 és 72 százalék, a nyelvi és futtatási belső működésnél 83 és 78 százalék, az állapotfüggő reaktivitásnál 73 és 64 százalék, a konkurenciánál és tartósságnál 62 és 45 százalék, a programelemzésnél pedig 64 és 56 százalék volt.
A Fable 5 három területen vezetett: adatmodellezésben és szerializációban 88, illetve 79 százalékot, build- és üzemeltetési feladatoknál 71, illetve 68 százalékot, protokollmegfelelésnél pedig 55, illetve 44 százalékot ért el.
Programnyelvek szerint a legnagyobb különbség Rustban mutatkozott, ahol a Fable 5 85, a GLM-5.3 pedig 70 százalékot ért el. A Fable 5 Pythonban is vezetett, 70 és 66 százalékkal. A GLM-5.3 JavaScriptben 90, a Fable 5 75 százalékot ért el, Go esetében 76 és 71, TypeScriptnél pedig 61 és 57 százalék volt az eredmény.
A Together AI szerint kevés értelme van párhuzamosan futtatni őket
A két modell feladatszintű eredményeinek korrelációja 0,65 volt, ami a vizsgált párosítások között a legmagasabb egyezést jelentette. Mindkét modell 88 feladatot oldott meg. A GLM-5.3 önállóan 11, a Fable 5 önállóan hét feladatot oldott meg, miközben hét feladat mindkettő számára sikertelen maradt. Együttes lefedettségük 106 volt a 113 feladatból, vagyis 93,8 százalék.
A Together AI ebből azt a következtetést vonta le, hogy a két modell sok szempontból helyettesíti egymást, ezért a párhuzamos futtatás kevés többletlefedettséget ad. Ha mégis egymás után használják őket, a javasolt útvonal a GLM-5.3, majd sikertelen teszt esetén a Fable 5. Ez a lépcsőzetes megoldás 81,1 százalékos eredményt adott 10,74 dolláros költség mellett, szemben a Fable 5 önálló 69,7 százalékos eredményével és 21,63 dolláros rolloutköltségével.
A mérés alapján a GLM-5.3 lehet az alapértelmezett választás, a Claude Fable 5 pedig főként Rust- és szerializációs feladatoknál indokolhatja a magasabb költséget.
Together AI: GLM-5.3 vs. Claude Fable 5 on DeepSWE: Cost, Coding, and Routing


