Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A GLM-5.3 ötödannyiba kerül, mint a Claude Fable 5

2026. augusztus 21.Forrás: Together AI
A GLM-5.3 ötödannyiba kerül, mint a Claude Fable 5
Kép: Together AI

A GLM-5.3 és a Claude Fable 5 első próbálkozásra gyakorlatilag döntetlenre végzett a DeepSWE szoftvermérnöki tesztjén, a GLM-5.3 azonban 5,4-szer olcsóbbnak bizonyult. Több próbálkozás engedélyezésekor a Together AI mérése szerint már a GLM-5.3 került előnybe.

A lényeg röviden
  • A DeepSWE pass@1 eredménye 69,0 százalék volt a GLM-5.3-nál és 69,7 százalék a Fable 5-nél.
  • A GLM-5.3 pass@2-ben 81,1, pass@4-ben 87,6 százalékot ért el.
  • Egy GLM-5.3 rollout 3,99, egy Fable 5 rollout 21,63 dollárba került.
  • A Fable 5 Rustban, a GLM-5.3 JavaScriptben teljesített jobban.
  • A Together AI a GLM-5.3-at javasolja alapértelmezettként, a Fable 5-öt célzott rásegítésre.

Elsőre döntetlen, több próbálkozással GLM-előny

A Together AI 113 DeepSWE-feladaton hasonlította össze a GLM-5.3 és a Claude Fable 5 maximális beállítását. Mindkét modell négy próbát kapott feladatonként, így összesen 904 futtatás, modellenként 452 rollout eredményeit elemezték.

Az első próbálkozás sikerességét mérő pass@1 mutatóban a Claude Fable 5 ért el magasabb eredményt, 69,7 százalékot, míg a GLM-5.3 69,0 százalékot. A 0,7 százalékpontos eltérés a Together AI szerint mindkét oldalon a hibahatáron belül marad.

Az újrapróbálkozásoknál megfordult a sorrend. Két próbálkozás után a GLM-5.3 81,1 százalékos, a Fable 5 pedig 77,1 százalékos eredményt ért el. Négy próbálkozásnál az értékek 87,6, illetve 84,1 százalékra emelkedtek.

A költségkülönbség döntő lehet

A mérés legnagyobb eltérése az árban jelentkezett. Egy rollout a GLM-5.3 esetében 3,99 dollárba került, a Claude Fable 5-nél pedig 21,63 dollárba. Ez 5,4-szeres különbség. Száz dollárból a GLM-5.3-mal 17, a Fable 5-tel három feladat megoldása jött ki a Together AI számítása szerint.

A futási idő lényegében azonos volt: a GLM-5.3 átlagosan 35 perc, a Fable 5 pedig 34 perc alatt végzett egy rollou­­ttal. A tokenhasználat eltért. A GLM-5.3 átlagosan 80 ezer kimeneti tokent használt 124 lépésben, a Fable 5 pedig 114 ezret 85 lépésben. A forrás értelmezése szerint a GLM-5.3 több, alacsonyabb költségű lépéssel dolgozik.

A teljes futtatási költség a GLM-5.3-nál 1806 dollár, a Fable 5-nél 9346 dollár volt. A Together AI táblázata szerint a GLM-5.3 csúcskontextusa 155 ezer, a Fable 5-é 205 ezer token volt.

Más területeken erősek, de a Rust a Fable 5 előnye

A modellek nem minden feladattípusban teljesítettek egyformán. A GLM-5.3 nyolc vizsgált területből ötön végzett jobban. Előnye a lekérdezési és konfigurációs feladatoknál 88 és 72 százalék, a nyelvi és futtatási belső működésnél 83 és 78 százalék, az állapotfüggő reaktivitásnál 73 és 64 százalék, a konkurenciánál és tartósságnál 62 és 45 százalék, a programelemzésnél pedig 64 és 56 százalék volt.

A Fable 5 három területen vezetett: adatmodellezésben és szerializációban 88, illetve 79 százalékot, build- és üzemeltetési feladatoknál 71, illetve 68 százalékot, protokollmegfelelésnél pedig 55, illetve 44 százalékot ért el.

Programnyelvek szerint a legnagyobb különbség Rustban mutatkozott, ahol a Fable 5 85, a GLM-5.3 pedig 70 százalékot ért el. A Fable 5 Pythonban is vezetett, 70 és 66 százalékkal. A GLM-5.3 JavaScriptben 90, a Fable 5 75 százalékot ért el, Go esetében 76 és 71, TypeScriptnél pedig 61 és 57 százalék volt az eredmény.

A Together AI szerint kevés értelme van párhuzamosan futtatni őket

A két modell feladatszintű eredményeinek korrelációja 0,65 volt, ami a vizsgált párosítások között a legmagasabb egyezést jelentette. Mindkét modell 88 feladatot oldott meg. A GLM-5.3 önállóan 11, a Fable 5 önállóan hét feladatot oldott meg, miközben hét feladat mindkettő számára sikertelen maradt. Együttes lefedettségük 106 volt a 113 feladatból, vagyis 93,8 százalék.

A Together AI ebből azt a következtetést vonta le, hogy a két modell sok szempontból helyettesíti egymást, ezért a párhuzamos futtatás kevés többletlefedettséget ad. Ha mégis egymás után használják őket, a javasolt útvonal a GLM-5.3, majd sikertelen teszt esetén a Fable 5. Ez a lépcsőzetes megoldás 81,1 százalékos eredményt adott 10,74 dolláros költség mellett, szemben a Fable 5 önálló 69,7 százalékos eredményével és 21,63 dolláros rolloutköltségével.

A mérés alapján a GLM-5.3 lehet az alapértelmezett választás, a Claude Fable 5 pedig főként Rust- és szerializációs feladatoknál indokolhatja a magasabb költséget.

Kapcsolódó hírek

A Replit Agent maga dönti el, mikor és melyik modellt használja
Fejlesztőknek2026. szeptember 29. 18:00

A Replit Agent maga dönti el, mikor és melyik modellt használja

A Replit Agent új megközelítése nagyobb döntési szabadságot ad a fő modellnek: maga határozza meg, mennyire gondolkodjon, mikor adjon át egy feladatot, és melyik…

A Replit Agent maga dönti el, mikor és melyik modellt használja
Fejlesztőknek2026. szeptember 29. 18:00

A Replit Agent maga dönti el, mikor és melyik modellt használja

A Replit Agent új vezérlési rendszere a fő modellre bízza, mennyire gondolja végig a feladatot, mikor delegál részfeladatot, és melyik almodellt választja hozzá. A…

A GLM-5.3 Flash olcsóbban hozza a teljes modell teljesítményének nagy részét
Modellek2026. augusztus 28.

A GLM-5.3 Flash olcsóbban hozza a teljes modell teljesítményének nagy részét

A GLM-5.3 Flash a DeepSWE szoftverfejlesztési benchmarkon első próbálkozásra gyengébb volt a teljes GLM-5.3-nál, ismételt futtatásokkal azonban jelentősen csökkent a…