A GLM-5.3 Flash olcsóbban hozza a teljes modell teljesítményének nagy részét

A GLM-5.3 Flash a DeepSWE szoftverfejlesztési benchmarkon első próbálkozásra gyengébb volt a teljes GLM-5.3-nál, ismételt futtatásokkal azonban jelentősen csökkent a különbség. A Together AI mérése szerint a Flash futtatása 17-szer olcsóbb, ezért ellenőrzésre épülő modellkaszkádot javasolnak.
- A GLM-5.3 pass@1 eredménye 69,0, a GLM-5.3 Flashé 63,4 százalék volt.
- Négy próbálkozásnál 87,6 és 85,0 százalékra szűkült a különbség.
- A Flash futtatása 0,24 dollárba került, a teljes modellé 3,99 dollárba.
- A Flash 6,9 százalékban tört meg már sikeres alapszintű teszteket.
- Flashből teljes GLM-5.3-ba irányító kaszkáddal 80,9 százalékos megoldási arányt mértek.
Elsőre nagyobb a különbség, ismétléssel szűkül
A Together AI 113 DeepSWE-feladaton hasonlította össze a GLM-5.3 és a GLM-5.3 Flash teljes, maximális erőfeszítésre állított változatát. Mindkét konfigurációt négy alkalommal futtatták feladatonként, összesen 900 futtatásban. A cég közlése szerint a mérés eltérhet más, nyilvánosan elérhető GLM-5.3 és GLM-5.3 Flash eredménylistáktól.
Egyetlen próbálkozásnál a GLM-5.3 69,0 százalékos pass@1 eredményt ért el, a Flash 63,4 százalékot. Két próbálkozásnál a különbség négy pontra csökkent, négy próbálkozásnál pedig 87,6 és 85,0 százalék volt az arány. A Together AI értelmezése szerint a lepárlás, vagyis a kisebb modell tanítása, elsősorban a megbízhatóságot csökkentette, a feladatok megoldásához szükséges képességet kevésbé.
A Flash olcsóbb és gyorsabb is
A teljes GLM-5.3 egy futtatása 3,99 dollárba került, míg a GLM-5.3 Flashé 0,24 dollár volt. Ez a forrás szerint 17-szeres árkülönbség. Száz dollárból a Flash 264 feladatot, a teljes modell 17 feladatot oldott meg a vizsgált költségszámítás alapján.
A sebességelőny is a Flashnél jelent meg. Egy futtatás átlagosan 26 percig tartott, szemben a teljes modell 35 percével. A két modell hasonló számú lépést tett meg, átlagosan 123-at, illetve 125-öt. A különbséget főként az egyes lépések késleltetése adta: a Flashnél 12,5, a teljes modellnél 17,0 másodperc volt az átlag. A Flash átlagos csúcskontextusa 145 ezer, a teljes modellé 155 ezer token volt.
A képességprofil átrendeződött
A Together AI feladatonként azt is vizsgálta, mennyire következetesen teljesít a két modell. A teljes modell által mind a négy alkalommal megoldott 48 feladat közül egy sem vált megoldhatatlanná a Flash számára. A feladatok fele továbbra is minden futtatásban sikeres maradt, a többinél viszont csökkent a következetesség.
A teljes modell legalább egyszer 99 feladatot oldott meg, ezek közül a Flash 93-at, vagyis 94 százalékot szintén teljesített. A Flash 15 olyan feladatot stabilizált, amelyeken a teljes modell változó eredményt produkált, és három olyan feladatot is megoldott, amely a teljes modell számára minden próbálkozásban sikertelen maradt.
A modellek eltérő területeken teljesítettek jobban. A Flash előnye a forrás szerint a konkurencia és tartósság területén 8 pont, Pythonban 5, adatmodellezésben 4, protokolloknál pedig 3 pont volt. A teljes modell a nyolc vizsgált területből ötben végzett előrébb, a programozási nyelvek közül pedig Go, TypeScript, JavaScript és Rust esetében bizonyult jobbnak, míg a Flash Pythonban vezetett.
Kaszkáddal használható ki az árkülönbség
A Flash egyik fontos gyengesége, hogy a hosszabb futtatás ritkábban fordul át sikerbe. A változó eredményű feladatoknál a teljes GLM-5.3 esetében a sikeres futtatás 61 százalékban több lépésből állt, mint a sikertelen. A Flashnél ez az arány 46 százalék volt, vagyis a futtatás hossza kevésbé jelezte előre a sikert.
A modell emellett óvatosabban sem kezeli mindig a már működő kódot. Egy korábban sikeres alapszintű tesztet a nem hibás futtatások 6,9 százalékában tört meg, míg a teljes GLM-5.3-nál ez az arány 4,4 százalék volt. A Together AI ezért regressziós teszt futtatását javasolja, mielőtt egy Flash által készített módosítást ellenőrzés nélkül elfogadnának.
A cég ajánlott megoldása az azonos modellcsaládon belüli kaszkád: először a GLM-5.3 Flash készítse el a választ, majd egy ellenőrző rendszer csak akkor küldje tovább a feladatot a teljes GLM-5.3-nak, ha az első eredményt elutasítja. Ez a beállítás a Together AI számítása szerint a DeepSWE-feladatok 80,9 százalékát oldotta meg feladatonként 1,70 dolláros költséggel. A szolgáltatás a közlemény szerint már elérhető amerikai üzemeltetésű infrastruktúrán, függvényhívással, JSON-móddal és OpenAI-kompatibilis API-val.


