Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A GLM-5.3 Flash olcsóbban hozza a teljes modell teljesítményének nagy részét

2026. augusztus 28.Forrás: Together AI
A GLM-5.3 Flash olcsóbban hozza a teljes modell teljesítményének nagy részét
Kép: Together AI

A GLM-5.3 Flash a DeepSWE szoftverfejlesztési benchmarkon első próbálkozásra gyengébb volt a teljes GLM-5.3-nál, ismételt futtatásokkal azonban jelentősen csökkent a különbség. A Together AI mérése szerint a Flash futtatása 17-szer olcsóbb, ezért ellenőrzésre épülő modellkaszkádot javasolnak.

A lényeg röviden
  • A GLM-5.3 pass@1 eredménye 69,0, a GLM-5.3 Flashé 63,4 százalék volt.
  • Négy próbálkozásnál 87,6 és 85,0 százalékra szűkült a különbség.
  • A Flash futtatása 0,24 dollárba került, a teljes modellé 3,99 dollárba.
  • A Flash 6,9 százalékban tört meg már sikeres alapszintű teszteket.
  • Flashből teljes GLM-5.3-ba irányító kaszkáddal 80,9 százalékos megoldási arányt mértek.

Elsőre nagyobb a különbség, ismétléssel szűkül

A Together AI 113 DeepSWE-feladaton hasonlította össze a GLM-5.3 és a GLM-5.3 Flash teljes, maximális erőfeszítésre állított változatát. Mindkét konfigurációt négy alkalommal futtatták feladatonként, összesen 900 futtatásban. A cég közlése szerint a mérés eltérhet más, nyilvánosan elérhető GLM-5.3 és GLM-5.3 Flash eredménylistáktól.

Egyetlen próbálkozásnál a GLM-5.3 69,0 százalékos pass@1 eredményt ért el, a Flash 63,4 százalékot. Két próbálkozásnál a különbség négy pontra csökkent, négy próbálkozásnál pedig 87,6 és 85,0 százalék volt az arány. A Together AI értelmezése szerint a lepárlás, vagyis a kisebb modell tanítása, elsősorban a megbízhatóságot csökkentette, a feladatok megoldásához szükséges képességet kevésbé.

A Flash olcsóbb és gyorsabb is

A teljes GLM-5.3 egy futtatása 3,99 dollárba került, míg a GLM-5.3 Flashé 0,24 dollár volt. Ez a forrás szerint 17-szeres árkülönbség. Száz dollárból a Flash 264 feladatot, a teljes modell 17 feladatot oldott meg a vizsgált költségszámítás alapján.

A sebességelőny is a Flashnél jelent meg. Egy futtatás átlagosan 26 percig tartott, szemben a teljes modell 35 percével. A két modell hasonló számú lépést tett meg, átlagosan 123-at, illetve 125-öt. A különbséget főként az egyes lépések késleltetése adta: a Flashnél 12,5, a teljes modellnél 17,0 másodperc volt az átlag. A Flash átlagos csúcskontextusa 145 ezer, a teljes modellé 155 ezer token volt.

A képességprofil átrendeződött

A Together AI feladatonként azt is vizsgálta, mennyire következetesen teljesít a két modell. A teljes modell által mind a négy alkalommal megoldott 48 feladat közül egy sem vált megoldhatatlanná a Flash számára. A feladatok fele továbbra is minden futtatásban sikeres maradt, a többinél viszont csökkent a következetesség.

A teljes modell legalább egyszer 99 feladatot oldott meg, ezek közül a Flash 93-at, vagyis 94 százalékot szintén teljesített. A Flash 15 olyan feladatot stabilizált, amelyeken a teljes modell változó eredményt produkált, és három olyan feladatot is megoldott, amely a teljes modell számára minden próbálkozásban sikertelen maradt.

A modellek eltérő területeken teljesítettek jobban. A Flash előnye a forrás szerint a konkurencia és tartósság területén 8 pont, Pythonban 5, adatmodellezésben 4, protokolloknál pedig 3 pont volt. A teljes modell a nyolc vizsgált területből ötben végzett előrébb, a programozási nyelvek közül pedig Go, TypeScript, JavaScript és Rust esetében bizonyult jobbnak, míg a Flash Pythonban vezetett.

Kaszkáddal használható ki az árkülönbség

A Flash egyik fontos gyengesége, hogy a hosszabb futtatás ritkábban fordul át sikerbe. A változó eredményű feladatoknál a teljes GLM-5.3 esetében a sikeres futtatás 61 százalékban több lépésből állt, mint a sikertelen. A Flashnél ez az arány 46 százalék volt, vagyis a futtatás hossza kevésbé jelezte előre a sikert.

A modell emellett óvatosabban sem kezeli mindig a már működő kódot. Egy korábban sikeres alapszintű tesztet a nem hibás futtatások 6,9 százalékában tört meg, míg a teljes GLM-5.3-nál ez az arány 4,4 százalék volt. A Together AI ezért regressziós teszt futtatását javasolja, mielőtt egy Flash által készített módosítást ellenőrzés nélkül elfogadnának.

A cég ajánlott megoldása az azonos modellcsaládon belüli kaszkád: először a GLM-5.3 Flash készítse el a választ, majd egy ellenőrző rendszer csak akkor küldje tovább a feladatot a teljes GLM-5.3-nak, ha az első eredményt elutasítja. Ez a beállítás a Together AI számítása szerint a DeepSWE-feladatok 80,9 százalékát oldotta meg feladatonként 1,70 dolláros költséggel. A szolgáltatás a közlemény szerint már elérhető amerikai üzemeltetésű infrastruktúrán, függvényhívással, JSON-móddal és OpenAI-kompatibilis API-val.

Kapcsolódó hírek

A Replit Agent maga dönti el, mikor és melyik modellt használja
Fejlesztőknek2026. szeptember 29.

A Replit Agent maga dönti el, mikor és melyik modellt használja

A Replit Agent új megközelítése nagyobb döntési szabadságot ad a fő modellnek: maga határozza meg, mennyire gondolkodjon, mikor adjon át egy feladatot, és melyik…

A Replit Agent maga dönti el, mikor és melyik modellt használja
Fejlesztőknek2026. szeptember 29.

A Replit Agent maga dönti el, mikor és melyik modellt használja

A Replit Agent új vezérlési rendszere a fő modellre bízza, mennyire gondolja végig a feladatot, mikor delegál részfeladatot, és melyik almodellt választja hozzá. A…

Döntési modelleket támogat az Ollama, három modell már elérhető
Termékek és eszközök2026. szeptember 29.

Döntési modelleket támogat az Ollama, három modell már elérhető

Az Ollama 0.35-ös verziójától Jev API-alapú döntési modellek futtathatók helyben, az új /v1/systemone végponton keresztül. A vállalat szerint a megoldás gyors döntéseket…