A Baseten szerint 200 token/másodperc felett fut nála a GLM-5

A Baseten állítása szerint a GLM-5 több mint 200 token/másodperces sebességet ért el a szolgáltatásán, miközben az első tokenig eltelt idő körülbelül 200 ezredmásodperc volt. A teljesítményt az Artificial Analysis egymástól függetlenül mérte, és a Baseten modell API-ja mindkét mutatóban a ranglista élére került.
- A Baseten szerint a GLM-5 több mint 200 token/másodperces sebességet ért el.
- Az Artificial Analysis mérésében az első tokenig eltelt idő körülbelül 200 ezredmásodperc volt.
- A modell 744 milliárd paraméteres, ebből 40 milliárd aktív egy előrelépés során.
- A Baseten MoE, DSA és MTP-specifikus optimalizációkat alkalmazott.
- A GLM-5 MIT-licenc alatt kiadott, nyílt súlyú modell.
A GLM-5 sebessége a mérésben
A Baseten 2026. október 2-i beszámolója szerint az Artificial Analysis a GLM-5-höz biztosított Model API-t vizsgálta. A mérés alapján a rendszer több mint 200 tokent generált másodpercenként, az első tokenig eltelt idő pedig körülbelül 200 ezredmásodperc volt. A vállalat szerint ezzel a szolgáltatás a legjobb eredményt érte el az Artificial Analysis ranglistáján a time to first token, vagyis az első tokenig eltelt idő, valamint a tokens per second, vagyis a másodpercenként előállított tokenek száma alapján.
A Baseten az eredményt saját következtetései mellett független Artificial Analysis-benchmarkként mutatja be. A cég szerint a gyorsaság különösen fontos a GLM-5 esetében, mivel a modell következtetési modellként először egy gondolkodási sorozatot állít elő, és csak ezután adja meg a végső választ. Ez a belső folyamat gyakran hosszabb a végső válasznál, ezért a magasabb tokenenkénti sebesség közvetlenül rövidíti a teljes válaszidőt.
Három ponton hangolták az infrastruktúrát
A GLM-5 a Z.ai legújabb, nyílt súlyú zászlóshajómodellje. A forrás szerint összesen 744 milliárd paraméterrel rendelkezik, egy előrelépés során 40 milliárd aktív, és 28,5 billió tokenen tanították. A modellt MIT-licenc alatt adták ki. A Baseten beszámolója szerint a GLM-5 a kódolási és ügynöki benchmarkokban jelenleg a legképességesebb nyílt forrású modellek közé tartozik, eredményei a SWE-bench Verified teszten 77,8, az AIME 2026-on pedig 92,7 százalékosak. A Vending Bench 2-n a cég szerint első helyen állt a nyílt modellek között.
A modell a DeepSeek V3-hoz hasonlóan kevert szakértői, vagyis Mixture of Experts architektúrát használ, de a GLM-sorozatra jellemző módon több réteggel és kisebb rejtett mérettel épül fel. A Baseten szerint ez mélyebb, de keskenyebb felépítést jelent, amelyhez a hagyományos Mixture of Experts-kódok nem feltétlenül illeszkednek optimálisan. Ezért a vállalat a GLM-5 tényleges architektúrájára hangolt elosztási kerneleket használ, amelyek célja a szakértők közötti továbbítási többletének csökkentése és a GPU-k jobb kihasználása.
A GLM-5 a GLM-családban elsőként alkalmazza a DeepSeek Sparse Attention technikát. A Baseten szerint ez hosszú kontextus esetén jelentősen csökkenti a kulcs-érték gyorsítótár, vagyis a KV cache méretét, miközben megmarad a 200K-s kontextusablak. A cég ehhez olyan egyedi kerneleket készített, amelyek közvetlenül kihasználják a ritkított figyelmi mintázatot.
A Multi-Token Prediction gyorsítja a gondolkodási folyamatot
A harmadik fő elem a Multi-Token Prediction, röviden MTP alapú spekulatív dekódolás. Ennek lényege, hogy a rendszer jelölt tokeneket állít elő, majd a célmodell párhuzamosan ellenőrzi ezeket. Ha a célmodell elfogadja a jelölteket, egyetlen előrelépés költségéért több token készülhet el.
A GLM-5 beépített MTP-fejeket tartalmaz, így a Baseten szerint nincs szükség külön, kisebb vázlatmodell betanítására vagy futtatására. A vállalat saját dekódoló motorja a vázlattokenek ütemezését szorosan összekapcsolja a következtetési ciklussal, miközben alacsonyan tartja a gazdagépen végzett koordináció költségét. A Baseten szerint ez magas elfogadási arányt tesz lehetővé kódgenerálás, hosszú gondolkodási folyamatok és ügynöki eszközhasználat mellett is.
A bejelentés alapján a GLM-5 sebessége elsősorban azoknak a fejlesztőknek lehet fontos, akik autonóm kódoló ügynököket, több lépésből álló eszközhasználati folyamatokat vagy hosszú ideig futó ügynöki rendszereket építenek. A Baseten szerint a 200 token/másodperc feletti teljesítmény ilyen alkalmazásokban gyorsabb válaszokat tesz lehetővé, miközben a modell nyílt súlyú és MIT-licenc alatt érhető el.
Baseten: How we built the fastest GLM-5 on Artificial Analysis


