Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Baseten szerint 200 token/másodperc felett fut nála a GLM-5

2026. október 2.Forrás: Baseten
A Baseten szerint 200 token/másodperc felett fut nála a GLM-5
Kép: Baseten

A Baseten állítása szerint a GLM-5 több mint 200 token/másodperces sebességet ért el a szolgáltatásán, miközben az első tokenig eltelt idő körülbelül 200 ezredmásodperc volt. A teljesítményt az Artificial Analysis egymástól függetlenül mérte, és a Baseten modell API-ja mindkét mutatóban a ranglista élére került.

A lényeg röviden
  • A Baseten szerint a GLM-5 több mint 200 token/másodperces sebességet ért el.
  • Az Artificial Analysis mérésében az első tokenig eltelt idő körülbelül 200 ezredmásodperc volt.
  • A modell 744 milliárd paraméteres, ebből 40 milliárd aktív egy előrelépés során.
  • A Baseten MoE, DSA és MTP-specifikus optimalizációkat alkalmazott.
  • A GLM-5 MIT-licenc alatt kiadott, nyílt súlyú modell.

A GLM-5 sebessége a mérésben

A Baseten 2026. október 2-i beszámolója szerint az Artificial Analysis a GLM-5-höz biztosított Model API-t vizsgálta. A mérés alapján a rendszer több mint 200 tokent generált másodpercenként, az első tokenig eltelt idő pedig körülbelül 200 ezredmásodperc volt. A vállalat szerint ezzel a szolgáltatás a legjobb eredményt érte el az Artificial Analysis ranglistáján a time to first token, vagyis az első tokenig eltelt idő, valamint a tokens per second, vagyis a másodpercenként előállított tokenek száma alapján.

A Baseten az eredményt saját következtetései mellett független Artificial Analysis-benchmarkként mutatja be. A cég szerint a gyorsaság különösen fontos a GLM-5 esetében, mivel a modell következtetési modellként először egy gondolkodási sorozatot állít elő, és csak ezután adja meg a végső választ. Ez a belső folyamat gyakran hosszabb a végső válasznál, ezért a magasabb tokenenkénti sebesség közvetlenül rövidíti a teljes válaszidőt.

Három ponton hangolták az infrastruktúrát

A GLM-5 a Z.ai legújabb, nyílt súlyú zászlóshajómodellje. A forrás szerint összesen 744 milliárd paraméterrel rendelkezik, egy előrelépés során 40 milliárd aktív, és 28,5 billió tokenen tanították. A modellt MIT-licenc alatt adták ki. A Baseten beszámolója szerint a GLM-5 a kódolási és ügynöki benchmarkokban jelenleg a legképességesebb nyílt forrású modellek közé tartozik, eredményei a SWE-bench Verified teszten 77,8, az AIME 2026-on pedig 92,7 százalékosak. A Vending Bench 2-n a cég szerint első helyen állt a nyílt modellek között.

A modell a DeepSeek V3-hoz hasonlóan kevert szakértői, vagyis Mixture of Experts architektúrát használ, de a GLM-sorozatra jellemző módon több réteggel és kisebb rejtett mérettel épül fel. A Baseten szerint ez mélyebb, de keskenyebb felépítést jelent, amelyhez a hagyományos Mixture of Experts-kódok nem feltétlenül illeszkednek optimálisan. Ezért a vállalat a GLM-5 tényleges architektúrájára hangolt elosztási kerneleket használ, amelyek célja a szakértők közötti továbbítási többletének csökkentése és a GPU-k jobb kihasználása.

A GLM-5 a GLM-családban elsőként alkalmazza a DeepSeek Sparse Attention technikát. A Baseten szerint ez hosszú kontextus esetén jelentősen csökkenti a kulcs-érték gyorsítótár, vagyis a KV cache méretét, miközben megmarad a 200K-s kontextusablak. A cég ehhez olyan egyedi kerneleket készített, amelyek közvetlenül kihasználják a ritkított figyelmi mintázatot.

A Multi-Token Prediction gyorsítja a gondolkodási folyamatot

A harmadik fő elem a Multi-Token Prediction, röviden MTP alapú spekulatív dekódolás. Ennek lényege, hogy a rendszer jelölt tokeneket állít elő, majd a célmodell párhuzamosan ellenőrzi ezeket. Ha a célmodell elfogadja a jelölteket, egyetlen előrelépés költségéért több token készülhet el.

A GLM-5 beépített MTP-fejeket tartalmaz, így a Baseten szerint nincs szükség külön, kisebb vázlatmodell betanítására vagy futtatására. A vállalat saját dekódoló motorja a vázlattokenek ütemezését szorosan összekapcsolja a következtetési ciklussal, miközben alacsonyan tartja a gazdagépen végzett koordináció költségét. A Baseten szerint ez magas elfogadási arányt tesz lehetővé kódgenerálás, hosszú gondolkodási folyamatok és ügynöki eszközhasználat mellett is.

A bejelentés alapján a GLM-5 sebessége elsősorban azoknak a fejlesztőknek lehet fontos, akik autonóm kódoló ügynököket, több lépésből álló eszközhasználati folyamatokat vagy hosszú ideig futó ügynöki rendszereket építenek. A Baseten szerint a 200 token/másodperc feletti teljesítmény ilyen alkalmazásokban gyorsabb válaszokat tesz lehetővé, miközben a modell nyílt súlyú és MIT-licenc alatt érhető el.

Kapcsolódó hírek

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia
Fejlesztőknek2026. október 2.

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia

A Baseten egy LLM által létrehozott, egyedi inferenciamotorral akár 90 százalékkal jobb egyfolyamos dekódolási sebességet ért el a vLLM-nél. A VibeQwen nevű motor…

A CoreWeave szerint élmezőnyben a Kimi K2.7 Code ár-teljesítménye
Termékek és eszközök2026. október 2.

A CoreWeave szerint élmezőnyben a Kimi K2.7 Code ár-teljesítménye

Elérhetővé vált a Moonshot AI Kimi K2.7 Code modellje a CoreWeave Serverless Inference szolgáltatásán. A CoreWeave szerint a modell a szolgáltatók között a legmagasabb…

A Liquid AI Pipette-t adott ki az eszközön futó AI-modellek mérésére
Kutatás2026. augusztus 24.

A Liquid AI Pipette-t adott ki az eszközön futó AI-modellek mérésére

A Liquid AI és az Artificial Analysis nyílt forráskódú benchmarkrendszert indított az eszközökön futó AI-modellek vizsgálatára. A Pipette a sebességet, késleltetést…