Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Modal szerint trilliónyi token kiszolgálása kell a kódoló ügynökökhöz

2026. szeptember 23.Forrás: Modal
A Modal szerint trilliónyi token kiszolgálása kell a kódoló ügynökökhöz
Kép: Modal

A Modal olyan következtetési szolgáltatásokat üzemeltet kódoló AI-ügynökökhöz, amelyek naponta több százmilliárd, összesen pedig trilliónyi tokent dolgoznak fel. A vállalat szerint a megfelelő optimalizálással egy replikán 2,8-szorosára növelte az egy felhasználóra jutó teljesítményt, a felhasználók között mért teljesítményt pedig 5,6-szorosára.

A lényeg röviden
  • A Modal szerint a kódoló ügynökök kiszolgálása trilliónyi tokenes léptéket igényel.
  • A Kimi K2.6 körülbelül egytrillió paraméterrel működik.
  • A vállalat B200 és B300 GPU-kon, NVFP4 formátummal szolgálja ki a modellt.
  • Az optimalizálás 2,8-szoros, illetve 5,6-szoros teljesítménynövekedést hozott.
  • A munkamenetekben felépülő kontextus miatt a tokenforgalom önmagában nem írja le a terhelést.

Trilliós modellekhez trilliós tokenforgalom kell

A Modal szeptember 23-án közzétett technikai bejegyzésében azt írta, hogy a fejlett kódoló ügynököket működtető modellek már trilliónyi lebegőpontos paraméterrel rendelkeznek. Ezek mindegyikéhez másodpercenként többször hozzá kell férni, még akkor is, ha a rendszer csak egyetlen kérést szolgál ki.

A vállalat szerint emiatt a gazdaságosan működtethető következtetési szolgáltatásokhoz olyan méret szükséges, amelyen a hardveres és mérnöki költségek eloszthatók. A Modal ezt nagyjából trilliónyi bemeneti és kimeneti token feldolgozásának léptékeként írja le. A cég több, ilyen méretű kódolóügynök-szolgáltatást működtet, és ügyfelekkel is dolgozik hasonló rendszereken.

A szolgáltatások közvetve olyan következtetés-útválasztó platformokon keresztül is elérhetők, mint az OpenRouter és a Vercel AI Gateway, közvetlenül pedig a Modal Shared Endpoints felületén.

A Kimi K2.6 kiszolgálásának optimalizálása

A bejegyzés a Moonshot AI Kimi K2.6 modelljének kiszolgálásán keresztül mutatja be a módszereket. A Modal megjegyzése szerint a modell a terület mércéjével számítva régi, ugyanakkor a szekvenciamodellezés, a hardver és a skálázás alapjai lassabban változnak, ezért a bemutatott megoldások újabb modelleknél is használhatók. A vállalat példaként a Kimi K3-at említi.

A Kimi K2.6 mátrixszorzásait körülbelül egytrillió szám, vagyis súly paraméterezi. Ezek többségét négybites egész számként, INT4 formátumban tárolják, a Modal azonban négybites lebegőpontos, FP4 formátumban szolgálja ki a modellt. A rendszerhez az NVFP4 mikroléptékes formátumot választották, amelyet a Blackwell Streaming Multiprocessor Architecture B200 és B300 GPU-inak Tensor Core egységei natívan támogatnak.

A dinamikus GPU-flotta miatt a telepítést mindkét GPU-típusra felkészítették. A közölt eredmények B200 GPU-kon készültek. A Modal szerint a B300-ak lényegében hasonlóan teljesítenek, de a nagyobb, nagy sávszélességű memóriájuk miatt több párhuzamos kérést tudnak gyorsítótárazni.

Alapként az SGLang következtetési motort használták, majd több ponton módosították. A Modal a változtatásokat az SGLang projekt közreműködőjeként vissza is juttatta a projektbe.

A késleltetés és a költséghatékonyság egyszerre számít

A nagy generatív modellek a bemenetet párhuzamosan dolgozzák fel, a választ viszont szekvenciálisan következtetik ki. A rendszerben a tokenenként végzett számítások több szekvencia egyidejű kötegelt feldolgozásával oszthatók meg, a tokenek közötti számítások pedig a belső állapot gyorsítótárazásával tehetők hatékonyabbá. Ezt a gyorsítótárat hagyományosan key-value cache-nek, röviden KV cache-nek nevezik.

A bemeneti tokeneket feldolgozó lépést prefillnek hívják, ennek fő mérőszáma az első tokenig eltelt idő, vagyis a TTFT. A válasz tokenjeinek előállítása a decode szakasz, amelyet a másodpercenként előállított kimeneti tokenek száma, a TPS jellemez.

A Modal szerint a kódolóügynök-forgalom naiv kiszolgálásakor a teljesítmény gyorsan romlik hat párhuzamos felhasználó fölött. Az interaktivitás és a rendszer hatékonysága már ez előtt a pont előtt is elmaradhat a kívánatostól. A vállalat optimalizálásai ezt a helyzetet javították: egy replikán az egy felhasználóra jutó teljesítmény 2,8-szorosára, a replikán belüli felhasználók között mért teljesítmény 5,6-szorosára nőtt.

A kódoló ügynökök munkamenetekben építik fel a kontextust

A Modal szerint a terhelést nem lehet pusztán a bejövő és kimenő tokenek számával leírni. Az egyedi kérések munkamenetekben kapcsolódnak össze: a felhasználó, a generatív modell és az eszközhívások ismétlődő folyamatban építenek fel egyre hosszabb bemeneti szekvenciákat. Eközben a kontextus és az összegyűjtött információ is folyamatosan bővül.

Ez a működés meghatározza, hogyan kell a következtetési infrastruktúrát megtervezni. A Modal ezért a teljesítményt egyszerre méri felhasználói oldalon, az interaktivitást kifejező másodpercenkénti dekódolt tokenekkel, és rendszeroldalon, a GPU-nkénti percenkénti teljes tokenátvitellel. A cél a gyorsabb válaszadás és a jobb költségteljesítmény egyidejű elérése.

Kapcsolódó hírek

A Modal teljes értékű Linux-gépeket ad az AI-ügynököknek
Termékek és eszközök2026. október 1.

A Modal teljes értékű Linux-gépeket ad az AI-ügynököknek

Általánosan elérhetővé váltak a Modal VM Sandboxes nevű virtuális gépei, amelyekkel az AI-ügynökök teljes értékű Linux-környezetben dolgozhatnak. A szolgáltatás a…

A Modal új eszközöket jelentett be az AI-ügynökök és modellek számára
Termékek és eszközök2026. október 1.

A Modal új eszközöket jelentett be az AI-ügynökök és modellek számára

A Modal több új futtatási és infrastruktúra-funkciót jelentett be első konferenciáján. A csomagban virtuális gépet kínáló Sandboxok, elkülönített Sidecar konténerek…

A Modal új eszközöket mutatott be az ügynökalapú rendszerekhez
Termékek és eszközök2026. október 1.

A Modal új eszközöket mutatott be az ügynökalapú rendszerekhez

A Modal több új futtatási és infrastruktúra-funkciót mutatott be, köztük teljes Linux-környezetet biztosító VM Sandboxokat, többcsomópontos klasztereket és munkamenethez…