A Modal szerint trilliónyi token kiszolgálása kell a kódoló ügynökökhöz

A Modal olyan következtetési szolgáltatásokat üzemeltet kódoló AI-ügynökökhöz, amelyek naponta több százmilliárd, összesen pedig trilliónyi tokent dolgoznak fel. A vállalat szerint a megfelelő optimalizálással egy replikán 2,8-szorosára növelte az egy felhasználóra jutó teljesítményt, a felhasználók között mért teljesítményt pedig 5,6-szorosára.
- A Modal szerint a kódoló ügynökök kiszolgálása trilliónyi tokenes léptéket igényel.
- A Kimi K2.6 körülbelül egytrillió paraméterrel működik.
- A vállalat B200 és B300 GPU-kon, NVFP4 formátummal szolgálja ki a modellt.
- Az optimalizálás 2,8-szoros, illetve 5,6-szoros teljesítménynövekedést hozott.
- A munkamenetekben felépülő kontextus miatt a tokenforgalom önmagában nem írja le a terhelést.
Trilliós modellekhez trilliós tokenforgalom kell
A Modal szeptember 23-án közzétett technikai bejegyzésében azt írta, hogy a fejlett kódoló ügynököket működtető modellek már trilliónyi lebegőpontos paraméterrel rendelkeznek. Ezek mindegyikéhez másodpercenként többször hozzá kell férni, még akkor is, ha a rendszer csak egyetlen kérést szolgál ki.
A vállalat szerint emiatt a gazdaságosan működtethető következtetési szolgáltatásokhoz olyan méret szükséges, amelyen a hardveres és mérnöki költségek eloszthatók. A Modal ezt nagyjából trilliónyi bemeneti és kimeneti token feldolgozásának léptékeként írja le. A cég több, ilyen méretű kódolóügynök-szolgáltatást működtet, és ügyfelekkel is dolgozik hasonló rendszereken.
A szolgáltatások közvetve olyan következtetés-útválasztó platformokon keresztül is elérhetők, mint az OpenRouter és a Vercel AI Gateway, közvetlenül pedig a Modal Shared Endpoints felületén.
A Kimi K2.6 kiszolgálásának optimalizálása
A bejegyzés a Moonshot AI Kimi K2.6 modelljének kiszolgálásán keresztül mutatja be a módszereket. A Modal megjegyzése szerint a modell a terület mércéjével számítva régi, ugyanakkor a szekvenciamodellezés, a hardver és a skálázás alapjai lassabban változnak, ezért a bemutatott megoldások újabb modelleknél is használhatók. A vállalat példaként a Kimi K3-at említi.
A Kimi K2.6 mátrixszorzásait körülbelül egytrillió szám, vagyis súly paraméterezi. Ezek többségét négybites egész számként, INT4 formátumban tárolják, a Modal azonban négybites lebegőpontos, FP4 formátumban szolgálja ki a modellt. A rendszerhez az NVFP4 mikroléptékes formátumot választották, amelyet a Blackwell Streaming Multiprocessor Architecture B200 és B300 GPU-inak Tensor Core egységei natívan támogatnak.
A dinamikus GPU-flotta miatt a telepítést mindkét GPU-típusra felkészítették. A közölt eredmények B200 GPU-kon készültek. A Modal szerint a B300-ak lényegében hasonlóan teljesítenek, de a nagyobb, nagy sávszélességű memóriájuk miatt több párhuzamos kérést tudnak gyorsítótárazni.
Alapként az SGLang következtetési motort használták, majd több ponton módosították. A Modal a változtatásokat az SGLang projekt közreműködőjeként vissza is juttatta a projektbe.
A késleltetés és a költséghatékonyság egyszerre számít
A nagy generatív modellek a bemenetet párhuzamosan dolgozzák fel, a választ viszont szekvenciálisan következtetik ki. A rendszerben a tokenenként végzett számítások több szekvencia egyidejű kötegelt feldolgozásával oszthatók meg, a tokenek közötti számítások pedig a belső állapot gyorsítótárazásával tehetők hatékonyabbá. Ezt a gyorsítótárat hagyományosan key-value cache-nek, röviden KV cache-nek nevezik.
A bemeneti tokeneket feldolgozó lépést prefillnek hívják, ennek fő mérőszáma az első tokenig eltelt idő, vagyis a TTFT. A válasz tokenjeinek előállítása a decode szakasz, amelyet a másodpercenként előállított kimeneti tokenek száma, a TPS jellemez.
A Modal szerint a kódolóügynök-forgalom naiv kiszolgálásakor a teljesítmény gyorsan romlik hat párhuzamos felhasználó fölött. Az interaktivitás és a rendszer hatékonysága már ez előtt a pont előtt is elmaradhat a kívánatostól. A vállalat optimalizálásai ezt a helyzetet javították: egy replikán az egy felhasználóra jutó teljesítmény 2,8-szorosára, a replikán belüli felhasználók között mért teljesítmény 5,6-szorosára nőtt.
A kódoló ügynökök munkamenetekben építik fel a kontextust
A Modal szerint a terhelést nem lehet pusztán a bejövő és kimenő tokenek számával leírni. Az egyedi kérések munkamenetekben kapcsolódnak össze: a felhasználó, a generatív modell és az eszközhívások ismétlődő folyamatban építenek fel egyre hosszabb bemeneti szekvenciákat. Eközben a kontextus és az összegyűjtött információ is folyamatosan bővül.
Ez a működés meghatározza, hogyan kell a következtetési infrastruktúrát megtervezni. A Modal ezért a teljesítményt egyszerre méri felhasználói oldalon, az interaktivitást kifejező másodpercenkénti dekódolt tokenekkel, és rendszeroldalon, a GPU-nkénti percenkénti teljes tokenátvitellel. A cél a gyorsabb válaszadás és a jobb költségteljesítmény egyidejű elérése.


