TokenGridgel váltaná fel a statikus AI-limitálást a DataRobot

A DataRobot bemutatta a TokenGridet, egy tokenérzékeny kapacitásütemezőt, amely az LLM-kéréseket nem pusztán a kérések számát, hanem azok várható erőforrás-igénye alapján kezeli. A rendszer a vállalati, önállóan üzemeltetett és külső szolgáltatóknál elérhető modellek forgalmát is képes egy közös szabályrendszerben kezelni.
- A TokenGrid tokenek és erőforrás-terhelés alapján ütemezi az LLM-kéréseket.
- Saját GPU-fürtöket és külső modell-API-kat is képes közös szabályrendszerben kezelni.
- A rendszer dinamikus kvótákat, méltányos megosztást és memóriaalapú visszanyomást alkalmaz.
- A DataRobot megoldása jelenleg privát előzetes hozzáférésben érhető el.
A kérések száma önmagában kevés
A DataRobot szerint a vállalati AI-rendszerek egyik fő problémája, hogy miközben nő a tokenfelhasználás és a külső modell-előfizetések költsége, az ezeket kiszolgáló GPU-fürtök kihasználtsága akár csak 20 százalékos lehet. A vállalat ezt azzal magyarázza, hogy a hagyományos alkalmazásütemezők, Kubernetes-alapú keretrendszerek és API-átjárók jellemzően a statikus hardveres jellemzőket látják, például a CPU-k és GPU-k számát, a memóriát vagy a hálózati forgalmat.
Ezek az eszközök nem feltétlenül érzékelik a tokenek számát, a prompt hosszát vagy a kulcsérték-gyorsítótár, vagyis a KV cache terhelését. Egy 10 tokenes kérés és egy 200 ezer tokenes kontextust továbbító kérés ezért azonosnak tűnhet számukra, miközben a DataRobot szerint a fürt terhelése között nagyságrendi különbség lehet. A hosszú kérés lefoglalhatja a modellkiszolgáló KV cache-ét, növelheti a késleltetést, és más alkalmazásoknál is hibákhoz, például 429-es elutasításokhoz vezethet.
A vállalat szerint a gondot tovább súlyosbítja, hogy a tokenkezelés gyakran több helyre széttagolódik. A szervezetek önálló modelleket futtathatnak saját infrastruktúrájukon, miközben olyan szolgáltatók API-it is használják, mint az AWS Bedrock, az Azure OpenAI vagy az Anthropic. Így a platformcsapatoknak nehéz egyetlen helyen követniük és szabályozniuk a kvótákat.
Három pillérre épül a TokenGrid
A TokenGrid a meglévő átjárók és proxyk mellett működik, és a kérések beléptetési útvonalán helyezkedik el. A DataRobot állítása szerint a rendszer egy közös, megosztott kapacitásmedencével váltja fel a statikus hardverpartíciókat, és saját fürtök, felhőben üzemeltetett modellek, valamint közvetlenül külső szolgáltatóktól elért modellek között is alkalmazható.
Az első képesség a dinamikus sebességkorlátozás. A TokenGrid a rögzített, például percenkénti kérésszám helyett többdimenziós kvótákat kezel. Figyelembe veszi a másodpercenként feldolgozott tokeneket, a havi tokenkereteket, a konténerek memóriáját és az aktuális terhelési adatokat.
A második elem a méltányos megosztást biztosító ütemező. A rendszer először megbecsüli a kérés előfeldolgozási igényét, és elkülöníti a nagy kontextusú feladatokat a könnyebb lekérdezésektől. Ezután nyilvántartja a tokenfogyasztást a saját fürtökben és a külső API-kban. A kvótáját túllépő bérlő alacsonyabb prioritást kaphat. Saját fürtökön ez a kérés késleltetését jelentheti, külső API-knál pedig visszanyomást és fokozatosabb kiszolgálást, hogy egy nagy forgalmú felhasználó ne merítse ki a közös TPM- vagy RPM-keretet.
Ha a rendszer hozzáfér a konténerek teljesítményadataihoz, a GPU-memóriát és a cache kihasználtságát is figyeli. Egy beállított KV cache-küszöb átlépésekor a TokenGrid alacsony prioritású háttérfeladatokat 429-es válasszal korlátozhat, az interaktív munkameneteket szabad kapacitású csomópontokra irányíthatja, és az érkezési sorrend helyett a rövidebb feladatokat részesítheti előnyben.
A harmadik elem az automatikus kapacitás-összehangolás. A rendszer konténerszintű teljesítményjeleket küld egy központi Token Admin Service-nek, amely ezeket a valós idejű forgalmi mintákkal veti össze. Ennek alapján a TokenGrid ajánlásokat adhat, illetve újrakalibrálhatja a végrehajtási helyeket, a TPM-küszöböket és az RPM-korlátokat.
Elsősorban a saját GPU-fürtöket üzemeltető csapatokat célozza
A DataRobot szerint a megoldás különösen azokat a platformcsapatokat segítheti, amelyek főként helyben, saját adatközpontban futtatják modelljeiket. Ezek a szervezetek akár több millió dollárt is befektethettek dedikált, csupasz fémű GPU-fürtökbe, ezért számukra minden kihasználatlan kapacitás közvetlen költséget jelent. A TokenGrid célja, hogy a forgalmi csúcsokat a statikus proxybeállításoknál rugalmasabban kezelje, és megakadályozza, hogy egy zajos vagy túlterhelt bérlő más alkalmazások működését is akadályozza.
A vállalat szerint a tokenalapú ütemezés a többfordulós és ügynökalapú rendszerekben válik különösen fontossá, ahol egy kérés futás közben jelentősen megnövelheti a kontextus méretét és az erőforrásigényt. A DataRobot úgy véli, hogy a platformcsapatok így a túlméretezés helyett a tényleges használati mintákhoz igazíthatják a kapacitáselosztást, és más modellek vagy tanítási feladatok számára is felszabadíthatnak GPU-kapacitást.
A TokenGrid 2026. augusztus 10-én még privát előzetes hozzáférésben volt, kiválasztott közös fejlesztési és vállalati ügyfelek számára. A DataRobot termékcsapata korai hozzáférési kérelmeket fogad.


