Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

TokenGridgel váltaná fel a statikus AI-limitálást a DataRobot

2026. augusztus 10. 20:53Forrás: DataRobot
TokenGridgel váltaná fel a statikus AI-limitálást a DataRobot
Kép: DataRobot

A DataRobot bemutatta a TokenGridet, egy tokenérzékeny kapacitásütemezőt, amely az LLM-kéréseket nem pusztán a kérések számát, hanem azok várható erőforrás-igénye alapján kezeli. A rendszer a vállalati, önállóan üzemeltetett és külső szolgáltatóknál elérhető modellek forgalmát is képes egy közös szabályrendszerben kezelni.

A lényeg röviden
  • A TokenGrid tokenek és erőforrás-terhelés alapján ütemezi az LLM-kéréseket.
  • Saját GPU-fürtöket és külső modell-API-kat is képes közös szabályrendszerben kezelni.
  • A rendszer dinamikus kvótákat, méltányos megosztást és memóriaalapú visszanyomást alkalmaz.
  • A DataRobot megoldása jelenleg privát előzetes hozzáférésben érhető el.

A kérések száma önmagában kevés

A DataRobot szerint a vállalati AI-rendszerek egyik fő problémája, hogy miközben nő a tokenfelhasználás és a külső modell-előfizetések költsége, az ezeket kiszolgáló GPU-fürtök kihasználtsága akár csak 20 százalékos lehet. A vállalat ezt azzal magyarázza, hogy a hagyományos alkalmazásütemezők, Kubernetes-alapú keretrendszerek és API-átjárók jellemzően a statikus hardveres jellemzőket látják, például a CPU-k és GPU-k számát, a memóriát vagy a hálózati forgalmat.

Ezek az eszközök nem feltétlenül érzékelik a tokenek számát, a prompt hosszát vagy a kulcsérték-gyorsítótár, vagyis a KV cache terhelését. Egy 10 tokenes kérés és egy 200 ezer tokenes kontextust továbbító kérés ezért azonosnak tűnhet számukra, miközben a DataRobot szerint a fürt terhelése között nagyságrendi különbség lehet. A hosszú kérés lefoglalhatja a modellkiszolgáló KV cache-ét, növelheti a késleltetést, és más alkalmazásoknál is hibákhoz, például 429-es elutasításokhoz vezethet.

A vállalat szerint a gondot tovább súlyosbítja, hogy a tokenkezelés gyakran több helyre széttagolódik. A szervezetek önálló modelleket futtathatnak saját infrastruktúrájukon, miközben olyan szolgáltatók API-it is használják, mint az AWS Bedrock, az Azure OpenAI vagy az Anthropic. Így a platformcsapatoknak nehéz egyetlen helyen követniük és szabályozniuk a kvótákat.

Három pillérre épül a TokenGrid

A TokenGrid a meglévő átjárók és proxyk mellett működik, és a kérések beléptetési útvonalán helyezkedik el. A DataRobot állítása szerint a rendszer egy közös, megosztott kapacitásmedencével váltja fel a statikus hardverpartíciókat, és saját fürtök, felhőben üzemeltetett modellek, valamint közvetlenül külső szolgáltatóktól elért modellek között is alkalmazható.

Az első képesség a dinamikus sebességkorlátozás. A TokenGrid a rögzített, például percenkénti kérésszám helyett többdimenziós kvótákat kezel. Figyelembe veszi a másodpercenként feldolgozott tokeneket, a havi tokenkereteket, a konténerek memóriáját és az aktuális terhelési adatokat.

A második elem a méltányos megosztást biztosító ütemező. A rendszer először megbecsüli a kérés előfeldolgozási igényét, és elkülöníti a nagy kontextusú feladatokat a könnyebb lekérdezésektől. Ezután nyilvántartja a tokenfogyasztást a saját fürtökben és a külső API-kban. A kvótáját túllépő bérlő alacsonyabb prioritást kaphat. Saját fürtökön ez a kérés késleltetését jelentheti, külső API-knál pedig visszanyomást és fokozatosabb kiszolgálást, hogy egy nagy forgalmú felhasználó ne merítse ki a közös TPM- vagy RPM-keretet.

Ha a rendszer hozzáfér a konténerek teljesítményadataihoz, a GPU-memóriát és a cache kihasználtságát is figyeli. Egy beállított KV cache-küszöb átlépésekor a TokenGrid alacsony prioritású háttérfeladatokat 429-es válasszal korlátozhat, az interaktív munkameneteket szabad kapacitású csomópontokra irányíthatja, és az érkezési sorrend helyett a rövidebb feladatokat részesítheti előnyben.

A harmadik elem az automatikus kapacitás-összehangolás. A rendszer konténerszintű teljesítményjeleket küld egy központi Token Admin Service-nek, amely ezeket a valós idejű forgalmi mintákkal veti össze. Ennek alapján a TokenGrid ajánlásokat adhat, illetve újrakalibrálhatja a végrehajtási helyeket, a TPM-küszöböket és az RPM-korlátokat.

Elsősorban a saját GPU-fürtöket üzemeltető csapatokat célozza

A DataRobot szerint a megoldás különösen azokat a platformcsapatokat segítheti, amelyek főként helyben, saját adatközpontban futtatják modelljeiket. Ezek a szervezetek akár több millió dollárt is befektethettek dedikált, csupasz fémű GPU-fürtökbe, ezért számukra minden kihasználatlan kapacitás közvetlen költséget jelent. A TokenGrid célja, hogy a forgalmi csúcsokat a statikus proxybeállításoknál rugalmasabban kezelje, és megakadályozza, hogy egy zajos vagy túlterhelt bérlő más alkalmazások működését is akadályozza.

A vállalat szerint a tokenalapú ütemezés a többfordulós és ügynökalapú rendszerekben válik különösen fontossá, ahol egy kérés futás közben jelentősen megnövelheti a kontextus méretét és az erőforrásigényt. A DataRobot úgy véli, hogy a platformcsapatok így a túlméretezés helyett a tényleges használati mintákhoz igazíthatják a kapacitáselosztást, és más modellek vagy tanítási feladatok számára is felszabadíthatnak GPU-kapacitást.

A TokenGrid 2026. augusztus 10-én még privát előzetes hozzáférésben volt, kiválasztott közös fejlesztési és vállalati ügyfelek számára. A DataRobot termékcsapata korai hozzáférési kérelmeket fogad.

Kapcsolódó hírek

Így osztja meg az AI21 a közel 10 ezer GPU-t a csapatai között
Chipek és infrastruktúra2026. október 4. 13:37

Így osztja meg az AI21 a közel 10 ezer GPU-t a csapatai között

Az AI21 egy mintegy 10 ezer GPU-t kezelő, több csapat által használt GKE-fürtön váltott kézi erőforrás-egyeztetésről automatizált feladatütemezésre. A rendszer központi…

Az AWS Dél-Koreában és Szingapúrban is helyben futtatja a Claude modelleket
Termékek és eszközök2026. szeptember 30. 03:13

Az AWS Dél-Koreában és Szingapúrban is helyben futtatja a Claude modelleket

Az Amazon Bedrock mostantól régión belüli következtetést kínál Anthropic Claude modellekhez Szöulban és Szingapúrban. A kérelmek, a bemenetek és a válaszok az adott…

Helyben maradnak a Claude-modellek az AWS szöuli és szingapúri régiójában
Termékek és eszközök2026. szeptember 30. 03:13

Helyben maradnak a Claude-modellek az AWS szöuli és szingapúri régiójában

Az Amazon Bedrock már támogatja az Anthropic Claude Opus 5 és Claude Sonnet 5 modelleket Szöulban, valamint a Claude Sonnet 5 modellt Szingapúrban, régión belüli…