Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Cache-tudatos útválasztást vezetett be a DigitalOcean Inference Router

2026. augusztus 20.Forrás: DigitalOcean
Cache-tudatos útválasztást vezetett be a DigitalOcean Inference Router
Kép: DigitalOcean

A DigitalOcean Inference Router mostantól a modellek gyorsítótárban lévő kontextusát is figyelembe veszi a kérések elosztásakor. A vállalat szerint így elkerülhető, hogy egy olcsóbb modellre váltás a teljes kontextus újbóli feldolgozása miatt végül drágább és lassabb legyen.

A lényeg röviden
  • A DigitalOcean Inference Router már a gyorsítótárazott kontextust is figyelembe veszi.
  • A meleg gyorsítótár megtartása egy drágább modell mellett is csökkentheti a következő kérés költségét.
  • Az X-Model-Affinity munkamenethez vagy feladathoz kötheti a kéréseket.
  • Az X-Routing-Max-Switch-Spend-Pct szabályozza a modellváltások engedélyezett többletköltségét.

A tokenhasználat növekedése új költségproblémát okoz

A DigitalOcean augusztus 20-i bejelentése szerint a mesterséges intelligenciát nagyobb léptékben használó vállalatoknak egyre nehezebb változatlan szinten tartaniuk a kiadásaikat. Brian Armstrong, a Coinbase vezérigazgatója nemrég azt a kérdést tette fel, hogyan tartható stabilan a költés akkor is, amikor a tokenfelhasználás gyorsan növekszik.

A közlemény több példát is említ. Az Uber az év első négy hónapjában felhasználta az egész éves kódolási AI-keretét, ezt követően pedig havi 1500 dolláros limitet vezetett be alkalmazottanként. A Walmart tokenlimitet állított be belső Code Puppy ügynökénél, miután a dolgozók többször ugyanazokat a problémákat kérték megoldani. Egy Priceline-alkalmazott arról számolt be, hogy egy szokásos Cursor-megújítás 4 és 5-ször drágább lett.

A gyorsítótár felülírhatja az olcsóbb modell előnyét

Az ügynökalapú rendszerek ismételten nagy mennyiségű azonos kontextust küldenek a modelleknek. Ebbe beletartozhatnak a rendszerutasítások, az eszközdefiníciók, a kódrepository kontextusa és a folyamatosan bővülő beszélgetési előzmények. A DigitalOcean szerint ezért a gyorsítótárazás a költség és a késleltetés szinte minden későbbi modellhívására hatással van.

A vállalat egy példával szemlélteti a különbséget. Ha egy ügynök 100 000 tokenes kontextusából 90 000 token már gyorsítótárban van Claude Sonnet 5 modellen, a következő kérés bemeneti költsége körülbelül 0,043 dollár lehet. Ugyanez a kérés GLM-5.2 modellen, 0,7 dolláros egymillió nem gyorsítótárazott bemeneti tokenenkénti árral számolva, 0,07 dollárba kerülhet, mivel a teljes kontextust újra fel kell dolgozni. Ez a példában hozzávetőleg 1,6-szoros különbséget jelent.

A DigitalOcean saját munkafolyamataiban a Kimi K3 megjelenése óta 90 százalék feletti összesített gyorsítótár-találati arányt figyelt meg kódolási és hosszú feladatoknál. A vállalat hozzáteszi, hogy az egyes munkafolyamatok eredménye ettől eltérhet.

Két vezérlési lehetőség a modellváltások kezelésére

A cache-tudatos útválasztás előtt az Inference Router minden kérést önállóan értékelt. Ez alapján kiválaszthatta az olcsóbb vagy a feladathoz jobban illő modellt, azt viszont nem érzékelte, hogy egy folyamat már meglévő, felmelegített gyorsítótárhoz tartozik. A modellváltás ilyenkor érvénytelenítheti a korábbi gyorsítótárat, és a célmodellnek a teljes kontextust újra fel kell dolgoznia.

Az egyik új lehetőség az X-Model-Affinity HTTP-fejléc. Az alkalmazások ebben egy munkamenethez vagy feladathoz tartozó azonosítót adhatnak át. Az azonos értékű kéréseket a rendszer ugyanahhoz a munkához kapcsolja, így megtarthatja a modellkötést és újrahasznosíthatja a gyorsítótárazott kontextust. Ilyen egység lehet például egy kódolási munkamenet, kutatási feladat, ügyfélszolgálati beszélgetés vagy egyetlen ügynökfuttatás.

Ha nincs explicit azonosító, az Inference Router a kérés stabil kontextusa alapján is következtethet a kapcsolatra. A rendszer figyelembe veszi többek között a rendszer- és fejlesztői utasításokat, az eszközdefiníciókat, valamint az első felhasználói üzenetet.

A routing budget korlátozza a gyorsítótár megtörésének költségét

A másik új vezérlő a routing budget, amelyhez nem szükséges módosítani az alkalmazás kódját. Ha az útválasztási szabály egy másik modellre váltana, az Inference Router kiszámítja a meleg gyorsítótár elhagyásának többletköltségét. Ezután összeveti azt azzal a költséggel, amely a munkamenetben az eredeti modellen maradással keletkezett volna.

A fejlesztők maximális váltási költséget határozhatnak meg. Az X-Routing-Max-Switch-Spend-Pct: 20 beállítás például legfeljebb 20 százalékkal engedi a kumulatív váltási költség növekedését az alapforgatókönyvhöz képest. A DigitalOcean szerint a modell kiválasztása és a gazdaságossági döntés külön marad: az útválasztó az előnyben részesített modellt azonosítja, a routing budget pedig azt dönti el, hogy megéri-e az ehhez szükséges többlet bemeneti költség.

Kapcsolódó hírek

A CoreWeave interaktív jegyzetfüzeteket indított AI-fejlesztéshez
Fejlesztőknek2026. október 2.

A CoreWeave interaktív jegyzetfüzeteket indított AI-fejlesztéshez

A CoreWeave Notebooks a CoreWeave Forge részeként interaktív Python- és SQL-alapú elemzést kínál a modellek fejlesztéséhez. A jegyzetfüzetek közvetlenül a projektek…

A DigitalOcean MicroVM-ek elkülönített, szüneteltethető gépeket adnak az AI-agentekhez
Termékek és eszközök2026. október 1.

A DigitalOcean MicroVM-ek elkülönített, szüneteltethető gépeket adnak az AI-agentekhez

A DigitalOcean privát előzetesben elérhetővé tette MicroVM szolgáltatását, amely munkamenetenként elkülönített virtuális gépet biztosít az AI-agentek és rövid ideig futó…

A DigitalOcean egyetlen havi csomagba vonja az AI-ügynökök költségeit
Termékek és eszközök2026. október 1.

A DigitalOcean egyetlen havi csomagba vonja az AI-ügynökök költségeit

A DigitalOcean Agent Droplets néven új csomagokat indított, amelyek egyetlen havi díjba vonják az AI-ügynökök futtatásának több költségelemét. A konstrukció a számítási…