A sessionazonosítóval gyorsítaná az ügynöki AI-kiszolgálást a NVIDIA Dynamo

A NVIDIA Dynamo egységes munkamenet-azonosítóval kezeli az ügynöki AI-rendszerek ismétlődő modellhívásait, párhuzamos alügynökeit és megőrzött KV-gyorsítótárát. A PyTorch bemutatása szerint ezzel a kérésenként működő infrastruktúra munkamenet-tudatos rendszerré alakítható.
- A Dynamo a munkameneteket stabil session_id azonosítóval kapcsolja össze.
- A Claude Code, a Codex és az OpenCode támogatása konfiguráció nélkül működik.
- A nyomkövetés alapértelmezésben nem ment prompt- és válaszszöveget.
- Az AISimulate offline, az AIPerf élő környezetben játszhatja vissza a terhelést.
- A rendszer a munkamenet-tudatos útválasztást és KV-gyorsítótár-kezelést célozza.
Az ügynöki munkafolyamat más terhelést jelent
Az ügynöki rendszerek forgalma eltér a hagyományos, egyfordulós csevegésétől. Egy kódolási munkamenet nagy kezdeti előfeldolgozással indulhat, amelyben több tízezer tokennyi rendszerszöveg, eszközleírás és felhasználói útmutatás szerepel. A későbbi fordulók ehhez a teljes kontextushoz adnak új tartalmat.
Egyetlen feladat több tucat modellhívást is elindíthat, miközben rövid és hosszabb életű alügynökök dolgoznak párhuzamosan. A munkamenet faliórával mért idejének nagy része az eszközhívások között telik, ezért a kontextus közben a KV-gyorsítótárban maradhat, miközben a modell éppen nem generál.
A PyTorchon megjelent technikai bejegyzés szerint az ilyen terhelés kiszolgálásának egyik kulcsa, hogy a rendszer mennyi kontextust tart meg és használ fel újra, illetve hány munkamenetet tud egyszerre kezelni a késleltetési célok betartása mellett.
Egy azonosító köti össze a kéréseket
A Dynamo a session_id mezőt egyetlen ügynöki gondolkodási és eszközhasználati lánc stabil, egyedi azonosítójaként használja. Egy adott munkamenet minden LLM-kérése ugyanazt az értéket kapja. Az alügynökök rendszerint parent_session_id mezőt is továbbítanak, így a nyomkövető és visszajátszó eszközök kapcsolatot teremthetnek az ügynökök és az általuk létrehozott alügynökök vagy részfeladatok között.
A rendszer konfiguráció nélkül felismeri a Claude Code, a Codex és az OpenCode által küldött azonosítófejléceket. Egyedi ügynöki keretrendszer esetén az X-Dynamo-Session-ID fejléc használható, az alügynökökhöz pedig az X-Dynamo-Parent-Session-ID adható meg. A Dynamo ezeket belső agent_context struktúrává alakítja, így az infrastruktúra többi része nem függ attól, melyik keretrendszer küldte a kérést.
Azokhoz a keretrendszerekhez, amelyek nem küldenek megfelelő fejlécet, a projekt agent-plugins tárolója is kínál integrációkat. A forrás szerint jelenleg Pi, Hermes és OpenClaw számára érhető el ilyen bővítmény.
Nyomkövetés, ütemezés és KV-gyorsítótár
A session_id a Dynamo több fejlesztésének alapja. A munkamenethez kötött nyomok összekapcsolják az ügynöki keretrendszer működését az inferencia teljesítményével, és lehetővé teszik az offline szimulációt, valamint az élő összehasonlító méréseket.
A DYN_REQUEST_TRACE=1 beállítással a rendszer automatikusan rögzíti a kérések adatait. Alapértelmezésben nem menti el a prompt, a válasz vagy az eszközhívás tartalmát. A request_end rekord többek között a munkamenet mezőit, a generált tokenek számát, a befejezés okát, a KV-gyorsítótár mutatóit, az eszközhívások neveit, valamint a bemeneti hosszra és a blokkok szekvenciahash-eire vonatkozó visszajátszási adatokat tartalmazza.
A Dynamo ütemezése a munkamenetek által használt erőforráskészleteket is figyelembe veszi, és az eszközhívások határainál visszaterhelést alkalmazhat a gyorsítótár túlzott cserélődésének mérséklésére. A megosztott KV-gyorsítótár kísérleti indexelője külső tárolókban lévő, újrahasznosítható gyorsítótár alapján is segítheti az útválasztást.
A fejlesztők ugyanazt a terhelést játszhatják vissza
A rögzített nyom egy újrafelhasználható mérési alapot ad. A visszajátszás a munkamenet által küldött terhelést őrzi, ezért ugyanaz az ütemezés többször lefuttatható a modell, az eszközök vagy külső API-k újbóli meghívása nélkül. A tartalommentes folyamatban a szekvenciahash-ek szintetikus blokmazonosítókká válnak, miközben megmarad az előtagok közös használatának információja.
Offline módban az AISimulate a Dynamo szimulált ütemezőjén, útválasztóján és KV-gyorsítótárán futtatja a kérésgráfot. Így különböző munkásszámok, kiszolgálási topológiák, útválasztási szabályok és gyorsítótár-kapacitások hasonlíthatók össze GPU-idő felhasználása nélkül. Élő környezetben az AIPerf ugyanezt a gráfot valódi Dynamo-végponton és valódi GPU-kon játssza vissza.
A PyTorch forrása szerint az egységes azonosító a vLLM és az SGLang fölött is támogatja a megosztott KV-gyorsítótár indexelését és a programozott gyorsítótár-mozgatást. A megoldás így az ügynöki alkalmazások fejlesztőinek a teljes munkamenet teljesítményét teszi vizsgálhatóbbá, nem csak az egyes modellkéréseket.
PyTorch: Session-Aware Agentic Inference with NVIDIA Dynamo
