Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A sessionazonosítóval gyorsítaná az ügynöki AI-kiszolgálást a NVIDIA Dynamo

2026. október 8. 20:13Forrás: PyTorch
A sessionazonosítóval gyorsítaná az ügynöki AI-kiszolgálást a NVIDIA Dynamo
Kép: PyTorch

A NVIDIA Dynamo egységes munkamenet-azonosítóval kezeli az ügynöki AI-rendszerek ismétlődő modellhívásait, párhuzamos alügynökeit és megőrzött KV-gyorsítótárát. A PyTorch bemutatása szerint ezzel a kérésenként működő infrastruktúra munkamenet-tudatos rendszerré alakítható.

A lényeg röviden
  • A Dynamo a munkameneteket stabil session_id azonosítóval kapcsolja össze.
  • A Claude Code, a Codex és az OpenCode támogatása konfiguráció nélkül működik.
  • A nyomkövetés alapértelmezésben nem ment prompt- és válaszszöveget.
  • Az AISimulate offline, az AIPerf élő környezetben játszhatja vissza a terhelést.
  • A rendszer a munkamenet-tudatos útválasztást és KV-gyorsítótár-kezelést célozza.

Az ügynöki munkafolyamat más terhelést jelent

Az ügynöki rendszerek forgalma eltér a hagyományos, egyfordulós csevegésétől. Egy kódolási munkamenet nagy kezdeti előfeldolgozással indulhat, amelyben több tízezer tokennyi rendszerszöveg, eszközleírás és felhasználói útmutatás szerepel. A későbbi fordulók ehhez a teljes kontextushoz adnak új tartalmat.

Egyetlen feladat több tucat modellhívást is elindíthat, miközben rövid és hosszabb életű alügynökök dolgoznak párhuzamosan. A munkamenet faliórával mért idejének nagy része az eszközhívások között telik, ezért a kontextus közben a KV-gyorsítótárban maradhat, miközben a modell éppen nem generál.

A PyTorchon megjelent technikai bejegyzés szerint az ilyen terhelés kiszolgálásának egyik kulcsa, hogy a rendszer mennyi kontextust tart meg és használ fel újra, illetve hány munkamenetet tud egyszerre kezelni a késleltetési célok betartása mellett.

Egy azonosító köti össze a kéréseket

A Dynamo a session_id mezőt egyetlen ügynöki gondolkodási és eszközhasználati lánc stabil, egyedi azonosítójaként használja. Egy adott munkamenet minden LLM-kérése ugyanazt az értéket kapja. Az alügynökök rendszerint parent_session_id mezőt is továbbítanak, így a nyomkövető és visszajátszó eszközök kapcsolatot teremthetnek az ügynökök és az általuk létrehozott alügynökök vagy részfeladatok között.

A rendszer konfiguráció nélkül felismeri a Claude Code, a Codex és az OpenCode által küldött azonosítófejléceket. Egyedi ügynöki keretrendszer esetén az X-Dynamo-Session-ID fejléc használható, az alügynökökhöz pedig az X-Dynamo-Parent-Session-ID adható meg. A Dynamo ezeket belső agent_context struktúrává alakítja, így az infrastruktúra többi része nem függ attól, melyik keretrendszer küldte a kérést.

Azokhoz a keretrendszerekhez, amelyek nem küldenek megfelelő fejlécet, a projekt agent-plugins tárolója is kínál integrációkat. A forrás szerint jelenleg Pi, Hermes és OpenClaw számára érhető el ilyen bővítmény.

Nyomkövetés, ütemezés és KV-gyorsítótár

A session_id a Dynamo több fejlesztésének alapja. A munkamenethez kötött nyomok összekapcsolják az ügynöki keretrendszer működését az inferencia teljesítményével, és lehetővé teszik az offline szimulációt, valamint az élő összehasonlító méréseket.

A DYN_REQUEST_TRACE=1 beállítással a rendszer automatikusan rögzíti a kérések adatait. Alapértelmezésben nem menti el a prompt, a válasz vagy az eszközhívás tartalmát. A request_end rekord többek között a munkamenet mezőit, a generált tokenek számát, a befejezés okát, a KV-gyorsítótár mutatóit, az eszközhívások neveit, valamint a bemeneti hosszra és a blokkok szekvenciahash-eire vonatkozó visszajátszási adatokat tartalmazza.

A Dynamo ütemezése a munkamenetek által használt erőforráskészleteket is figyelembe veszi, és az eszközhívások határainál visszaterhelést alkalmazhat a gyorsítótár túlzott cserélődésének mérséklésére. A megosztott KV-gyorsítótár kísérleti indexelője külső tárolókban lévő, újrahasznosítható gyorsítótár alapján is segítheti az útválasztást.

A fejlesztők ugyanazt a terhelést játszhatják vissza

A rögzített nyom egy újrafelhasználható mérési alapot ad. A visszajátszás a munkamenet által küldött terhelést őrzi, ezért ugyanaz az ütemezés többször lefuttatható a modell, az eszközök vagy külső API-k újbóli meghívása nélkül. A tartalommentes folyamatban a szekvenciahash-ek szintetikus blokmazonosítókká válnak, miközben megmarad az előtagok közös használatának információja.

Offline módban az AISimulate a Dynamo szimulált ütemezőjén, útválasztóján és KV-gyorsítótárán futtatja a kérésgráfot. Így különböző munkásszámok, kiszolgálási topológiák, útválasztási szabályok és gyorsítótár-kapacitások hasonlíthatók össze GPU-idő felhasználása nélkül. Élő környezetben az AIPerf ugyanezt a gráfot valódi Dynamo-végponton és valódi GPU-kon játssza vissza.

A PyTorch forrása szerint az egységes azonosító a vLLM és az SGLang fölött is támogatja a megosztott KV-gyorsítótár indexelését és a programozott gyorsítótár-mozgatást. A megoldás így az ügynöki alkalmazások fejlesztőinek a teljes munkamenet teljesítményét teszi vizsgálhatóbbá, nem csak az egyes modellkéréseket.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A PyTorch natív eszközként kezeli az IBM Spyre gyorsítót
Fejlesztőknek2026. október 8. 14:45

A PyTorch natív eszközként kezeli az IBM Spyre gyorsítót

Az IBM Spyre adatfolyam-alapú AI-gyorsító natív PyTorch-eszközzé válik a torch-spyre integrációjával. A megoldás a tenzorok eszközön tartását, a párhuzamos adatmozgatást…

Chipek és infrastruktúra
Chipek és infrastruktúra2026. október 5. 15:12

A PyTorch egységesíti a hardveres gyorsítók tesztelését és CI-folyamatait

A PyTorch Accelerator Integration Working Group új eszközökkel egyszerűsíti a különböző AI-gyorsítók integrációját. A 2026 első felében végzett munka középpontjában a…

Fejlesztőknek
Fejlesztőknek2026. október 2. 21:55

A Helion gyorsíthatja a vLLM LLM-inferenciáját NVIDIA GPU-kon

A PyTorch Helion-alapú lineáris backendet integrált a vLLM-be, hogy automatikus hangolással javítsa a nagy nyelvi modellek következtetési teljesítményét. Az NVIDIA…