A GPU-k kihasználtsága önmagában nem teszi olcsóbbá az AI-inferenciát

A közel 100 százalékos GPU-kihasználtság sem garantálja, hogy hatékonyan működik az AI-inferencia. Az Everpure által ismertetett architektúra a korábban kiszámolt kontextus újrafelhasználásával és a kérelmek megfelelő modellhez irányításával csökkentené a tokenenkénti költséget.
- A magas GPU-kihasználtság önmagában nem mutatja meg az inferencia hatékonyságát.
- Egy 100 000 tokenes prompt feldolgozása 8, illetve 10 másodperc GPU-időt is igényelhet.
- A Pure KVA tesztjeiben a hozzávetőleg 10 másodperces újraszámolás körülbelül 500 milliszekundumra csökkent.
- A megosztott KV-gyorsítótár több csomóponton is újrahasznosíthatóvá teszi a kontextust.
- A dinamikus útválasztás a saját infrastruktúrát és a külső modelleket egyetlen rendszerré kapcsolhatja össze.
A terheltség nem azonos a hatékonysággal
A vállalatok egyre több AI-inferenciát visznek saját, helyben üzemeltetett infrastruktúrára, hogy jobban kontrollálják a tokenek költségét. A Pure Storage Everpure blogján megjelent írás szerint az elmúlt évben ezt az irányt erősítette, hogy a csúcskategóriás modellek kimeneti árai két és hétszeresére emelkedtek, a GPU-k szűkössé váltak, az inferencia iránti kereslet pedig néhány havonta megduplázódott.
A saját infrastruktúra költségeit azonban nehezebb észrevenni, mivel nincs hozzá felhős számla. A problémára gyakran csak a lassú válaszidő vagy a vártnál nagyobb hardverigény hívja fel a figyelmet. A GPU-kihasználtság közben akár 100 százalék közelében is lehet, ez azonban csak azt mutatja, hogy a chipek dolgoznak. A tényleges hatékonyság méréséhez az összes ráfordítást, például a GPU-órákat és az áramot, a létrehozott tokenek számával kell összevetni.
Az Everpure szerint rosszul kialakított inferenciastack mellett egy nyílt súlyú modell tokenenként annyiba kerülhet, mint egy csúcskategóriás API. A magas kihasználtság és az alacsony hatékonyság egyszerre is jelen lehet ugyanazon a fürtön.
A kontextus újraszámolása rejtett költséget okoz
A modellnek a válasz első tokenje előtt a teljes bemeneti kérésen végig kell dolgoznia. Ezt a lépést előfeldolgozásnak, vagyis prefillelésnek nevezik. A forrás szerint a műveletigény a bemenet hosszával négyzetesen növekszik: a prompt megduplázása hozzávetőlegesen négyszeres munkát jelent. Egy 100 000 tokenes prompt egy nagy modellen még jelenlegi hardveren, például NVIDIA DGX B300 vagy NVIDIA Vera Rubin NVL72 rendszeren is 8, illetve 10 másodperc GPU-időt igényelhet az első kimeneti token előtt.
Az ügynökalapú AI-rendszerekben több száz fejlesztői ügynök dolgozhat ugyanazon a kódbázison, azonos rendszerutasításokkal, eszközleírásokkal és megosztott kontextussal. Naiv kialakítás esetén a rendszer minden kérésnél újra felépíti ugyanazt az állapotot. Az írás egy példája szerint 500 mérnök ügynökei 4000, illetve 5000 GPU-másodpercet tölthetnek ugyanazon KV-állapot újraszámolásával.
A körkörös terheléselosztás tovább ronthat a helyzeten, mert ugyanazon munkamenet következő kérése másik, üres gyorsítótárral rendelkező csomópontra kerülhet. Ilyenkor a rendszer ismét a teljes előkészítési költséget fizeti meg, ami csökkenti az egy dollárra jutó tokenmennyiséget.
Megosztott KV-gyorsítótár és rugalmas modellválasztás
Az Everpure által bemutatott megközelítésben a prompt feldolgozásakor létrejövő kulcs-érték, vagyis KV-gyorsítótár nem marad annál az egy GPU-csomópontnál, amely kiszámolta. A cél egy teljes flottán megosztott gyorsítótár létrehozása, amelyből bármelyik csomópont felhasználhatja a korábban elkészített állapotot.
A leírás szerint az NVIDIA Dynamo és a Pure Key-Value Accelerator, röviden KVA, ezt az állapotátadást támogatja. A Pure KVA tesztjeiben egy hozzávetőleg 10 másodperces újraszámolás körülbelül 500 milliszekundumos gyorsítótár-beillesztéssé válhatott. Az architektúra a tétlen munkameneteket is kezeli: a szünetelő ügynökök KV-gyorsítótára megosztott tárhelyre helyezhető, majd újraszámolás nélkül visszaállítható egy szabad kapacitással rendelkező csomóponton. A blogbejegyzés szerint mindez egyetlen átjáró mögött, az ügyfélkód módosítása nélkül történhet.
A rendszer a kérelmeket a feladat nehézsége és az aktuális terhelés alapján is irányíthatja. A legtöbb forgalom a vállalat saját infrastruktúrájára kerülhet, míg az összetettebb feladatokat vagy a kapacitás feletti csúcsokat külső, csúcskategóriás modellhez továbbíthatja. Az írás az NVIDIA NeMo Switchyardot is hasonló, nyílt forráskódú útválasztási rétegként említi, amelyet a LangChain 74 százalékos költségcsökkenéssel tesztelt egy hatékony nyílt modell és egy csúcskategóriás modell közötti irányítással.
Pure Storage: The Architecture Behind More Efficient AI Inference


