Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A GPU-k kihasználtsága önmagában nem teszi olcsóbbá az AI-inferenciát

2026. október 8. 15:00Forrás: Pure Storage
A GPU-k kihasználtsága önmagában nem teszi olcsóbbá az AI-inferenciát
Kép: Pure Storage

A közel 100 százalékos GPU-kihasználtság sem garantálja, hogy hatékonyan működik az AI-inferencia. Az Everpure által ismertetett architektúra a korábban kiszámolt kontextus újrafelhasználásával és a kérelmek megfelelő modellhez irányításával csökkentené a tokenenkénti költséget.

A lényeg röviden
  • A magas GPU-kihasználtság önmagában nem mutatja meg az inferencia hatékonyságát.
  • Egy 100 000 tokenes prompt feldolgozása 8, illetve 10 másodperc GPU-időt is igényelhet.
  • A Pure KVA tesztjeiben a hozzávetőleg 10 másodperces újraszámolás körülbelül 500 milliszekundumra csökkent.
  • A megosztott KV-gyorsítótár több csomóponton is újrahasznosíthatóvá teszi a kontextust.
  • A dinamikus útválasztás a saját infrastruktúrát és a külső modelleket egyetlen rendszerré kapcsolhatja össze.

A terheltség nem azonos a hatékonysággal

A vállalatok egyre több AI-inferenciát visznek saját, helyben üzemeltetett infrastruktúrára, hogy jobban kontrollálják a tokenek költségét. A Pure Storage Everpure blogján megjelent írás szerint az elmúlt évben ezt az irányt erősítette, hogy a csúcskategóriás modellek kimeneti árai két és hétszeresére emelkedtek, a GPU-k szűkössé váltak, az inferencia iránti kereslet pedig néhány havonta megduplázódott.

A saját infrastruktúra költségeit azonban nehezebb észrevenni, mivel nincs hozzá felhős számla. A problémára gyakran csak a lassú válaszidő vagy a vártnál nagyobb hardverigény hívja fel a figyelmet. A GPU-kihasználtság közben akár 100 százalék közelében is lehet, ez azonban csak azt mutatja, hogy a chipek dolgoznak. A tényleges hatékonyság méréséhez az összes ráfordítást, például a GPU-órákat és az áramot, a létrehozott tokenek számával kell összevetni.

Az Everpure szerint rosszul kialakított inferenciastack mellett egy nyílt súlyú modell tokenenként annyiba kerülhet, mint egy csúcskategóriás API. A magas kihasználtság és az alacsony hatékonyság egyszerre is jelen lehet ugyanazon a fürtön.

A kontextus újraszámolása rejtett költséget okoz

A modellnek a válasz első tokenje előtt a teljes bemeneti kérésen végig kell dolgoznia. Ezt a lépést előfeldolgozásnak, vagyis prefillelésnek nevezik. A forrás szerint a műveletigény a bemenet hosszával négyzetesen növekszik: a prompt megduplázása hozzávetőlegesen négyszeres munkát jelent. Egy 100 000 tokenes prompt egy nagy modellen még jelenlegi hardveren, például NVIDIA DGX B300 vagy NVIDIA Vera Rubin NVL72 rendszeren is 8, illetve 10 másodperc GPU-időt igényelhet az első kimeneti token előtt.

Az ügynökalapú AI-rendszerekben több száz fejlesztői ügynök dolgozhat ugyanazon a kódbázison, azonos rendszerutasításokkal, eszközleírásokkal és megosztott kontextussal. Naiv kialakítás esetén a rendszer minden kérésnél újra felépíti ugyanazt az állapotot. Az írás egy példája szerint 500 mérnök ügynökei 4000, illetve 5000 GPU-másodpercet tölthetnek ugyanazon KV-állapot újraszámolásával.

A körkörös terheléselosztás tovább ronthat a helyzeten, mert ugyanazon munkamenet következő kérése másik, üres gyorsítótárral rendelkező csomópontra kerülhet. Ilyenkor a rendszer ismét a teljes előkészítési költséget fizeti meg, ami csökkenti az egy dollárra jutó tokenmennyiséget.

Megosztott KV-gyorsítótár és rugalmas modellválasztás

Az Everpure által bemutatott megközelítésben a prompt feldolgozásakor létrejövő kulcs-érték, vagyis KV-gyorsítótár nem marad annál az egy GPU-csomópontnál, amely kiszámolta. A cél egy teljes flottán megosztott gyorsítótár létrehozása, amelyből bármelyik csomópont felhasználhatja a korábban elkészített állapotot.

A leírás szerint az NVIDIA Dynamo és a Pure Key-Value Accelerator, röviden KVA, ezt az állapotátadást támogatja. A Pure KVA tesztjeiben egy hozzávetőleg 10 másodperces újraszámolás körülbelül 500 milliszekundumos gyorsítótár-beillesztéssé válhatott. Az architektúra a tétlen munkameneteket is kezeli: a szünetelő ügynökök KV-gyorsítótára megosztott tárhelyre helyezhető, majd újraszámolás nélkül visszaállítható egy szabad kapacitással rendelkező csomóponton. A blogbejegyzés szerint mindez egyetlen átjáró mögött, az ügyfélkód módosítása nélkül történhet.

A rendszer a kérelmeket a feladat nehézsége és az aktuális terhelés alapján is irányíthatja. A legtöbb forgalom a vállalat saját infrastruktúrájára kerülhet, míg az összetettebb feladatokat vagy a kapacitás feletti csúcsokat külső, csúcskategóriás modellhez továbbíthatja. Az írás az NVIDIA NeMo Switchyardot is hasonló, nyílt forráskódú útválasztási rétegként említi, amelyet a LangChain 74 százalékos költségcsökkenéssel tesztelt egy hatékony nyílt modell és egy csúcskategóriás modell közötti irányítással.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

64 GB-os változattal bővül a GIGABYTE AI TOP ATOM
Chipek és infrastruktúra2026. október 8. 09:26

64 GB-os változattal bővül a GIGABYTE AI TOP ATOM

64 GB-os egyesített memóriájú konfigurációval bővíti AI TOP ATOM termékcsaládját a GIGABYTE. Az NVIDIA DGX Spark platformjára épülő asztali számítógép új változata…

Az NVIDIA digitális ikrekkel tesztelné az AI-gyárak módosításait
Termékek és eszközök2026. október 7. 18:00

Az NVIDIA digitális ikrekkel tesztelné az AI-gyárak módosításait

Az NVIDIA olyan munkafolyamatot mutatott be, amelyben digitális iker és AI-ügynökök ellenőrzik az AI-gyárak támogatott konfigurációit és szoftverintegrációit, még a…

Az Everpure adatközpontú architektúrával készítené fel a vállalatokat az AI-ra
Termékek és eszközök2026. szeptember 30. 09:49

Az Everpure adatközpontú architektúrával készítené fel a vállalatokat az AI-ra

Az Everpure szerint a vállalati AI-projektek egyik fő akadálya, hogy az adatok feletti irányítás továbbra is az alkalmazásoknál marad. A cég új fejlesztései az…