Az AI-rendszerek teljesítményét már az adatmozgatás korlátozza

Az AI-rendszerek teljesítményét egyre kevésbé önmagában a számítási kapacitás, inkább az adatok elhelyezése és mozgatása határozza meg. Az SK hynix szerint az infrastruktúrát ezért a memória, a számítás, a tárolás és a hálózat közös tervezésével kell átalakítani.
- Az AI-inferencia során a memória-hozzáférés és az adatmozgatás jelentős teljesítménykorlátozó tényezővé vált.
- Egy DRAM-adatlekérés energiaigénye 150 és 2000 közötti szorzóval haladhatja meg egy egyszerű aritmetikai műveletét.
- Nagy gépi tanulási modelleknél a rendszer energiájának több mint 90 százalékát a memória-hozzáférés és az adatmozgatás adhatja.
- A memória-központú számítástechnika az adatokat a feldolgozáshoz közelebb próbálja tartani.
- A HBM mellett a tárolást, a hálózatokat és az összeköttetéseket is egységes rendszerként kell megtervezni.
A számítás helyett az adatok áramlása került előtérbe
Az SK hynix 2026. október 1-jén közzétett cikke az AI-ökoszisztéma átalakulását vizsgálja, különös tekintettel a memória szerepére. A vállalat szerint az AI-munkaterhelések a modellfejlesztés mellett egyre inkább a következtetésre és az ügynökalapú AI-ra épülnek. Emiatt a rendszer teljesítményét már nem lehet kizárólag a számítási teljesítmény alapján megítélni.
Egy ChatGPT-, Gemini- vagy Claude-szerű nagy nyelvi modell minden kérdés megválaszolásakor nagy mennyiségű modellparamétert, korábbi kontextust és köztes eredményt olvas be. Hosszabb válaszok és több gondolkodási lépés esetén az elolvasandó adatmennyiség is növekszik. A modell előtanítása nagy, egyszeri befektetést igényel, a következtetés viszont minden felhasználói lekérdezésnél megismétlődik.
Az enterprise copilotok, a generatív AI-szolgáltatások és az ügynökalapú rendszerek terjedésével a kérések száma, valamint az egyes kérésekhez fenntartott kontextus hossza is nő. Az SK hynix szerint ezért a verseny a gyorsabb GPU-k, NPU-k és TPU-k, illetve a nagyobb klaszterek telepítésén túl az egész rendszer adatáramlásának hatékonyságára irányul.
A processzorközpontú felépítés ára
A mai számítógépes rendszerek alapvetően processzorközpontúak. Az adatoknak a szenzoroktól, a tárolótól, a memóriától és a gyorsítótáraktól a számítási egységekig, majd vissza kell jutniuk. Ez a felépítés sokáig hatékonyan támogatta az általános célú számításokat, az AI-adatmennyiség és az elérések gyakoriságának növekedésével azonban az adat-hozzáférés és az adatmozgatás jelentős szűk keresztmetszetté vált.
Minél messzebbre kell eljuttatni az adatot, annál nagyobb lehet a késleltetés, az energiafogyasztás és a hardverköltség. A rendszerek ezt többek között gyorsítótárszintekkel, előzetes adatbetöltéssel, többszálú végrehajtással és sorrenden kívüli végrehajtással próbálják mérsékelni. Ezek a megoldások ugyan csökkenthetik a számítási egységek várakozását, de összetettebbé, energiaigényesebbé és drágábbá teszik a rendszert.
A forrásban idézett kutatások alapján egy DRAM-ból történő adatlekérés energiaigénye 150 és 2000 közötti szorzóval lehet nagyobb egy egyszerű aritmetikai műveleténél. Nagy gépi tanulási modelleknél a rendszer energiájának több mint 90 százalékát a memória-hozzáférés és az adatmozgatás emésztheti fel, nem maga a számítás.
A memória köré szervezett infrastruktúra lehet a válasz
A nagy nyelvi modellek esetében a probléma tovább erősödik. Minden új token előállításakor a rendszer a korábbi kontextusra támaszkodik, és a kulcs-érték gyorsítótárban, vagyis a KV cache-ben tárolt köztes eredményeket is kezeli. Hosszabb következtetési folyamatok és nagyobb kontextusok esetén gyorsan nő a memória kapacitás- és sávszélesség-igénye.
Az SK hynix szerint a High Bandwidth Memory, vagyis a HBM azért vált egyre fontosabbá, mert a GPU, NPU vagy TPU mellett nagy mennyiségű adatot képes nagy sebességgel biztosítani. A HBM azonban önmagában nem oldja meg a problémát. A teljes adatútvonalat, így a tárolást, a hálózatokat és az összeköttetéseket is egységes rendszerként kell megtervezni.
A cikkben bemutatott memória-központú számítástechnika a számítási egységekhez történő folyamatos adatküldés helyett az adatokhoz közelebbi feldolgozást helyezi előtérbe. Egyes adatok a GPU, NPU vagy TPU melletti HBM-ben maradhatnak, mások megosztott memóriakészletben kezelhetők, miközben bizonyos műveletek a memóriához közelebb zajlanak.
Az optimális felépítés a modell architektúrájától, a kontextus hosszától, a felhasználói kérések számától és a hálózati konfigurációtól függ. A forrás szerint ilyen memória-központú rendszereket már az akadémiai szférában és az iparban is terveznek és értékelnek. A felhasználók számára ez azt jelentheti, hogy az AI-szolgáltatások fejlesztésében a láthatóan gyorsabb processzorok mellett egyre fontosabbá válik az adatok útjának rövidítése és a memória hatékonyabb használata.

