Az AI-rendszerek teljesítményét egyre inkább az architektúra határozza meg

Az AI-rendszerek teljesítményét már nem önmagában a számítási kapacitás határozza meg. Az SK hynix szerint az adatok tárolási helye, mozgatásuk sebessége és feldolgozásuk hatékonysága egyre fontosabb, ahogy az iparág az inferencia és az ügynöki AI felé mozdul.
- Az AI-rendszerek szűk keresztmetszete egyre inkább az adatmozgatás.
- A hosszabb kontextusok növelik a memória-kapacitás és a sávszélesség iránti igényt.
- Az adat DRAM-ból történő kiolvasása 150 és 2000-szer energiaigényesebb lehet egy egyszerű aritmetikai műveletnél.
- Nagy gépi tanulási modelleknél az energia több mint 90 százalékát a memóriaelérés és az adatmozgatás emésztheti fel.
- A memóriaközpontú számítás az adatot közelebb vinné a feldolgozáshoz.
A számítás mellett az adatáramlás is kritikus tényező
Az SK hynix 2026. október 1-jén közzétett, AI-ökoszisztémáról szóló sorozatának harmadik része azt vizsgálja, miért határozza meg az infrastruktúra architektúrája az AI-rendszerek teljesítményét. A vállalat szerint a szoftvernek, az adatközponti infrastruktúrának, a félvezetőknek és a memóriatechnológiáknak együtt kell működniük.
Egy nagy nyelvi modellnek, például a ChatGPT-nek, a Gemini-nek vagy a Claude-nak egyetlen kérdés megválaszolásakor is folyamatosan hozzá kell férnie a modell súlyaihoz, a korábbi kontextushoz és a köztes eredményekhez. A hosszabb válaszok és a több következtetési lépés nagyobb adatmennyiséget igényelnek.
Az előtanítás nagy kezdeti befektetést jelent, az inferencia viszont minden felhasználói lekérdezésnél ismétlődik. A generatív AI-szolgáltatások, a vállalati másodpilóták és az ügynöki AI terjedésével nő a kérések száma, miközben az egyes kérések által fenntartott kontextus is hosszabbá válik.
A processzorközpontú rendszerek ára az adatmozgatás
A mai számítógépek alapvetően processzorközpontúak. Az adatoknak az érzékelőktől, a háttértártól és a memóriától a gyorsítótárakon át el kell jutniuk a számítási eszközökhöz, majd feldolgozás után vissza is mozoghatnak. Az AI-modellek növekvő adatmennyisége és hozzáférési gyakorisága miatt az adat elérése és mozgatása jelentős szűk keresztmetszetté vált.
Minél messzebbre és minél nagyobb mennyiségben kell továbbítani az adatokat, annál nagyobb a késleltetés, az energiafogyasztás és a hardverköltség. A rendszerek ezt többek között gyorsítótár-hierarchiákkal, előzetes adatbetöltéssel, többszálú végrehajtással és sorrenden kívüli végrehajtással próbálják mérsékelni, ezek azonban összetettebbé, energiaigényesebbé és drágábbá teszik az infrastruktúrát.
Az SK hynix által idézett kutatások szerint egy adat egyszeri DRAM-ból történő kiolvasásához 150 és 2000-szer több energia kellhet, mint egy egyszerű aritmetikai művelethez. Nagy gépi tanulási modelleknél a rendszer energiájának több mint 90 százalékát a memóriaelérés és az adatmozgatás emésztheti fel, nem maga a számítás.
A nagy nyelvi modelleknél a probléma minden új token létrehozásakor jelentkezik. A modellek a korábbi kontextust és a köztes adatokat a kulcsérték-gyorsítótáron, vagyis a KV cache-en, valamint a figyelmi műveleteken keresztül kezelik. A hosszabb gondolkodási folyamatok és kontextusok ezért nagyobb memória-kapacitást és sávszélességet igényelnek.
A memóriaközpontú megközelítés csökkentheti a szűk keresztmetszetet
Az SK hynix szerint a verseny ezért túlmutat a gyorsabb GPU-k, NPU-k és TPU-k, valamint a nagyobb klaszterek telepítésén. A hangsúly egyre inkább azon van, hogyan lehet a számítási egységeket, a memóriát, a tárolást, a hálózatokat és az összeköttetéseket integrált rendszerként megtervezni, lehetőleg az adatmozgatás minimalizálásával.
A nagy sávszélességű memória, vagyis a HBM, a GPU, NPU vagy TPU mellett elhelyezve nagy mennyiségű adatot képes nagy sebességgel továbbítani, így mérsékelheti a számítási eszközök adatvárakozását. Teljesítményének kihasználásához azonban a teljes adatútvonalat együtt kell megtervezni, beleértve a tárolást, a hálózatokat és az összeköttetéseket is.
A memóriaközpontú számítás olyan megközelítés, amely az adat elhelyezkedését és mozgatási költségét a rendszertervezés központi szempontjává teszi. Egyes adatok a számítási egység mellett található HBM-ben lehetnek, másokat megosztott memóriakészlet kezelhet, miközben bizonyos műveletek a memóriához közelebb zajlanak.
Az optimális kialakítás az SK hynix szerint több tényezőtől függ, például a modell architektúrájától, a kontextus hosszától, a felhasználói kérések számától és a hálózati konfigurációtól. Ilyen memóriaközpontú rendszereket már akadémiai és iparági környezetben is terveznek és értékelnek. A felhasználók számára ez azt jelentheti, hogy a jövő AI-szolgáltatásainak sebességét és energiahatékonyságát egyre inkább a teljes infrastruktúra összehangolása, nem egyetlen komponens önálló gyorsasága szabja meg.

