Memóriahiányra készül az AI-ipar, több adatot hozna ki a meglévőből

Az AI-infrastruktúra fejlesztői szerint a memóriahiányt nem lehet pusztán új memória vásárlásával kezelni. Az AI Infra Summit 2026 résztvevői inkább a meglévő kapacitás jobb kihasználására, az adatmozgatás gyorsítására és a memória több szintre osztására koncentráltak.
- A DRAM átlagára 250 százalékkal nőtt 2025 második és 2026 második negyedéve között.
- Az AWS Trainium a memória-sávszélesség dolláronkénti mutatójában vezet az Astera Labs beszámolója szerint.
- Egy kivont szerverben hozzávetőleg 30 ezer dollár értékű, újrahasznosítható DDR4 memória lehet.
- Az Astera Labs tesztje 62 százalékkal gyorsabb első tokenig eltelt időt és 22 százalékkal több tokent mért másodpercenként.
- A piac a memória újrafelhasználásával, többszintű tárolással és gyorsabb adatmozgatással alkalmazkodna.
A memória ára és hiánya került a középpontba
Az Astera Labs szeptember 17-én közzétett beszámolója szerint az AI Infra Summit 2026 egyik meghatározó témája a memória szerepe volt. Dave Patterson, a Google Fellow munkatársa úgy fogalmazott, hogy az iparág a „memóriaközpontú korszakba” lép. Az Astera Labs szerint a piaci árak is ezt támasztják alá: Jim Handy, az Objective Analysis elemzője arról beszélt, hogy a DRAM átlagára 250 százalékkal emelkedett 2025 második negyedéve és 2026 második negyedéve között.
A vállalat szerint a memóriahiány miatt egyes cégek fejlesztései lassulnak, mivel egyszerűen nem jutnak elegendő memóriához. A konferencia fontos üzenete azonban az volt, hogy a résztvevők már nem kizárólag a beszerzés növelésében gondolkodnak. A mérnöki megoldások azt célozzák, hogy ugyanabból a rendelkezésre álló memóriamennyiségből több hasznos kapacitást nyerjenek ki.
A drága memória mellé olcsóbb rétegek kerülhetnek
Peter DeSantis, az Amazon munkatársa Dylan Patellel, a SemiAnalysis képviselőjével beszélgetve arról számolt be, hogy az AWS Trainium chipjei az úgynevezett memória-sávszélesség dolláronkénti mutatójában vezetnek minden más gyorsító előtt. Az Astera Labs beszámolója szerint ehhez az AWS a memória-alrendszerbe is ugyanolyan tudatosan fektetett, mint a számítási kapacitásba.
A Samsung a memória oldaláról közelítette meg ugyanezt a kérdést. A vállalat összeállítható AI-memóriacsomópontokról szóló előadásán többszintű felépítést mutatott be. Ennek középső rétege az úgynevezett HBM over optical, míg egy másik megoldás olyan összeállítható memóriakészletet jelent, amely független az egyes GPU-któl.
Az elképzelés lényege, hogy az adatoknak nem kell minden esetben a rendszer legdrágább memóriájában maradniuk. Ha az infrastruktúra a teljesítmény jelentős romlása nélkül képes az adatokat olcsóbb rétegekbe továbbítani, az a vállalat szerint önmagában is kapacitásnövekedést eredményezhet.
A régi DDR4 és a gyorsabb KV-cache is szerepet kaphat
Thad Omura, az Astera Labs munkatársa a számítási és memória-korlátokat együtt kezelné. Szerinte a kihasználatlan kapacitás, legyen szó leálló GPU-ról vagy elérhetetlenné váló memóriáról, „láthatatlan falat” képez. Az előadás egyik gyakorlati példája a kivont szerverekben található DDR4 memória újrafelhasználása volt. Az Astera Labs számítása szerint egyetlen nyugdíjazott szerverben hozzávetőleg 30 ezer dollár értékű, továbbra is használható memória lehet, amely csak azért marad kihasználatlan, mert régebbi hardvergenerációhoz tartozik.
Rakesh Vitta technikai elemzése azt mutatta be, hogyan okozhat késleltetést a memória elfogyása egy többfordulós, ügynökalapú munkamenetben. Amikor a KV-gyorsítótárnak a CPU memóriájából vissza kell kerülnie a GPU-ra, a GPU a visszaállítás befejezéséig várakozik. Az Astera Labs példájában egy négy GPU-t tartalmazó szerver, tíz párhuzamos, egyenként 128 000 tokenes ügynökalapú munkamenettel, 1,28 millió tokennyi KV-gyorsítótár-kapacitást igényel. Ez több annál, mint amit a GPU saját, nagy sávszélességű memóriája önmagában tárolni képes.
A vállalat szerint erre kínál megoldást a Leo X-Series Smart Memory Controllers és a Scorpio Fabric Switches. A KV-gyorsítótár dedikált, hálózati szöveten elérhető memóriarétegbe kerülhet ahelyett, hogy a CPU memóriáján keresztül mozogna. Az Astera Labs által ismertetett tesztben ez 62 százalékkal gyorsabb első tokenig eltelt időt és 22 százalékkal több, másodpercenként előállított tokent eredményezett.
A felhasználható kapacitás növelése lett a cél
Az Astera Labs szerint az AI Infra Summit 2026 résztvevői nem állították, hogy megoldották volna a memóriahiányt. A bemutatott irányok inkább azt mutatják, hogy a piac több oldalról próbál alkalmazkodni: a felhőszolgáltatók régebbi hardverek memóriáját hasznosíthatják újra, a memóriachipek gyártói több szintű rendszereket terveznek, a vezérlők és kapcsolók pedig az adatok gyorsabb elérését segíthetik.
A konferencia üzenete a felhasználók és az infrastruktúra-üzemeltetők számára az, hogy az AI-rendszerek kapacitását nem kizárólag új memória beszerzésével lehet bővíteni. A memória elhelyezése, elérhetősége és az adatmozgatás sebessége ugyanilyen fontos tényezővé válhat. Az Astera Labs értékelése szerint az iparág Santa Clarában azt mutatta meg, hogy a memóriahiányra architekturális válaszok is adhatók, miközben a kínálat bővülésére továbbra sem lehet saját ütemtervként tekinteni.


