Így épített az Amazon egy évtized alatt saját chipportfóliót

Az Amazon saját és ügyfelei valós munkaterhelései alapján tervezi egyedi chipjeit, ahelyett hogy elsősorban szabványos tesztekkel optimalizálná azokat. A vállalat a Nitro rendszerrel kezdte, azóta általános célú és mesterségesintelligencia-chipeket is fejleszt.
- A Nitro System a virtualizációs réteget dedikált hardverre helyezi.
- A Graviton fejlesztését valós AWS-munkaterhelések adatai alapozták meg.
- A Trainium fejlesztési irányát a nagy nyelvi modellek igényei is alakították.
- Az Amazon a memória-sávszélességet teljesítmény és költség alapján is optimalizálja.
- DeSantis szerint az AI-számítások többsége idővel következtetésre irányulhat.
Ügyféligényből született a Nitro
Peter DeSantis, az Amazon alapmodellekért és egyedi chipekért felelős vezető alelnöke az AI Infra Summit szeptember 16-i beszélgetésén arról beszélt, hogy az Amazon nem előre elhatározott chipgyártói stratégiával indult. A fejlesztések rendre olyan problémákból nőttek ki, amelyeket az AWS ügyfelei jeleztek.
DeSantis 28 éve dolgozik az Amazonnál, és az EC2 indulása óta, vagyis 20 éve foglalkozik az AWS-szel. A korai EC2-rendszerek a legtöbb munkaterhelést megfelelően futtatták, egyes ügyfelek azonban bare metal teljesítményt kértek. A virtualizált munkaterhelések ugyanis megosztják az olyan erőforrásokat, mint a processzormagok gyorsítótárai és a bemeneti, illetve kimeneti buszok.
Az Amazon erre hardveres szinten keresett megoldást. Így jött létre a Nitro System, amely a virtualizációs réteget dedikált hardverre helyezi át. A fejlesztés összehozta a vállalatot az Annapurna Labsszal is. DeSantis szerint a felhő lehetővé teszi, hogy az ügyfeleknek ne kelljen saját szervert és ellátási láncot kiépíteniük, elég egy példányt elindítaniuk.
A Graviton alapja a valós munkaterhelés
2016 körül, amikor a Moore-törvény éves teljesítménynövekedése lassulni kezdett, az Amazon az általános célú processzorok felé fordult. A vállalat különleges előnnyel rendelkezett: évek adataival az Amazon saját webszolgáltatásainak és adatbázisainak működéséről, valamint az ügyfélalkalmazások hangolása során szerzett tapasztalatokkal.
DeSantis szerint ezek a munkaterhelések és profilok jelentik a megfelelő alapot egy chip és egy rendszer optimalizálásához, nem a mikroszintű teljesítménytesztek. Ebből a megközelítésből született meg a Graviton. Az Amazon vezetője szerint jelenleg az AWS-en futó munkaterhelések túlnyomó többsége gyorsabban és költséghatékonyabban működik rajta.
A fejlesztők külön figyelmet fordítottak az ügyfelek számára fontos feladatokra, köztük az adatbázisokra és a chiptervező szoftverekre. DeSantis szerint az Amazon mérete idővel csökkentette az infrastruktúra költségeit, a megtakarításokat pedig alacsonyabb árak formájában továbbadták az ügyfeleknek.
Az AI-chipek útját a modellek változása alakította
Ugyanez az elv vezette az Amazon mesterségesintelligencia-chipjeinek fejlesztését is. Az első ilyen chip, az Inferentia, a 2018 és 2021 közötti AI-munkaterhelésekhez illett. A nagy nyelvi modellek megjelenése azonban más követelményeket hozott. Az Amazon vezető AI-ügyfelekkel dolgozott együtt, miközben belső kutatásait is bővítette, hogy megértse az új munkaterhelések igényeit és várható irányát.
Ez a tanulási folyamat formálta a Trainium2 és Trainium3 fejlesztését, valamint a Trainium4 felé vezető ütemtervet. Az ügyfelek saját munkaterheléseikhez is több eszközt kaptak. A Trainium hardveres profilozója a gyártási munkaterhelések részletes telemetriai adatait gyűjti azok zavarása nélkül, a Neuron eszközlánc pedig hozzáférést ad a chip teljes utasításkészletéhez.
DeSantis szerint az AI-rendszerek egyszerre több ponton is terhelhetik a hardvert. Egyik munkaterhelés energiaigényes lehet, a másik memória-sávszélességbe, a harmadik pedig a memória kapacitásába ütközhet. Az Amazon ezért a Trainium memóriarendszerébe is jelentős fejlesztéseket fektetett, az összesített memória-sávszélességre és az egy dollárra jutó sávszélességre egyaránt figyelve.
Az eredmény az ügyfelek számára a tokenátbocsátásban jelenik meg, vagyis abban, hogy egy modell milyen mennyiségben és költséggel képes kimenetet előállítani. DeSantis arra számít, hogy a mesterséges intelligenciához kapcsolódó számítások többsége idővel következtetésre, vagyis végfelhasználók kiszolgálására és megerősítéses tanuláshoz használt futtatások előállítására irányul majd.
Az Amazon vezetője szerint a hardvernek ehhez tovább kell alkalmazkodnia, miközben a nagy tanítási feladatokat is támogatnia kell. Nem minden munkaterheléshez készül külön chip, de várakozása szerint több, egyes feladatokra jobban szabott chip jelenik meg.


