A Modular Qualcomm AI-gyorsítókat integrált a saját platformjába

A Modular platformjába bekerültek a Qualcomm Technologies adatközponti AI-gyorsítói. A vállalat szerint az NVIDIA és AMD GPU-kra írt kód ugyanazzal a szoftveres veremmel célozhatja a Qualcomm szilíciumát is.
- A Modular integrálta a Qualcomm Cloud AI 100 gyorsítót a Modular Platformba.
- Az NVIDIA és AMD GPU-kra írt kód Qualcomm szilíciumon is célozható.
- A Gemma 4 31B négy chipes konfiguráción futott, élő kiszolgálással.
- A Qualcomm Cloud AI 100 Ultra négy, egyenként 32 GB memóriájú eszközből áll.
- Az együttműködés a Dragonfly AI 200, AI 250 és AI 300 gyorsítókra is kiterjed.
Közös szoftverréteg többféle gyorsítóhoz
A Modular augusztus 18-án, a ModCon keynote előadásán jelentette be, hogy integrálta a Qualcomm Technologies adatközponti AI-gyorsítóit a Modular Platformba. Az együttműködés a Qualcomm Cloud AI 100-zal kezdődik, és kiterjed a Qualcomm Dragonfly AI 200, AI 250 és AI 300 gyorsítókra, valamint a későbbi generációkra is.
A bejelentés azután érkezett, hogy a Qualcomm felvásárolta a Modular Inc.-t. A vállalatok közös célja, hogy a fejlesztők és a vállalatok a munkaterhelésükhöz leginkább megfelelő hardvert választhassák anélkül, hogy újra kellene írniuk a szoftveres vermet.
A Modular MAX nevű platformja a fordítótól a futtatókörnyezeten át a modellkiszolgálásig biztosít AI-fejlesztési eszközöket. A Mojo programozási nyelv Python-szintű használhatóságot kínál rendszerszintű vezérléssel, így a fejlesztők a hardver képességeit kihasználó, optimalizált kerneleket írhatnak.
Hetek alatt eljutottak az első modellekig
A Modular és a Qualcomm Technologies mérnökei az elmúlt hónapokban közösen dolgoztak a Qualcomm Cloud AI 100 Ultra MAX- és Mojo-integrációján. A vállalat közlése szerint az első mátrixszorzási kernelek elkészítése után néhány héten belül végponttól végpontig futott a GPT-2 a MAX-en, ugyanazzal a magas szintű modellleírással és gazdakód-útvonalakkal, amelyeket az NVIDIA és AMD GPU-khoz használnak.
A csapat ezt követően a Gemma 4 modellre skálázta a rendszert. A Modular szerint az első Gemma 4 kernelmunkától az élő kiszolgálási végpontig kevesebb mint hat hónap telt el. A Gemma 4 31B négy chipen futott, és a max serve szolgáltatáson keresztül élőben is kiszolgálták.
A cég ezt natív integrációnak nevezi. A Mojo a Qualcomm Hexagon LLVM NPU-háttérre fordul, a hardver képességei pedig közvetlenül megjelennek a Mojo szabványkönyvtárában. A MAX eszközillesztő-csatlakozóján keresztül a Qualcomm Cloud AI 100 ugyanahhoz a gráffordítóhoz, kiszolgálókeretrendszerhez és futtatókörnyezethez kapcsolódik, mint az NVIDIA, AMD és Apple Metal GPU-k.
Eltérő hardver, eltérő optimalizálási modell
A Qualcomm Cloud AI 100 Ultra generatív AI-hoz és nagy nyelvi modellekhez tervezett, teljesítményre és költségre optimalizált következtetési megoldás. A rendszer négy, egyenként 32 GB memóriával rendelkező eszközből áll, amelyek mindegyike 16 NSP-t tartalmaz.
A fejlesztőknek a vektoros és elemenkénti műveleteket végző HVX vektoros motorral, valamint a mátrixszorzást és a figyelmi műveletek számításigényes részét végző HMX egységgel kell dolgozniuk. A gyorsító nem egységes memóriát használ. A számításokhoz a chipen található VTCM és a külső DDR között DMA-val, vagyis közvetlen memória-hozzáféréssel kell mozgatni az adatokat.
A HMX egy speciális, crouton layoutnak nevezett adatelrendezést igényel, amelynek átalakítása költséggel jár. Emiatt bizonyos esetekben hatékonyabb lehet a HVX vektoros motor használata, mint az adatok HMX-hez szükséges átalakítása.
Mit jelent ez a fejlesztőknek?
A Modular szerint a Qualcomm AI 100 integrációja az első ASIC, vagyis alkalmazásspecifikus integrált áramkör, illetve NPU bekapcsolását jelenti a Modular stackbe. A vállalat ezt a MAX és a Mojo hardverfüggetlenségének első bizonyítékaként mutatja be.
A Qualcomm állítása szerint a Dragonfly AI Inference megoldások és a Modular „hordozhatóságra tervezett” szoftveres verme lehetővé teszi a Qualcomm Technologies NPU-alapú gyorsítójának gyors integrációját, és mentesítheti a fejlesztőket a modellek újraírásától. A Modular közlése alapján a cél az, hogy az új hardverek megjelenésekor a fejlesztői élmény változatlan maradjon, miközben a platform további adatközponti gyorsítókat támogat.
Modular: Modular: Modular and Qualcomm: Same code, new silicon


