A Luma AI AMD chipeken futtatja élesben főbb modelljeit

A Luma AI több ezer AMD Instinct MI325X GPU-n futtatja éles környezetben főbb modelljeinek következtetési feladatait. A vállalat szerint a migráció során a videó-, multimodális és nyelvi munkafolyamatok is támogatást kaptak.
- A Luma több ezer AMD Instinct MI325X GPU-n futtat éles következtetést.
- Az infrastruktúra a Ray3.2, az Uni-1 és a Luma Agents munkafolyamatait is kiszolgálja.
- A vállalat szerint kódjának körülbelül 90 százaléka azonnal működött AMD PyTorch-háttéren.
- A Luma nem tapasztalt minőségromlást az AMD hardverén készült videóknál.
- A cég új modelleket és modalitásokat is AMD-re tervez átvinni.
Több ezer GPU szolgálja ki a generálási kéréseket
A Luma AI július 22-én ismertette, hogyan állította át éles következtetési infrastruktúrájának egy részét AMD hardverre a Tensorwave közreműködésével. A vállalat közlése szerint ma már több ezer AMD Instinct MI325X GPU szolgál ki generálási kéréseket a platformján.
A rendszer a szöveges, képi, videós és multimodális munkafolyamatokat kezeli. Ezek között szerepel a Luma zászlóshajó videómodellje, a Ray3.2, az új multimodális következtetési modell, az Uni-1, valamint a modelleket egy platformon összekapcsoló Luma Agents.
A Luma célja egy olyan multimodális általános mesterséges intelligencia fejlesztése, amely képes a fizikai világ generálására, megértésére és működtetésére. Ehhez a cég szerint fejlett modellekre és azokat kiszolgáló infrastruktúrára is szükség van.
A videóátalakítás különösen összetett feladat
A vállalat a migrációt az egyik legnagyobb terhelésű munkafolyamatán, a videóból videó készítésén keresztül mutatta be. A Ray3.2 ezen képessége egy akár iPhone-nal rögzített hétköznapi jelenetet is teljesen más világgá alakíthat át úgy, hogy közben megőrzi az eredeti szerkezetet és mozgást.
A modern videó- és világmodellek több almodellből álló folyamatok. Ezek között variációs autoenkóderek, ControlNetek, LoRA-k és a zajt eltávolító főmodell is lehet, mind eltérő számítási és memóriaigénnyel. A Luma szerint a nagy videómemória lehetővé teszi, hogy az összes almodell a memóriában maradjon.
Így elkerülhető a lassú processzorra történő áthelyezés, illetve a modellek több eszközre való agresszívebb felosztása, amely növelné a kommunikáció mennyiségét. Amikor mégis szükség van adatcserére, az AMD összeköttetései segítik annak hatékony lebonyolítását.
A kód nagy része módosítás nélkül működött
A Luma belső tanítási platformja külön klaszteren fut, ezért az AMD-s következtetéshez egy folyamatosan változó kódbázist kellett átültetni. A cég szerint az AMD PyTorch-háttere a kód körülbelül 90 százalékát azonnal futtathatóvá tette, mivel az általuk használt szabványos PyTorch-műveletek már támogatottak voltak.
A videóból videó feladat vezérlőjeleinek egyedi hálózatai, valamint az alacsonyabb pontosságú, köztük FP8-as tesztváltozatok is könnyen átkerültek. A saját Triton-kódmagok az AMD háttéren keresztül külön átalakítás nélkül futottak, a Luma feladata elsősorban az ellenőrzés volt.
A figyelmi műveletnél a vállalat kézzel módosította az útvonalat, és az AMD AITER könyvtárának megoldására irányította át a hívásokat. Az Uni-1 esetében, amely kulcs-érték gyorsítótárazást és egyedi, szétválasztott kiszolgálási felépítést használ, az AMD FlashInfer támogatását vették igénybe.
A videóátalakítás élesítéséhez két-három mérnök nagyjából két hétig dolgozott. A multimodális modell teljesítménycéljainak eléréséhez három mérnökre és körülbelül négy hétre volt szükség. A Luma szerint a videóminőségben nem történt visszaesés, és emberi értékelők alapján az AMD hardverén készült videók megkülönböztethetetlenek voltak a korábbi eredményektől.
A Luma új modelleket is AMD-re vinne
A vállalat az AMD nyílt forrású szoftveres ökoszisztémáját is kiemelte. A PyTorch-támogatás mellett a HipKittens, a FlyDSL és a Triton AMD-háttere több lehetőséget ad a mérnököknek egyedi kódmagok írására és optimalizálására. A Luma nyelvi modelljeihez használt, saját módosítású vLLM is első osztályú támogatással fut AMD-n.
A Luma közlése szerint tovább mélyíti az együttműködést, és a kutatások előrehaladtával új modelleket, modalitásokat és kiszolgálási módszereket hozna AMD hardverre. Ez a felhasználók számára azt jelentheti, hogy a Ray3.2, az Uni-1 és a Luma Agents mögötti szolgáltatások fejlesztése az AMD-alapú infrastruktúrán is folytatódik.
Luma AI: Luma Runs Production Inference on AMD and Tensorwave | Luma


