Az Ai2 megnyitotta az Olmo-core 3 MoE-képzési rendszerét

Az Ai2 kiadta az Olmo-core 3-at, a nagy kevert szakértői modellek, vagyis MoE-k képzésére fejlesztett nyílt infrastruktúrát. A rendszerrel 1,2 billió paraméteres modellt is teszteltek 512 NVIDIA B300 GPU-n.
- Az Olmo-core 3 nyílt infrastruktúra nagy MoE-modellek képzéséhez.
- A 47 milliárd paraméteres modell 52 000 tokent dolgozott fel másodpercenként GPU-nként.
- Az Ai2 1,2 billió paraméteres modellt tesztelt 512 NVIDIA B300 GPU-n.
- A rendszer 2,38 billió teljes paraméterig is eljutott egy rövid kapacitástesztben.
- A következő Olmo-modell MoE-architektúrára épül majd.
Nagyobb modellek, változatlan aktív kapacitás
Az Ai2 október 1-jén mutatta be az Olmo-core 3-at. A keretrendszer új, nyílt MoE-képzési rendszert kapott, amelyet a szervezet úgy tervezett, hogy a képzést billió paraméteres tartományig lehessen skálázni a számítási hatékonyság megőrzése mellett. Az Olmo-core 3 a következő Olmo-generáció egyik alapvető rendszere lesz.
Az MoE-modellek sok szakértői komponensből, vagyis paraméterből állhatnak, miközben egy adott bemenet feldolgozásakor csak ezek egy részét használják. Ez csökkentheti az egy tokenre jutó számítási igényt, a teljes modellt azonban továbbra is el kell helyezni a GPU-k memóriájában, és a bemeneteket a megfelelő szakértőkhöz kell továbbítani. A klaszteren belüli adatmozgatás és összehangolás költségei nagyobb modelleknél jelentősen befolyásolhatják az előnyt.
Az Ai2 egyik mérésében a szakértők száma 8-ról 128-ra nőtt, miközben tokenenként továbbra is csak 4 szakértőt választottak ki. Az aktív paraméterek száma így nagyjából 3,2 milliárd maradt, a teljes kapacitás viszont 4,6 milliárdról 47 milliárd paraméterre emelkedett. A képzési teljesítmény kevesebb mint 5 százalékkal csökkent. Ugyanezt az infrastruktúrát összesen több mint 1 billió paraméterrel is tesztelték.
Új megközelítés az MoE-k képzésében
Az Olmo-core korábbi MoE-megvalósítása teljesen felosztott adatpárhuzamosságra, vagyis FSDP-re épült. Ez minden kisebb képzési adagegységnél összegyűjtötte, majd újra szétosztotta a modell súlyait. Az Olmo-core 3 ezzel szemben elosztott adatpárhuzamosságot, DDP-t használ. A szakértők a GPU-kon maradnak, a rendszer pedig a hozzájuk tartozó adatokat továbbítja, így elkerülhető az ismételt súlygyűjtés.
Az Ai2 előzetes tesztjében egy 47 milliárd paraméteres MoE-modell 8 NVIDIA B300 GPU-n, az új rendszerrel, GPU-nként másodpercenként 52 000 tokent dolgozott fel. A korábbi megvalósítás 19 400 tokenes eredményt ért el, ami az Ai2 számítása szerint nagyjából 2,7-szeres teljesítményt jelent.
Az Olmo-core 3 több párhuzamosítási módszert kombinál. A szakértői párhuzamosság szétosztja a szakértőket a GPU-k között, a csővezetékes párhuzamosság a modell rétegeit osztja fel, az elosztott optimalizáló pedig a képzés állapotát teríti szét a hardveren. A rendszer emellett soronkénti szakértői párhuzamosságot, GPU-n működő útválasztást és csoportos GEMM-műveleteket használ az adatmozgatás és a számítás hatékonyabbá tételére.
Billió paraméteres tesztek és nyílt felhasználás
Az Ai2 NVIDIA B300 GPU-kon több konfigurációt vizsgált. Egy 1,2 billió paraméteres modellben tokenenként 58,36 milliárd paraméter volt aktív, a tesztet pedig 512 GPU-n futtatták. A legmagasabb mért érték 858 TFLOP/s/GPU volt. Ezekben a vizsgálatokban véletlenszerű útválasztást használtak, ezért az eredmények a rendszer teljesítményét mérik, nem egy betanított modell minőségét.
Az Ai2 a DeepEP v2 nevű alternatív kommunikációs megoldással 2,38 billió teljes paraméterig is eljutott. Ez rövid kapacitásteszt volt, nem teljes képzési futtatás, így a rendszer elérhető méretét mutatja, nem a tartós képzési teljesítményt.
A technikai jelentés több, a képzési gyakorlatot érintő megfigyelést is dokumentál. Egy kiegyensúlyozott útválasztást ösztönző mérőszám akkor is javulhatott, amikor a tényleges terhelés kiegyensúlyozatlanabbá vált. Az Ai2 ezt tokenes gerrymanderingnek nevezte. A jelentés szerint az sem gyorsította mindig a futtatást, ha a kommunikációt és a számításokat külön GPU-folyamokon fedésbe hozták, egyes tesztekben ez lassította a teljes végrehajtást.
Az Olmo-core 3 teljesen nyílt rendszerként készül. Kutatók és fejlesztők saját MoE-modelljeik képzésére használhatják, különböző hardverekhez igazíthatják, és kísérletezhetnek az útválasztással, a párhuzamosítással, valamint a rendszer más részeivel. Az Ai2 következő Olmo-modellje MoE-architektúrát használ majd, és a szervezet szerint a keretrendszer ennek a fejlesztésnek lesz az alapja. A részletes tervezési döntéseket, kísérleteket és teszteket a technikai jelentés, illetve az Olmo-core 3 GitHub-oldala ismerteti.


