Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Ai2 megnyitotta az Olmo-core 3 MoE-képzési rendszerét

2026. október 1. 10:00Forrás: Ai2
Az Ai2 megnyitotta az Olmo-core 3 MoE-képzési rendszerét
Kép: Ai2

Az Ai2 kiadta az Olmo-core 3-at, a nagy kevert szakértői modellek, vagyis MoE-k képzésére fejlesztett nyílt infrastruktúrát. A rendszerrel 1,2 billió paraméteres modellt is teszteltek 512 NVIDIA B300 GPU-n.

A lényeg röviden
  • Az Olmo-core 3 nyílt infrastruktúra nagy MoE-modellek képzéséhez.
  • A 47 milliárd paraméteres modell 52 000 tokent dolgozott fel másodpercenként GPU-nként.
  • Az Ai2 1,2 billió paraméteres modellt tesztelt 512 NVIDIA B300 GPU-n.
  • A rendszer 2,38 billió teljes paraméterig is eljutott egy rövid kapacitástesztben.
  • A következő Olmo-modell MoE-architektúrára épül majd.

Nagyobb modellek, változatlan aktív kapacitás

Az Ai2 október 1-jén mutatta be az Olmo-core 3-at. A keretrendszer új, nyílt MoE-képzési rendszert kapott, amelyet a szervezet úgy tervezett, hogy a képzést billió paraméteres tartományig lehessen skálázni a számítási hatékonyság megőrzése mellett. Az Olmo-core 3 a következő Olmo-generáció egyik alapvető rendszere lesz.

Az MoE-modellek sok szakértői komponensből, vagyis paraméterből állhatnak, miközben egy adott bemenet feldolgozásakor csak ezek egy részét használják. Ez csökkentheti az egy tokenre jutó számítási igényt, a teljes modellt azonban továbbra is el kell helyezni a GPU-k memóriájában, és a bemeneteket a megfelelő szakértőkhöz kell továbbítani. A klaszteren belüli adatmozgatás és összehangolás költségei nagyobb modelleknél jelentősen befolyásolhatják az előnyt.

Az Ai2 egyik mérésében a szakértők száma 8-ról 128-ra nőtt, miközben tokenenként továbbra is csak 4 szakértőt választottak ki. Az aktív paraméterek száma így nagyjából 3,2 milliárd maradt, a teljes kapacitás viszont 4,6 milliárdról 47 milliárd paraméterre emelkedett. A képzési teljesítmény kevesebb mint 5 százalékkal csökkent. Ugyanezt az infrastruktúrát összesen több mint 1 billió paraméterrel is tesztelték.

Új megközelítés az MoE-k képzésében

Az Olmo-core korábbi MoE-megvalósítása teljesen felosztott adatpárhuzamosságra, vagyis FSDP-re épült. Ez minden kisebb képzési adagegységnél összegyűjtötte, majd újra szétosztotta a modell súlyait. Az Olmo-core 3 ezzel szemben elosztott adatpárhuzamosságot, DDP-t használ. A szakértők a GPU-kon maradnak, a rendszer pedig a hozzájuk tartozó adatokat továbbítja, így elkerülhető az ismételt súlygyűjtés.

Az Ai2 előzetes tesztjében egy 47 milliárd paraméteres MoE-modell 8 NVIDIA B300 GPU-n, az új rendszerrel, GPU-nként másodpercenként 52 000 tokent dolgozott fel. A korábbi megvalósítás 19 400 tokenes eredményt ért el, ami az Ai2 számítása szerint nagyjából 2,7-szeres teljesítményt jelent.

Az Olmo-core 3 több párhuzamosítási módszert kombinál. A szakértői párhuzamosság szétosztja a szakértőket a GPU-k között, a csővezetékes párhuzamosság a modell rétegeit osztja fel, az elosztott optimalizáló pedig a képzés állapotát teríti szét a hardveren. A rendszer emellett soronkénti szakértői párhuzamosságot, GPU-n működő útválasztást és csoportos GEMM-műveleteket használ az adatmozgatás és a számítás hatékonyabbá tételére.

Billió paraméteres tesztek és nyílt felhasználás

Az Ai2 NVIDIA B300 GPU-kon több konfigurációt vizsgált. Egy 1,2 billió paraméteres modellben tokenenként 58,36 milliárd paraméter volt aktív, a tesztet pedig 512 GPU-n futtatták. A legmagasabb mért érték 858 TFLOP/s/GPU volt. Ezekben a vizsgálatokban véletlenszerű útválasztást használtak, ezért az eredmények a rendszer teljesítményét mérik, nem egy betanított modell minőségét.

Az Ai2 a DeepEP v2 nevű alternatív kommunikációs megoldással 2,38 billió teljes paraméterig is eljutott. Ez rövid kapacitásteszt volt, nem teljes képzési futtatás, így a rendszer elérhető méretét mutatja, nem a tartós képzési teljesítményt.

A technikai jelentés több, a képzési gyakorlatot érintő megfigyelést is dokumentál. Egy kiegyensúlyozott útválasztást ösztönző mérőszám akkor is javulhatott, amikor a tényleges terhelés kiegyensúlyozatlanabbá vált. Az Ai2 ezt tokenes gerrymanderingnek nevezte. A jelentés szerint az sem gyorsította mindig a futtatást, ha a kommunikációt és a számításokat külön GPU-folyamokon fedésbe hozták, egyes tesztekben ez lassította a teljes végrehajtást.

Az Olmo-core 3 teljesen nyílt rendszerként készül. Kutatók és fejlesztők saját MoE-modelljeik képzésére használhatják, különböző hardverekhez igazíthatják, és kísérletezhetnek az útválasztással, a párhuzamosítással, valamint a rendszer más részeivel. Az Ai2 következő Olmo-modellje MoE-architektúrát használ majd, és a szervezet szerint a keretrendszer ennek a fejlesztésnek lesz az alapja. A részletes tervezési döntéseket, kísérleteket és teszteket a technikai jelentés, illetve az Olmo-core 3 GitHub-oldala ismerteti.

Kapcsolódó hírek

64 GB memóriával jön az NVIDIA DGX Spark új változata
Chipek és infrastruktúra2026. október 2. 15:00

64 GB memóriával jön az NVIDIA DGX Spark új változata

Az NVIDIA 2026. október 2-án bejelentette a DGX Spark 64 GB-os, egyesített memóriával szerelt konfigurációját. A rendszer október 23-án érkezik az Acer, ASUS, Dell…

Az Ai2 megnyitotta az Olmo-core 3 MoE-tréningrendszerét
Fejlesztőknek2026. október 1. 10:00

Az Ai2 megnyitotta az Olmo-core 3 MoE-tréningrendszerét

Az Ai2 bemutatta az Olmo-core 3-at, egy nyílt tréninginfrastruktúrát, amelyet nagy, szakértőkeverékes, vagyis MoE-modellek fejlesztésére terveztek. A rendszerrel a…

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt

A Red Hat az MLPerf Inference v6.1 tesztjeiben magas teljesítményt ért el Kubernetes-alapú GPU-s rendszereken, miközben CPU-only konfigurációkon is erős eredményeket…