Meta Muse Glimmer: 30B nyílt modell helyi agentikus AI-feladatokra

A Hugging Face augusztus 10-én közölt bejegyzése szerint a Meta visszatért a nyílt forrású ökoszisztémába a Muse Glimmer modellel. Az NVIDIA fejlesztői blogja alapján a Muse Glimmer egy 30B nyílt súlyú dense modell, 120K+ kontextusablakkal, helyi agentikus AI-munkafolyamatokra.
- A Muse Glimmer 30B nyílt súlyú dense modell, 120K+ kontextusablakkal.
- Az NVIDIA szerint egyetlen GPU-n több mint 20K tokén per másodperces teljesítményt ér el.
- A modell helyi, agentikus, multimodális és nyílt forrású felhasználásra készült.
- A fejlesztők SGLang, vLLM, NIM és NeMo AutoModel eszközökkel dolgozhatnak vele.
- A források GeForce RTX 5090, DGX Spark, DGX Station és Jetson platformokat említenek.
Helyben futó, hosszú kontextusú modell
A Muse Glimmer a Hugging Face bejegyzés címe szerint helyi, agentikus, multimodális és nyílt forrású modellként érkezik. Az NVIDIA leírása alapján a modell 30B paraméteres, nyílt súlyú dense architektúrát használ, és 120K+ kontextusablakot kínál.
Az NVIDIA szerint a modell kifejezetten helyi AI-agentikus munkára készült. A dense architektúra minden tokén feldolgozásakor minden paramétert aktivál, ami a cég állítása szerint megbízható utasításkövetést, hosszú kontextuson belüli koherenciát, kiszámítható késleltetést és kevesebb hibamódot ad a több lépésből álló agentikus munkafolyamatoknál.
A blog különbséget tesz a chatre optimalizált LLM-ek és az agentikus feladatok között. Az NVIDIA példái szerint egy ügynök szoftverprojektet állíthat össze, dokumentációt módosíthat, vagy tudásbázist kezelhet, miközben egy munkamenetben több egymás utáni eszközhívást hajt végre.
NVIDIA-platformokra optimalizált futtatás
Az NVIDIA közlése szerint a Muse Glimmer NVIDIA edge, desktop és workstation AI-platformokon futtatható. A vállalat azt állítja, hogy a Tensor Core architektúra egyetlen GPU-n több mint 20K tokén per másodperces teljesítményre gyorsítja a modellt, teljes kontextushosszon, helyben futó agentikus inferenciához.
A bejegyzés szerint a modell belefér egyetlen NVIDIA GPU VRAM-jába, így nincs szükség model shardingra, CPU offloadingra vagy külső végpontokra a felsorolt platformokon. Az NVIDIA a GeForce RTX 5090, DGX Spark, DGX Station és Jetson platformokat említi.
A fejlesztők az NVIDIA szerint SGLang vagy vLLM inferenciareceptekkel telepíthetik a Hugging Face-ről letölthető Muse Glimmer súlyokat. A cég emellett letölthető NIM konténert is kínál produkciós használathoz NVIDIA GPU-val gyorsított platformokon, valamint egy hosztolt végpont kipróbálását is említi a build.nvidia.com oldalon.
Multimodális felépítés és fejlesztői támogatás
A Hugging Face-oldalon szereplő közösségi hozzászólás szerint a Muse Glimmer egyetlen képkódolót használ képekhez és videókhoz. Ugyanez a hozzászólás 2B méretű, ViT-szerű képi kódolót említ, amelyet a Perception Encoder architektúra alapján terveztek, valamint egy 28B szövegdekódert. A leírás szerint így áll össze a 30B paraméteres modell.
A hozzászólás technikai részleteket is közöl: a képkódoló 2 képkocka x 3 csatorna x 14 x 14 alakra bontja a képeket, majd lineáris rétegen viszi át őket projekcióhoz. Ezután interpolált abszolút pozícióbeágyazást ad hozzá egy tanult pozíciós táblából. A képi torony a leírás szerint 50 rétegből és GELU MLP-kből áll, a figyelmi minta pedig három ablakos figyelmi réteg után egy teljes figyelmi réteget használ.
Az NVIDIA fejlesztői oldala a finomhangolási lehetőségeket is kiemeli. A bejegyzés szerint a fejlesztők NeMo AutoModellel végezhetnek full SFT és LoRA finomhangolást, natív Hugging Face checkpoint támogatással.
Mit jelent ez a felhasználóknak és a fejlesztőknek?
A bejelentés fő üzenete, hogy a Muse Glimmer olyan agentikus AI-munkafolyamatokat céloz, amelyek hosszabb ideig futnak, több lépésből állnak, és helyi adatfeldolgozást igényelnek. Az NVIDIA példái alapján ide tartozhat a dokumentáció átdolgozása, a tudásbázis-kezelés vagy szoftverprojektek felépítése.
A helyi futtatás a források alapján azért fontos, mert a modell eszközön belül dolgozhat, külső végpont nélkül. Az NVIDIA ezt valós idejű, teljesen eszközön futó agentikus inferenciaként írja le. A fejlesztők számára a Hugging Face súlyok, az SGLang és vLLM receptek, a NIM konténer, valamint a NeMo AutoModel támogatás adhatnak többféle bevezetési és testreszabási útvonalat.
Hugging Face: Meta is back with Muse Glimmer: local, agentic, multimodal, and open source
NVIDIA Developer: Run Local Agentic AI Workflows with Meta’s Muse Glimmer on NVIDIA


