Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A PyTorch szerint helyben is futtatható a 30 milliárd paraméteres Muse Glimmer

2026. augusztus 10. 15:42Forrás: PyTorch

A Meta bemutatta a Muse Sparkból lepárolt, nyílt súlyú Muse Glimmer modellt, amelyet helyi, ügynökalapú munkafolyamatokra szán. A PyTorch közlése szerint az ExecuTorch már teljes körűen támogatja a modell futtatását NVIDIA GPU-kon és Apple chipes Mac gépeken.

A lényeg röviden
  • A Muse Glimmer 30 milliárd paraméteres, nyílt súlyú modell.
  • Az ExecuTorch NVIDIA GPU-kon és Apple chipes Mac gépeken támogatja a futtatást.
  • A DFlash az M5 Pro mérésében 21,6-ról 33,0 tokenre növelte a sebességet másodpercenként.
  • A modell szöveges és képi bemenetet, valamint 128 ezer tokent meghaladó kontextust kezel.
  • A videóbemenet, a prefixmegosztás és a folyamatos kötegelt feldolgozás még nincs támogatva.

Helyi futtatás NVIDIA és Apple hardveren

A PyTorch augusztus 10-i bejelentése szerint a Muse Glimmer 30 milliárd paraméteres, nyílt súlyú modell, amelyet a Meta Muse Spark modelljéből desztilláltak. A rendszer helyi, ügynökalapú munkafolyamatokhoz készült, és szöveges, valamint képi bemeneteket is kezel.

Az ExecuTorch futtatási környezetéhez előre elkészített PTE-csomagok érhetők el. A PTE a modell PyTorch-gráfjából előre létrehozott, célhardverre optimalizált, szerializált állomány. A PyTorch ellenőrzött PTE-ket tett közzé a Hugging Face-en NVIDIA CUDA és Apple Silicon Metal platformhoz, szöveges, illetve szöveges és képi bemenetekhez, DFlash gyorsítással és anélkül.

A fejlesztők saját PTE-t is készíthetnek a Muse Glimmerhez mellékelt ExecuTorch útmutató alapján. Kiválaszthatják a hardveres hátteret, a bemeneti módot, a kontextus hosszát, valamint azt, hogy használják-e a DFlash spekulatív dekódolást.

Egy PyTorch-modellből célhardverre optimalizált futtatás

A PyTorch szerint a helyi AI-keretrendszerek gyakran más programozási nyelveken valósítják újra a modelleket. Ez a megközelítés a hagyományos, szöveges transzformermodelleknél jól skálázódott, a multimodális bemenetek és kimenetek, az új architektúrák, valamint az összetett dekódolási eljárások megjelenésével azonban nehezebben kezelhető.

Az ExecuTorchban a fejlesztők PyTorchban írhatják meg a modellt és a dekódolási stratégiát, majd exportálhatják azt a futtatási környezetbe. A keretrendszer ezután a célplatformhoz igazítja a végrehajtást. CUDA alatt Triton, Apple chipeken pedig MLX-alapú és egyedi Metal-megoldások használhatók. Az előzetes fordítás a PyTorch szerint a teljes végrehajtási útvonalat optimalizálja.

A Muse Glimmer támogatása közvetlen GGUF-exportot, natív K-quant végrehajtást, legalább 128 ezer tokent kezelő kontextust és DFlash-alapú spekulatív dekódolást is tartalmaz. A modell GGUF-állományából közvetlenül készülhet ExecuTorch-export. CUDA alatt a rendszer a felismert GPU-architektúrához fordítja és hangolja a Triton-kódot.

Képfeldolgozás és kódolóügynök helyben

A PyTorch által közölt mérésben egy 64 GiB memóriájú M5 Pro gépen a Muse Glimmer kép és szöveg együttes használatakor, önálló futtatásban 21,6 tokent dolgozott fel másodpercenként. A DFlash-t használó beállítás 33,0 tokenre növelte ezt az értéket, ami 52,8 százalékos javulás volt a közlés szerint, minőségromlás nélkül.

Az ExecuTorch a Pi Coding Agent kódolóügynökkel is használható. A bemutatóban a Muse Glimmer egy madártematikájú játék létrehozásán dolgozott, részleteket finomított, fájlokat készített, szükséges csomagokat telepített, teszteket írt és futtatott, majd a további lépésekről kérdezte a felhasználót.

A futtatási környezet több, egymástól elkülönített beszélgetést is kiszolgálhat egyetlen modellbetöltéssel. A támogatás része a Harmony csevegéssablon és a gondolkodási útvonal kezelése, valamint a modell XML-alapú eszközhívásainak elemzése, beleértve az egy válaszon belüli több hívást is.

A hosszú kontextus és a következő fejlesztések

A Muse Glimmer 128 ezer tokent meghaladó kontextust támogat. A modell 52 rétegéből 13 globális, a fennmaradó 39 pedig csúszóablakos működést használ. A PyTorch szerint az ExecuTorch ezt a felépítést hatékonyan kezeli, így a hosszú kontextusú helyi használat is megvalósítható.

A CUDA-háttér CUDA-gráfba rögzíti a dekódolást, a K-quant kernelek pedig az alacsony kötegméretű dekódolást gyorsítják. Apple chipeken az RMSNorm, a RoPE, az SDPA, a KV-gyorsítótár frissítése és a kvantált lineáris műveletek MLX-alapú vagy egyedi Metal-megoldásokra támaszkodnak.

Az első kiadás jelenleg szöveges és képi bemenetet támogat, a videóbemenet még nem érhető el. A PyTorch közlése szerint nincs még munkamenetek közötti prefixmegosztás, ellenőrzőpont-kezelés vagy folyamatos kötegelt feldolgozás. Ezeken a fejlesztők tovább dolgoznak, hogy az ExecuTorch alkalmasabb legyen az ügynökalapú munkafolyamatokra.

Kapcsolódó hírek

Kutatás
Kutatás2026. október 2. 00:26

A PyTorch szerint a TLX gyorsabb lett a Blackwell Jagged Flash Attentionjénél

A PyTorch csapata olyan Jagged Flash Attention kernelt mutatott be NVIDIA Blackwell B200 GPU-kra, amely a vállalat mérései szerint a GEM munkaterhelésén gyorsabb volt a…

Kutatás
Kutatás2026. október 2. 00:26

A PyTorch TLX-kernellel gyorsította a Meta hirdetési modelljének figyelmét

A PyTorch olyan Jagged Flash Attention-kernelt mutatott be, amely az NVIDIA Blackwell B200 gyorsítón a Meta Generative Ads Model modelljéhez fontos alakzatokon…

Meta Muse Glimmer: 30B nyílt modell helyi agentikus AI-feladatokra
Modellek2026. augusztus 10.

Meta Muse Glimmer: 30B nyílt modell helyi agentikus AI-feladatokra

A Hugging Face augusztus 10-én közölt bejegyzése szerint a Meta visszatért a nyílt forrású ökoszisztémába a Muse Glimmer modellel. Az NVIDIA fejlesztői blogja alapján a…