Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A llamafile már a Ternary Bonsai 27B és a Laguna-S-2.1 modellt is futtatja

2026. augusztus 5. 12:01Forrás: Mozilla.ai
A llamafile már a Ternary Bonsai 27B és a Laguna-S-2.1 modellt is futtatja
Kép: Mozilla.ai

Megjelent a llamafile v0.10.5, amely a frissebb llama.cpp révén támogatja a Ternary Bonsai 27B és a Poolside Laguna-S-2.1 modelleket. A kiadás dokumentációs javításokat és egy új csomagolt beszédfelismerő binárist is tartalmaz.

A lényeg röviden
  • Megjelent a llamafile v0.10.5.
  • A kiadás támogatja a Ternary Bonsai 27B és a Laguna-S-2.1 modelleket.
  • A Ternary Bonsai 27B körülbelül 6 GB-os, multimodális modell.
  • A Laguna-S-2.1 118 milliárd paraméteres, 8 milliárd aktív paraméterrel tokenenként.
  • A transcribefile mostantól kiadási binárisként is elérhető.

Két nagy modell személyi számítógépekre

A Mozilla.ai 2026. augusztus 5-i bejelentése szerint a llamafile új verziója két olyan modellt is futtat, amelyeket a korábbi kiadások nem tudtak betölteni. A modellek GGUF-súlyai már korábban is elérhetők voltak, a llamafile-be épített llama.cpp azonban még nem támogatta a szükséges architektúrát és kvantálást.

A Ternary Bonsai 27B a PrismML Qwen3.6-27B modelljének tömörített változata. Súlyai csak a -1, 0 és +1 értékeket használhatják, ezért körülbelül 1,58 bit jut egy súlyra a teljes pontosságú változat 16 bitje helyett. A modell így nagyjából 6 GB helyet foglal, és laptopokon való futtatásra készült. Multimodális is, a képfeldolgozó komponens azonban csak akkor töltődik be, ha a felhasználó képet ad át neki.

A Laguna-S-2.1 a Poolside nyílt súlyú kódolási modellje. A megadott 118 milliárd paraméterből tokenenként 8 milliárd aktív, mivel szakértőkeverék-modellről van szó. A generálás költsége ezért az adott tokennél aktivált 8 milliárd paraméterhez igazodik, így egy kvantált változat fogyasztói eszközök memóriájában is elférhet. A modell ügynöki kódolási feladatokra és hosszú munkamenetekre készült. A kvantált ellenőrzőpontok 256 ezres kontextusablakot használnak, miközben a BF16-súlyok teljes, 1 milliós kontextust támogatnak.

A llama.cpp követése lett a fő feladat

A Mozilla.ai szerint a llamafile csak azokat a modelleket tudja futtatni, amelyeket a beágyazott llama.cpp ismer. Mivel a llama.cpp gyorsan fejlődik, a modellkompatibilitás legfontosabb korlátja az upstream projekt követése. A v0.10.5 fejlesztése során két hét alatt három szinkronizálást végeztek, így a beágyazott llama.cpp három újabb upstream builden haladt át.

A projekt közben javította azt az ügynöki képességet is, amely a szinkronizáláshoz szükséges pull requestek tervezetét készíti. A Mozilla.ai szerint a későbbi szinkronizálásokhoz emiatt kevesebb kézi ellenőrzésre volt szükség az összeolvasztás előtt. A cél, hogy az új modellek a megjelenésük után hamarabb elérhetővé váljanak a llamafile-ben, ne hónapokkal később.

A kiadás egy tesztelt llama.cpp-állapotot rögzít, ezért nem jelent azonnali, ugyanazon órában megjelenő kompatibilitást minden upstream változással. A projekt kevesebb javító commitra és kisebb különbségekre számít a következő kiadásokban. A Mozilla.ai értékelése szerint ez a csomagolási munka fontosabb a most támogatott két modellnél is, mert a llamafile alapvető értéke a futtatás egyszerű csomagolása.

Új kiadási bináris és részletesebb dokumentáció

A v0.10.5 részeként a transcribefile is megjelenik kiadási artefaktumként. Ez a júniusban bemutatott, transcribe.cpp-re épülő, önálló beszédfelismerő végrehajtható fájl. A képesség maga nem új, a felhasználóknak azonban már nem kell saját maguknak lefordítaniuk a binárist a helyi beszédfelismerés használatához.

A dokumentáció mostantól részletesebben foglalkozik az új súgórendszerrel és a parancssori argumentumokkal. Közösségi közreműködések tisztázták a llamafile, a llamafile-thin és a többi kiadási bináris közötti különbségeket, valamint az aktuális GPU-támogatást, ezen belül a Vulkan-hátteret.

A v0.10.5 a kiadási oldalon tölthető le. A Mozilla.ai szerint hibák esetén egy hibajegy vagy egy beszélgetés indítása a leggyorsabb kapcsolatfelvételi mód. A felhasználók számára a változás azt jelenti, hogy a Ternary Bonsai 27B és a Laguna-S-2.1 helyi, interaktív használata kevesebb technikai akadállyal járhat, miközben a támogatás továbbra is a llamafile-be rögzített llama.cpp-verzióhoz kötődik.

Forrás
Mozilla.ai: llamafile v0.10.5

Kapcsolódó hírek

Gyorsabb lehet a képfeldolgozó LFM2.5-VL modell
Kutatás2026. szeptember 24. 16:08

Gyorsabb lehet a képfeldolgozó LFM2.5-VL modell

A Hugging Face bemutatta az LFM2.5-VL-DSpark megoldást, amely a képet és szöveget is kezelő modellek következtetését gyorsíthatja. A közzétett adatok szerint a gyorsulás…

A Hugging Face Transformers már llama.cpp kvantált modelleket is futtat
Fejlesztőknek2026. szeptember 22.

A Hugging Face Transformers már llama.cpp kvantált modelleket is futtat

A Hugging Face szerint a Transformers mostantól llama.cpp kvantált modellek futtatására is képes. A bejelentés részleteket nem közöl a támogatás technikai…

A beállítások többet számítanak, mint a helyi LLM-szerverek neve
Kutatás2026. szeptember 17. 13:32

A beállítások többet számítanak, mint a helyi LLM-szerverek neve

A Mozilla.ai négy népszerű helyi LLM-szervert hasonlított össze Mac Studio M4-en, NVIDIA L40S-en és Steam Decken. A mérések szerint a teljesítményt sok esetben inkább a…