Het verhaal
Muse Glimmer is een 30B-model van Meta Superintelligence Labs, geoptimaliseerd voor lokale agent-workflows: function calling, lokale coding en LLM-as-a-judge. De gewichten gaan onder Apache 2.0 naar Hugging Face. Training liep via logit-distillatie van Muse Spark, mid-training op langere agent-data, en post-training met SFT, on-policy distillatie en RL. Het model is beoordeeld onder Meta’s Advanced AI Scaling Framework.
Voor agents combineert het end-to-end taakvoltooiing, tool use, multi-step reasoning, failure recovery, multimodale invoer via een perception encoder, scaffold-compatibiliteit, instelbare reasoning-sterkte en training op meer dan 100 talen. Meta vergelijkt het in zijn klasse met Gemma4-31B en Qwen3.6-27B.
Op consumer-hardware wordt het model naar ongeveer 4-bit gekwantiseerd, tot onder 20 GB, zodat KV-cache, perception encoder en een DFlash-drafter in een 24 of 32 GB-envelope passen. Speculative decoding moet de generatie versnellen zonder kwaliteitsverlies. Meta meet snelheid van het K-Quant-17GB-model plus drafter op MacBook M4-Max, M5-Max en RTX-5090.
Partners als Ollama, LM Studio en Unsloth volgen in de komende dagen, naast llama.cpp, MLX en ExecuTorch. Serveren op schaal kan via vLLM en SGLang; hosted opties via Together AI, Fireworks AI en OpenRouter. Meta werkt met AMD, Arm, Dell, Intel en NVIDIA aan device-optimalisatie.