2min Analytics

Meta brengt Muse Glimmer uit als open lokaal agent-model

Meta brengt Muse Glimmer uit als open lokaal agent-model

Muse Glimmer is een model van 30 miljard parameters onder de Apache 2.0-licentie. Het model is gebouwd voor lokale agent-workflows en draait op een pc of Mac met één consumenten-GPU.

Het model richt zich op wat Meta ‘always-on’ lokale agents noemt. Denk aan function calling, lokaal programmeren en LLM-as-a-judge-evaluaties. Alles draait op het apparaat zelf, zonder internetverbinding.

Muse Glimmer is gedistilleerd uit Muse Spark, het model dat Meta Superintelligence Labs in april van dit jaar presenteerde. De training verliep in drie fasen: logit distillation op de output van het grotere model, mid-training met langere context en agentic data en tot slot supervised fine-tuning gecombineerd met reinforcement learning.

Van 55 GB naar onder de 20 GB

Op volledige precisie zou een model van 30 miljard parameters ruim 55 GB geheugen vragen. Geen enkele consumenten-GPU biedt dat. Meta comprimeert de gewichten daarom naar ongeveer 4-bit precisie, waardoor het taalmodel onder de 20 GB blijft. Dat laat ruimte over voor de KV-cache, de perception encoder voor beeldbegrip en de drafter voor speculative decoding, allemaal binnen 24 of 32 GB.

Die drafter is gebaseerd op DFlash en stelt hele blokken tokens tegelijk voor, die het hoofdmodel parallel verifieert. Op een RTX 5090 levert dat volgens Meta 3,1 keer snellere decoding op. Op een MacBook met M5 Max is dat 1,8 keer, op een M4 Max 1,5 keer.

Het model verwerkt afwisselend tekst en beeld via een aparte perception encoder, waardoor agents screenshots, grafieken en documenten kunnen interpreteren. Verder is er training op data uit meer dan honderd talen en ondersteunt Muse Glimmer instelbare reasoning-sterktes. Loopt een tool call mis? Dan is het model getraind om de fout te diagnosticeren en opnieuw te proberen, in plaats van te stoppen.

Beschikbaarheid

Het model staat nu op Hugging Face. Geoptimaliseerde integraties voor llama.cpp, MLX en ExecuTorch volgen de komende dagen. Ook partners als Ollama, LM Studio, Unsloth, Together AI, Fireworks AI en OpenRouter worden ondersteund. Voor schaalbare inference wijst Meta naar vLLM en SGLang.

Daarnaast werkt Meta samen met AMD, Arm, Dell, Intel en Nvidia aan optimalisaties per apparaat. Het model werd beoordeeld onder het Advanced AI Scaling Framework van Meta voordat het als open-weight release werd vrijgegeven.

Tip: Meta komt met Muse Code: AI-agent voor grote codebases