Muse Glimmer est le modèle de langage causal de Meta de 30 milliards de paramètres avec un encodeur de perception dédié, distillé à partir de Muse Spark et publié pour les charges de travail agentiques autonomes sur le matériel des consommateurs et des postes de travail. Distribué via Ollama sous Apache 2.0, il cible l'utilisation fiable d'outils, les tâches à long terme, la compréhension multimodale et la reprise après panne, sans nécessiter d'inférence cloud. Cette note technique Workstation réécrit et élargit la carte de modèle public destinée aux ingénieurs expédiant des agents locaux.
- Classe: 30B causal LM + encodeur de perception ; distillé à partir de Muse Spark ; vision + outils + réflexion.
- Servir:
ollama run muse-glimmer(~18GB, 128K, texte+image) ; Apple Silicon :muse-glimmer:30b-mlx(~21GB, DFlash). - Ajuster: Agents locaux / isolés toujours actifs sur un GPU ou un Mac Silicon – et non sur un modèle de cluster MoE multi-To.
- Signal de force : dirige la matrice de classe de taille rapportée par Meta sur MCP-Atlas, DeepSearch QA, WildClawBench, SWE-Bench Pro, AA-LCR, Beam128K (raisonnement élevé).
- Opérations : échafaudage via
ollama launch(Claude Code, OpenCode, Hermès, OpenClaw) ; gouverner avec les évaluations, HITL, MCP auth.
Sources primaires : Bibliothèque Ollama — muse-glimmer; Méthodologie de méta-évaluation — Méthodologie Muse Glimmer. Les numéros et les balises changent ; Vérifiez la carte de modèle vivant avant l'achat.
1. Architecture et intention de conception
Muse Glimmer ne se positionne pas comme un MoE de chat général. Le cadrage de Meta est achèvement des tâches agentiques de bout en bout sur le matériel que vous pouvez acheter pour un bureau ou un petit rack de laboratoire :
- Colonne vertébrale causale LM (30B) — nouvelle génération de jetons avec des chaînes de raisonnement en plusieurs étapes soutenues sur de longs flux de travail.
- Encodeur de perception dédié — accepte le texte et les images entrelacés afin que les agents puissent raisonner sur des captures d'écran, des graphiques et des documents dans la même fenêtre contextuelle que les transcriptions des outils.
- Distillation à partir de Muse Spark — transfert de capacités vers une empreinte qui cible le déploiement d'un seul GPU/grand public plutôt que le service uniquement dans un centre de données.
- Comportement de récupération après échec — lorsqu'un appel d'outil échoue ou renvoie une charge utile inattendue, le modèle est entraîné/réglé pour diagnostiquer et réessayer plutôt que d'arrêter l'épisode.
- Effort contrôlable — La force de raisonnement est sélectionnable afin que les opérateurs puissent échanger la latence contre la qualité par itinéraire.
- Couverture de formation multilingue — Méta-états des données de formation dans plus de 100 langues.
Pour les piles Workstation, l'implication du produit est la suivante : traitez Glimmer comme un cerveau d'exécution de l'agent derrière les outils, shells, navigateurs et éditeurs de fichiers MCP – et non comme un remplacement immédiat pour chaque appel API à frontière fermée.
2. Distribution Ollama (tags, empreinte, E/S)
Tel que publié sur la carte de bibliothèque Ollama (vérifiez les tailles en direct) :
| Étiqueter | Env. taille | Contexte | Saisir | Remarques |
|---|---|---|---|---|
muse-glimmer:latest / :30b | ~18GB | 128 Ko | Texte, image | Chemin d'accès GPU unique par défaut |
muse-glimmer:30b-mlx | ~21GB | 128 Ko | Texte, image | Moteur Ollama MLX ; DFlash + image sur Apple Silicon |
# Pull + interactive
ollama run muse-glimmer
# Apple Silicon (MLX)
ollama run muse-glimmer:30b-mlx
# HTTP chat (localhost Ollama)
curl http://localhost:11434/api/chat \
-d '{"model":"muse-glimmer","messages":[{"role":"user","content":"Hello!"}]}'
# Scaffold launchers (from Ollama applications list)
ollama launch claude --model muse-glimmer
ollama launch opencode --model muse-glimmer
ollama launch hermes --model muse-glimmer
ollama launch openclaw --model muse-glimmer
Les clients Python/JS doivent épingler la balise que vous avez validée (muse-glimmer contre :30b-mlx) dans la configuration, pas dans le code en dur latest chez les agents de production.
3. Surface de capacité (lecture technique)
- Achèvement agent de bout en bout — Meta cite des résultats solides sur les tâches de la famille DeepSearch QA, MCP-Atlas, τ3-Bench (bancaire) et SWE-Bench qui mesurent le succès multi-tours de l'échafaudage, et non des anecdotes ponctuelles.
- Utilisation fiable des outils — une large couverture d'appels de fonctions avec une précision de schéma sur des flux de travail étendus (critique pour les flottes d'outils MCP).
- Raisonnement en plusieurs étapes — planifier la cohérence sur de longs horizons ; s'associe à la fenêtre contextuelle 128K pour la transcription + la conservation des documents.
- Récupération après échec — diagnostiquer les résultats inattendus de l'outil et réessayer ; réduit les abandons dus aux « agents fragiles » lors des travaux de nuit.
- Raisonnement multimodal - L'encodeur de perception permet une capture d'écran/un graphique/un document entrelacé avec du texte (mise à la terre de l'interface graphique et bancs d'analyse de documents inclus dans la matrice de Meta).
- Compatibilité d'échafaudage — OpenClaw, Hermes Agent et modèles d'orchestration similaires ; Ollama répertorie les lanceurs Claude Code et OpenCode comme applications de première classe.
4. Matrice de référence (méta-rapportée, raisonnement élevé)
Meta compare Muse Glimmer-30B (raisonnement élevé) à Gemma4-31B et Qwen3.6-27B en mode réflexion. Lecture du titre Workstation : Glimmer en mène plusieurs agentique suites publiques (MCP-Atlas, DeepSearch QA, WildClawBench, Gaia2, SWE-Bench Pro) tout en suivant ou en liant ses pairs sur certaines métriques d'agent de bureau et de GDP-val. Réexécutez toujours ton harnais.
| Catégorie | Référence | Lueur-30B | Gemma4-31B | Qwen3.6-27B |
|---|---|---|---|---|
| Agent général | MCP-Atlas (Public) | 75.5 | 54.2 | 62.5 |
| Contrôle qualité DeepSearch | 74.6 | 61.7 | 71.1 | |
| τ3-Banque | 23.5 | 15.1 | 16.7 | |
| Banc WildClaw | 47.6 | 37.6 | 43.2 | |
| GDPVal-AA v2 | 953 | 811 | 1141 | |
| Gaïa2 | 43.3 | 36.4 | 40.0 | |
| SkillsBench (avec compétences) | 44.3 | 32.4 | 46.6 | |
| Vérifié OSWorld | 65.9 | 58.5 | 75.6 | |
| Codage agent | SWE-Bench Pro | 51.2 | 36.9 | 50.2 |
| SWE-Bench Vérifié | 76.0 | 66.6 | 77.2 | |
| TerminalBench 2.1 | 51.7 | 43.4 | 60.7 | |
| SciCode | 43.6 | 43.4 | 39.8 | |
| Multimodal | Raisonnement CharXiv | 78.8 | 77.7 | 78.4 |
| ScreenSpotPro | 75.4 | 75.9 | 76.1 | |
| OmniDocBench v1.5 | 75.8 | 72.5 | 77.8 | |
| MMMUPro | 74 | 73 | 75 | |
| Raisonnement / LCR | IFBenc | 77.0 | 76.0 | 70.8 |
| AIME 2026 | 94.7 | 89.2 | 94.1 | |
| GPQA Diamant (AA) | 83.5 | 85.7 | 84.2 | |
| Texte HLE (AA) | 22.0 | 23.6 | 23.1 | |
| AA-LCR | 80.0 | 68.3 | 73.3 | |
| Faisceau128K | 65.1 | 58.2 | 63.0 |
Les bancs de sécurité (CI Memories, Siren AgentDojo) montrent des compromis : Glimmer rapporte une grande utilité sous les injections AgentDojo avec ASR intermédiaire ; traitez la sécurité comme un problème de contrôle de déploiement (pare-feu d'invite, listes autorisées d'outils, HITL) - et non comme une propriété de modèle résolue. Consultez le PDF de la méthodologie Meta pour connaître les modèles d’évaluation, le nombre de tentatives et les mises en garde concernant l’exploitation.
5. Méthodologie d'évaluation (ce que signifient les chiffres)
La note méthodologique de Meta est essentielle avant de citer une cellule dans un tableau :
- Sélection par les pairs : modèles ouverts de classe de taille (Gemma4-31B, Qwen3.6-27B) ; les pairs peuvent utiliser des scores autodéclarés ou reproduits en interne ; Analyse artificielle utilisée lorsqu'elle est disponible pour les trois.
- Échantillonnage: Glimmer a été signalé avec une force de raisonnement élevée avec une température = 1,0 / top_p = 0,95 / top_k = 64 ; les pairs utilisent les configurations de réflexion recommandées par le fournisseur (Qwen utilise des températures plus fraîches sur certains bancs d'agents).
- Mise en garde concernant le biais du harnais : Meta note que les modèles tiers peuvent ne pas être adaptés aux invites des outils/systèmes de Meta – les classements absolus peuvent changer sous les échafaudages natifs des pairs.
- MCP-Atlas : utilisation d'outils multi-tours sur plus de 20 serveurs MCP ; Taux de réussite des juges LLM (seuil de 0,75) sur 500 tâches publiques, en moyenne sur 4 exécutions.
- Contrôle qualité DeepSearch : boucle de navigation autonome (rechercher/ouvrir/trouver) sur 900 questions de recherche difficiles ; F1 via extraction de juge.
- Banc WildClaw / Gaia2 : Tâches d'agent Dockerisées à long horizon sous des harnais de style OpenClaw avec injection d'événements et notation mixte déterministe/LLM.
- SWE-Bench : bash + échafaudage d'outils de fichiers ; Moyenne Pro et Vérifié sur plusieurs exécutions – Les comparaisons Pro évitent la variante de tâche raffinée de Qwen.
- Vérifié OSWorld : Contrôle de la machine virtuelle Ubuntu uniquement via l'interface graphique à partir de captures d'écran (pas de shell direct) ; les différences d’espace d’action entre les modèles sont importantes.
- Faisceau128K : Sonde de mémoire non agentique à contexte long à 128 Ko - pertinente si vous conservez des transcriptions volumineuses en contexte sans RAG.
Politique Workstation : publiez la matrice de Meta pour vous orienter, puis lancez la production sur un ensemble d'or interne (vos outils MCP, vos dépôts, votre SLO de latence).
6. Matériel et service à la réalité
- Classe GPU unique : L'empreinte de poids d'environ 18GB implique un 24GB+ grand public/pro moderne. GPU est le plancher NVIDIA pratique une fois que les activations du cache KV et de la vision sont prises en compte ; profil avec votre contexte maximum et vos sessions simultanées.
- Apple Silicon : préférer
:30b-mlx(~ 21GB) pour le chemin MLX de Ollama avec décodage spéculatif DFlash et entrée d'image native — Les configurations Mac Studio / Mac mini Max sont des nœuds PME de première classe. - Pas de classe Kimi-K3 : il ne s'agit pas d'un MoE multi-nœuds. Si vous avez besoin d'agents ouverts comportant des milliards de paramètres, consultez notre guide des poids ouverts; Glimmer possède le côté bureau toujours actif niche.
- Kubernetes : package Ollama ou un side-car compatible OpenAI par nœud ; conservez les extractions de modèles dans votre registre/cache privé ; n'exposez pas Ollama non lié à Internet.
7. Sécurité et gouvernance pour les agents toujours actifs
Les pondérations locales réduisent la sortie de données mais augmentent le rayon d'explosion d'un hôte d'agent compromis. Base de référence minimale Workstation :
- MCP OAuth 2.1 + secrets de courte durée (baux Vault) — voir article sur la sécurité agent.
- Listes autorisées d’outils et politiques de sortie réseau par identité d’agent.
- HITL bloque les actions irréversibles (paiements, déploiements de production, emails de masse).
- Surveillance par injection d'invites sur le contenu renvoyé par l'outil (modèle de menace de type Siren AgentDojo).
- Mode hors ligne / air-gap testé comme un runbook de première classe, pas un espoir.
8. Liste de contrôle de production
- Épingler la balise Ollama (
30bcontre30b-mlx) et enregistrez le résumé/hachage dans GitOps. - Créez une suite dorée de 20 à 50 tâches reflétant vos outils MCP et vos flux de travail de codage ; suivez la latence pass@1 et p95 à chaque niveau d’effort.
- Échafaudage en fil métallique (
ollama launch …ou personnalisé) avec journalisation structurée des appels et des tentatives d'outils. - Définir un routeur hybride : Glimmer local pour les RAG/agents privés ; basculement cloud pour débordement/pic de QI.
- Documentez la marge VRAM/mémoire unifiée à 32K/64K/128K avec la vision activée.
- Légal : examen Apache 2.0 pour votre modèle de distribution (généralement des licences ouvertes simples ou restrictives).
- Ship Review Bot + portes d'évaluation avant d'activer les agents de nuit sans surveillance.
Publié par Workstation. Carte modèle : ollama.com/library/muse-glimmer.