Le Kimi K3 de Moonshot a placé les modèles open-weight dans la même conversation que les API fermées de frontière — pour le coding agentique, pas seulement les démos de chat. Voici le regard Workstation pour le business et les builders. Analyse, liste radar et checklist production dans l’article long.
En bref. Les poids ouverts ne sont plus « presque aussi bons ». Kimi K3 (2,8T MoE, contexte 1M, multimodal natif) est arrivé avec support vLLM / SGLang day-0 et des scores qui placent les modèles ouverts sur des bancs agentiques à côté des systèmes classe Claude/GPT. La vraie décision n’est pas « ouvert ou fermé » — c’est quel modèle pour quel job, sur du hardware et des ops que vous pouvez vraiment faire tourner.
Ce que Kimi K3 a changé
- Échelle : premier modèle ouvert largement discuté dans la classe ~3T paramètres (Moonshot ; poids sur Hugging Face comme
moonshotai/Kimi-K3). - Aptitude agent : des bancs indépendants (ex. rapports SWE-bench / LiveCodeBench style MindStudio circulant en juillet 2026) placent K3 dans la même bande que les meilleurs modèles propriétaires sur coding/agents.
- Vitesse de serving : vLLM a livré des recettes day-0 (kernels KDA, désagrégation P/D, décodage spéculatif DSpark) — self-host est un projet d’ingénierie, pas un papier de recherche.
- Caveat licence : « open weights » ≠ MIT pour tout usage SaaS commercial — lisez la Kimi K3 License avant de productiser.
Signal industrie (même quinzaine)
- MCP 2026-07-28 — le protocole devient largement sans état (pas de handshake de session / session IDs) ; scale horizontale plus facile pour les outils agent. Extensions : MCP Apps, MCP Tasks.
- Open Secure AI Alliance (NVIDIA + 100+ firmes) + lettre « Open Weights and American AI Leadership » — cadrage politique et sécurité des modèles ouverts comme infrastructure défensive.
- Adoption ≠ production : les enquêtes open-source AI style Mozilla montrent encore une forte expérimentation open-model mais un écart tenace vers la production — ops et evals, pas le QI brut, sont le goulot.
À voir : servir des modèles ouverts avec vLLM
Conseils Workstation
- PME : préférer de plus petits MoE ouverts (Laguna S 2.1, Solar Open 2, classe Qwen/DeepSeek) sur workstations AI / petits nœuds GPU ; utiliser des API K3 managées si vous voulez ce QI sans rack.
- Entreprises : self-host classe K3 seulement avec cluster GPU + budget MLOps ; sinon hybride — ouvert pour RAG/agents privés, fermé pour les chemins peak-critical.
- Toujours : harnais d’éval, Review Bot, GitOps, outils MCP avec HITL — voir notre workflow multi-agent.
Radar complet (Kimi, Laguna, Solar, DeepSeek, Qwen, Llama, Nemotron, GLM, KAT-Coder, Mage-Flow, Inflect, et plus), notes MCP et checklist production : article long. Publié par Workstation.