KubePilot est un cockpit de dépannage Kubernetes open source construit par le Workstation équipe d’ingénierie. Il combine le diagnostic assisté par l'IA (Copilote), navigation dans les clusters de style SRE (Pilote) et les mesures correctives dépendantes des règles (Pilote automatique) afin que les équipes de plateforme, SRE et DevOps passent des signaux bruyants à une solution sûre, sans jongler avec les onglets kubectl en cours d'incident. Site produit : kubepilot.org. Source: github.com/bwalia/kubepilot.
- Quoi: Cockpit K8 open source — CoPilot (AI RCA) + Pilot (navigateur SRE) + AutoPilot (fixateur fermé).
- OMS: Équipes SRE, DevOps, plateforme/AIOps qui ont besoin d'un MTTR plus rapide avec une automatisation vérifiable.
- Courir: binaire
servesur :8383, carte Helm, Docker (ghcr.io/kubepilot/kubepilot), compagnon iOS. - IA : LLM locaux via Ollama ; Invite de copie ; Serveur MCP sur :9090.
- Sécurité: valeurs par défaut du pilote en lecture seule ; AutoPilot désactivé/fonctionnement à sec/actif ; seuils de confiance ; listes de blocage ; coupe-circuit ; registre des décisions.
1. Regardez la procédure pas à pas
youtu.be/CsiJWpfncqA —Balinder Walia, Workstation.
2. Le problème que KubePilot résout
Les clusters modernes émettent plus de signaux que les humains ne peuvent trier sur une seule page : CrashLoops, ImagePullBackOff, OOMKills, pression des nœuds, sondes floconneuses et dérive YAML. La réponse typique s'étend sur :
kubectlhistorique et scripts shell,- une interface utilisateur de navigateur (Lens / Rancher / tableau de bord),
- se connecte à un troisième outil,
- une discussion LLM avec YAML collé (et pas d'authentification de cluster).
Cette fragmentation brûle des minutes alors que les minutes représentent le SLA. KubePilot réduit la boucle en un seul cockpit : repérer → demander → vérifier → corriger.
3. Mode A — CoPilot (dépannage assisté par IA)
CoPilot est la surface RCA automatisée et en langage naturel :
- Posez des questions opérationnelles dans un anglais simple (« pourquoi le paiement CrashLooping est-il en production ? »).
- Un clic Analyse IA sur les pods et les événements problématiques.
- Analyse des causes profondes avec chaînes de preuves, confiance, risque, commandes suggérées, correctifs YAML et étapes suivantes.
- Détection d'anomalies pour les modèles CrashLoop, MOO, ImagePull et la pression des nœuds.
- Copier l'invite pour réutiliser l'invite de diagnostic exacte avec votre modèle préféré.
- Conçu pour Ollama / modèles locaux afin que le contexte du cluster puisse rester sur votre réseau.
4. Mode B — Pilote (navigateur de dépannage SRE)
Pilot est un atelier en lecture seule de style Lens/Rancher pour la vérification avant mutation :
- Parcourez les déploiements, les StatefulSets, les DaemonSets, les travaux, les services, les entrées, les ConfigMaps, les secrets et les PVC.
- Pod Workbench : présentation, conteneurs, événements, journaux, YAML nettoyé, nombre de redémarrages, temps de disponibilité.
- Jauges de ressources de cluster en direct (CPU, mémoire, disque) – compatibles Longhorn le cas échéant.
- Canevas de topologie de service : Entrée → Service → Charge de travail → Pod avec couleurs d'état et ports.
- Classification IP des nœuds LAN, WAN et tunnel (par exemple WireGuard / flanelle) – pas seulement l'adresse de superposition.
- Tunnels de transfert de port depuis l'interface utilisateur ; Téléchargement de kubeconfig multicluster et changement de contexte sans redémarrage.
5. Mode C — AutoPilot (fixateur AI avec rails de sécurité)
AutoPilot ferme la boucle avec une auto-réparation vérifiable – jamais « YOLO apply » par défaut :
| Contrôle | But |
|---|---|
| Modes : arrêt / marche à sec / actif | Prévisualiser avant d'appliquer ; garder l'automatisation garée en cas de besoin |
| Sols de confiance | Ignorez les RCA à faible confiance au lieu de deviner |
| Listes de blocage d'espaces de noms et listes d'autorisation d'actions | Protéger les espaces de noms kube-system / prod ; limiter les types de mutations |
| Temps de recharge et plafonds horaires | Prévenir les tempêtes de remédiation |
| Couper l'interrupteur | Pause en un clic pour les opérateurs |
| Grand livre de décisions | Exécuté, ignoré, remonté, échoué — piste d'audit |
| Escalade de code CR | Approbation humaine pour les actions risquées |
6. Carte complète des fonctionnalités (de kubepilot.org)
- Runbooks prédéfinis : sept flux de travail de diagnostic avisés ; runbooks YAML personnalisés avec rechargement à chaud fsnotify (les ID utilisateur remplacent les éléments intégrés).
- Historique durable de RCA : SQLite intégré en option (WAL, pas de CGO) avec conservation des rapports et des anomalies lors des redémarrages.
- Alertes et chronologie : avertissements, événements, anomalies, RCA comme chronologie des opérations consultable ; Cartes d'incident Slack en option.
- Puce de santé IA : sachez que Ollama est prêt avant qu’un incident n’en dépende.
- Valeurs par défaut axées sur la sécurité : authentification facultative, navigation en lecture seule, portes de mutation, politiques CORS.
- Protocole de l'agent MCP : serveur MCP intégré pour l'orchestration d'agents multiclusters et l'accès par programmation.
- Compagnon iOS natif : Application SwiftUI – cartes de santé, pods, journaux, RCA, Face ID, widgets, intentions Siri/App.
7. Options d'installation
Prérequis pour les builds sources : Go 1.22+, Node.js 18+, un cluster accessible + kubeconfig ; Ollama recommandé pour l'IA locale.
7.1 Construire à partir des sources
git clone https://github.com/bwalia/kubepilot.git cd kubepilot make dashboard-install make dashboard make build KUBEPILOT_KUBECONFIG="$HOME/.kube/config" ./dist/kubepilot serve --dashboard-port=8383 # Dashboard/API: http://localhost:8383 # MCP server: :9090
7.2 Helm (installation du cluster)
helm repo add kubepilot https://bwalia.github.io/kubepilot helm repo update helm upgrade --install kubepilot kubepilot/kubepilot \ -n kubepilot --create-namespace kubectl port-forward svc/kubepilot -n kubepilot 8080:8080 # Open http://localhost:8080
Également pris en charge : NodePort, Ingress (+ cert-manager TLS), LoadBalancer et remplacements de valeurs – voir le graphique README sur GitHub.
7.3 Docker
docker run --rm -p 8383:8383 -p 9090:9090 \ -v "$HOME/.kube:/root/.kube:ro" \ ghcr.io/kubepilot/kubepilot:latest \ serve --dashboard-port=8383
Compagnon iOS 7.4
cd ios brew install xcodegen ./generate.sh open KubePilot.xcodeproj # Point the app at http://<server-ip>:8383
8. Modèle opérationnel recommandé
- Jour 0 : exécuter Pilot en lecture seule sur un cluster non-prod ; fil Ollama ; confirmer la puce de santé AI.
- Jour 1 : utilisez CoPilot AI Analyze sur les pods défectueux connus ; comparez RCA à vos runbooks ; réglez l'invite de copie sur votre équipe LLM.
- Jour 2 : activer AutoPilot dans essai à sec seulement; examiner le grand livre des décisions pendant une semaine.
- Jour 3+ : promouvoir les espaces de noms sélectionnés comme actifs avec des listes autorisées strictes, des niveaux de confiance et des alertes Slack ; garder le système Kube bloqué.
- Toujours: kill switch répété ; Chemin du code CR pour les mutations à risque ; Outils MCP derrière l'authentification (voir notre briefing sur la sécurité des agents).
9. Liste de contrôle de production
- ☐ Authentification activée pour tout tableau de bord accessible par le réseau.
- ☐ AutoPilot démarre en mode essai ; actif uniquement après la révision du grand livre.
- ☐ La liste de blocage des espaces de noms comprend les espaces de noms système/partagés.
- ☐ Les plafonds horaires et les temps de recharge sont fixés en dessous des seuils de tempête.
- ☐ Ollama (ou chemin LLM approuvé) surveillé via la santé de l'IA.
- ☐ Intégration Slack ou pager pour les anomalies de haute gravité.
- ☐ GitOps possède toujours l'état souhaité — AutoPilot est un correcteur tactique, et non un substitut à Argo CD/Flux.
- ☐ Sorties vedettes et titres : github.com/bwalia/kubepilot.
10. Pourquoi Workstation propose cette open source
Workstation crée des plates-formes d'automatisation pour de véritables équipes opérationnelles. KubePilot est notre pari que L'AIOps ne fonctionne que lorsque le diagnostic et la remédiation partagent une même piste de preuves - et lorsque l'automatisation est contrôlée comme un SRE humain, cela déclencherait un changement. Nous le publions sous open source afin que les équipes de plateforme puissent l'exécuter sur leurs propres réseaux, étendre les runbooks et câbler les agents MCP sans dépendance vis-à-vis d'un fournisseur.
Commencez à kubepilot.org, cloner le dépôt, et regardez la procédure pas à pas sur YouTube. Résumé du compagnon : article de blog.