Un guide pratique pour associer Kubeflow (entraîner / évaluer / enregistrer) à Argo CD (livrer / rollback GitOps). Pour l’architecture complète, les manifests et les anti-patterns, lisez le long article.
InferenceService, définition de pipeline et composant plateforme est reconcilié depuis Git. Entraînez et évaluez dans Kubeflow ; promouvez en mettant à jour un manifest Git ; rollback avec git revert. Gardez les modèles en object storage — Git stocke URIs et config, pas les poids.
Pourquoi les deux outils ?
Kubeflow répond : comment mener entraînement et évaluation reproductibles sur GPUs ? Argo CD répond : comment livrer le modèle résultant en production sans clusters snowflake ? Utiliser seulement Kubeflow finit souvent en kubectl apply pour le serving. Utiliser seulement Argo CD vous laisse sans pipeline ML et système d’expériences de premier plan. Ensemble ils forment une boucle MLOps fermée.
La division du travail
| Préoccupation | Outil | Ce qui vit dans Git |
|---|---|---|
| DAGs de pipeline, TrainJobs, expériences | Kubeflow Pipelines / Trainer | YAML de pipeline / specs de composants |
| Artefacts de modèle et lignage | Model Registry + object storage | URI + métadonnées — pas le fichier de poids |
| Serving, canaries, rollbacks | KServe + Argo CD | InferenceService overlays |
| Install plateforme et upgrades | Applications Argo CD | Helm/Kustomize pour Kubeflow lui-même |
Boucle de bout en bout (à quoi ressemble le bon)
- Le data scientist merge un changement de pipeline → Argo CD synchronise les CRDs pipeline.
- Kubeflow lance l’entraînement sur des nœuds GPU (optionnellement file d’attente via Kueue).
- Les gates d’évaluation passent → URI du modèle enregistrée ; une PR met à jour le prod
InferenceServicestorageUri. - Argo CD détecte OutOfSync et déploie (trafic canary d’abord).
- Drift ou mauvaises métriques →
git revertrestaure l’URI précédente ; Argo CD réconcilie.
Cinq pratiques qui vous épargnent la douleur
- Repos ou dossiers séparés : plateforme (install Kubeflow) vs apps (pipelines + InferenceServices).
- Ne committez jamais les binaires de modèles — référencez
s3:///gs:/// URIs PVC. - Sync waves : MySQL/MinIO (ou équivalents managés) avant les composants KFP.
- Limites de ressources à chaque étape — des jobs d’entraînement sans limites affameront le cluster.
- Promotion = PR, pas un bouton dans un notebook. La piste d’audit est gratuite.
Quand cette pile est excessive
Un seul Mac Studio qui fait tourner Ollama pour un chatbot PME n’a pas besoin de Kubeflow + Argo CD. Adoptez ce pattern quand vous avez plusieurs modèles, de la contention GPU, des besoins de conformité, ou plus d’un environnement (dev/staging/prod) qui doivent rester identiques.
Lire la version longue
Le long article couvre la carte MLOps Kubernetes 2026 (KFP v2, Trainer, KServe, Kueue), les patterns Application Argo CD, les gates de promotion, le serving canary, le FinOps GPU, et une checklist de rollout. Publié par Workstation.