Un guide rapide et pratique des paliers de modèles Claude. Pour l’analyse complète avec plans de routage, patterns de prompting et playbook de budget tokens, lisez le grand article.
claude-haiku-4-5 pour le travail d’intention rapide et cheap, claude-sonnet-5 pour le meilleur équilibre vitesse/qualité, claude-opus-4-8 pour le coding agentique complexe et le travail entreprise, et réservez claude-fable-5 (et le gated claude-mythos-5) pour les jobs vraiment durs, long horizon, qui prennent des heures ou des jours.
Ligne de modèles en un coup d’œil
| Modèle | Idéal pour | Fenêtre de contexte | Sortie max | Tarifs (entrée / sortie) | Comportement de thinking |
|---|---|---|---|---|---|
Claude Fable 5 (claude-fable-5) |
Agents longue durée et problèmes non résolus les plus durs | 1M tokens | 128K tokens | 10 $ / 50 $ par MTok | Adaptive thinking toujours actif |
Claude Opus 4.8 (claude-opus-4-8) |
Coding agentique complexe et travail entreprise | 1M tokens | 128K tokens | 5 $ / 25 $ par MTok | Adaptive thinking toujours actif |
Claude Sonnet 5 (claude-sonnet-5) |
Meilleur équilibre vitesse/qualité | 1M tokens | 128K tokens | 3 $ / 15 $ par MTok | Adaptive thinking toujours actif |
Claude Haiku 4.5 (claude-haiku-4-5-20251001) |
Modèle le plus rapide pour tâches cheap à fort volume | 200K tokens | 64K tokens | 1 $ / 5 $ par MTok | Extended thinking disponible (adaptive off) |
Claude Mythos 5 (claude-mythos-5) est un modèle gated qui partage les mêmes specs et tarifs que Fable 5, mais sans les classifieurs de sécurité de Fable 5. La disponibilité est limitée aux partenaires approuvés via Project Glasswing.
Choisir le bon modèle (règles rapides)
- Haiku 4.5 : routage, classification, extraction, et tout workflow où vous voulez des réponses rapides sans budgets élevés de tokens de sortie.
- Sonnet 5 : coding quotidien et travail documentaire où vous voulez une forte qualité sans le tarif Opus/Fable.
- Opus 4.8 : coding agentique complexe, analyse entreprise et debugging plus dur où un travail plus long et autonome est requis.
- Fable 5 : les problèmes durs, long horizon, qui prennent des heures ou des jours, surtout quand le modèle doit garder l’objectif, déléguer des sous-tâches et rester cohérent.
Effort et thinking : impact sur le coût
Sur l’API, effort est le contrôle principal du compromis entre intelligence, latence et coût sur Fable 5 et Mythos 5. Pour Opus 4.8 et Sonnet 5, vous pouvez aussi fixer effort explicitement quand vous voulez un autre profil coût/latence.
Implication pratique : mettre chaque requête en effort maximum est souvent le moyen le plus rapide de brûler votre budget en tokens de sortie.
Stratégie tokens qui marche sur tous les paliers
Les tokens de sortie Claude sont la partie chère. Une règle simple : plafonner la longueur de sortie, prompt pour TLDR d’abord, et utilisez prompt caching pour que les préfixes stables (instructions système et schémas d’outils) soient réutilisés.
- Utilisez le modèle le moins cher qui peut finir. Un routeur (Haiku -> Sonnet/Opus -> Fable) coupe souvent le coût de façon spectaculaire tout en gardant une haute qualité.
- Fixez des limites de sortie. En production, fixez toujours un max output / plafond de tokens. Les réponses sans borne sont un accident de budget.
- Utilisez les résumés stratégiquement. Au lieu d’envoyer des transcripts complets à chaque tour, gardez une mémoire « lessons » compacte et ne mettez à jour qu’elle.
Un plan de routeur simple
- Classifiez l’intention et la complexité estimée avec
claude-haiku-4-5. - Envoyez le travail « normalement dur » à
claude-sonnet-5(ouclaude-opus-4-8quand vous attendez du coding agentique plus lourd). - Escaladez vers
claude-fable-5seulement quand la tâche est clairement long horizon ou a échoué sur les paliers inférieurs. - Si Fable 5 refuse via les classifieurs de sécurité, repliez-vous sur Opus 4.8 (l’API permet de relancer avec fallbacks si configuré).