En résumé : le coût d'un agent IA se décompose en trois postes : le développement (une fois), l'inférence (à chaque utilisation) et la supervision (en continu). L'inférence se calcule précisément : nombre de requêtes × tokens par requête × prix du modèle. Sur l'exemple détaillé plus bas, le cache de prompt divise la facture d'inférence par environ deux.
Les trois postes de coût
- Le développement. Cadrage du cas d'usage, prototype sur vos vraies données, intégration à votre application et à vos outils, jeux de tests pour mesurer la qualité. C'est souvent le premier poste, et le seul qui ne dépend pas du volume.
- L'inférence. Ce que vous payez au fournisseur du modèle (ou en matériel, pour un modèle local) à chaque fois que l'agent travaille.
- La supervision. Journaux, suivi des coûts, contrôle de la qualité dans le temps, ajustements quand les données ou les usages changent.
Les tarifs de référence
Les modèles sont facturés au million de tokens, en entrée (ce que vous envoyez) et en sortie (ce que le modèle génère). Tarifs publics d'Anthropic au 10 octobre 2026, en dollars, hors remises :
| Modèle | Entrée | Sortie | Lecture du cache |
|---|---|---|---|
| Claude Haiku 4.5 | 1 $ | 5 $ | 0,10 $ |
| Claude Sonnet 5.5 | 2 $ | 10 $ | 0,10 $ |
| Claude Opus 5.5 | 4 $ | 20 $ | 0,20 $ |
Source : page tarifs d'Anthropic. Les autres fournisseurs (OpenAI, Google, Mistral) publient des grilles de même nature : le raisonnement ci-dessous s'applique à l'identique.
Deux remises comptent beaucoup :
- Le cache de prompt : la partie du contexte qui ne change pas d'une requête à l'autre (instructions, documentation, définitions d'outils) est lue depuis le cache à une fraction du prix normal. L'écriture initiale dans le cache coûte un peu plus cher que l'entrée normale (1,25 fois pour un cache de 5 minutes).
- Le traitement par lots (Batch API) : 50 % de remise sur l'entrée et la sortie, pour les tâches qui peuvent attendre quelques heures.
Un exemple chiffré
Prenons un agent qui traite des demandes clients : il lit la demande, consulte quelques outils (base de connaissances, historique), puis rédige une réponse.
Hypothèses : 1 000 demandes par jour, 20 000 tokens en entrée par demande (instructions, outils, contexte et allers-retours compris), 2 000 tokens en sortie, avec Claude Sonnet 5.5.
Sans optimisation :
- entrée : 20 000 tokens × 2 $ / million = 0,04 $ ;
- sortie : 2 000 tokens × 10 $ / million = 0,02 $ ;
- 0,06 $ par demande, soit 60 $ par jour, environ 1 800 $ par mois (30 jours).
Avec le cache de prompt, si 15 000 des 20 000 tokens d'entrée sont communs à toutes les demandes :
- partie en cache : 15 000 × 0,10 $ / million = 0,0015 $ ;
- partie variable : 5 000 × 2 $ / million = 0,01 $ ;
- sortie inchangée : 0,02 $ ;
- environ 0,032 $ par demande, soit environ 32 $ par jour et environ 950 $ par mois, hors coût des écritures dans le cache, faible quand le trafic est régulier.
Le même calcul avec un modèle plus petit sur les étapes simples (trier, extraire, résumer) et le plus grand seulement là où il fait la différence peut encore réduire la facture. Mais attention : un modèle moins cher qui rate une tâche sur cinq et oblige à recommencer n'est pas moins cher.
Les coûts qu'on oublie
- Les boucles d'agent. Un agent qui appelle plusieurs outils renvoie tout l'historique à chaque étape : le contexte grossit à chaque tour. C'est souvent là que la facture dérape.
- Les nouvelles tentatives. Erreurs réseau, limites de débit, réponses hors format : chaque reprise se paie.
- Les tests de qualité. Pour savoir si un changement de modèle ou de prompt améliore les choses, il faut rejouer des jeux de tests, qui consomment eux aussi des tokens.
- La supervision humaine, tant que l'agent n'a pas fait ses preuves sur des cas réels.
Ma méthode pour chiffrer un projet
- Mesurer dès le prototype le nombre réel de tokens par tâche, sur vos données, plutôt que de l'estimer.
- Raisonner en coût par tâche réussie, pas par requête.
- Activer d'abord les optimisations gratuites : cache de prompt et traitement par lots.
- Ensuite seulement, comparer les modèles sur vos propres cas, et envisager un modèle local si la confidentialité ou le volume le justifient.
Le développement se chiffre après cadrage, quand on connaît le périmètre et les données. L'inférence, elle, se chiffre au centime dès le prototype : c'est la meilleure base pour décider.