Retour
Business 10 min de lecture - 18 sept. 26 - Félix Monnier

Faut-il craindre l'explosion du prix des tokens ? Cinq ans de données sur le coût de l'IA générative

Septembre 2026 - tarifs relevés au 3 septembre 2026.
Lorsqu'une entreprise souhaite automatiser des tâches grâce à l'intelligence artificielle (IA) générative, elle crée une dépendance à un fournisseur de grand modèle de langage (LLM), et s'expose à la variation du coût des tokens (unité de facturation de ces modèles) qu'elle ne maîtrise pas. Beaucoup hésitent donc au moment de lancer un projet, de peur que ce prix flambe du fait de fournisseurs qui augmenteraient leurs tarifs une fois les clients captifs, ou de prix d'appel subventionnés qui remonteraient à l'heure de rentabiliser. Les données de cinq ans permettent de tester les deux.

Le constat : à performance égale, le prix est divisé par dix chaque année, jusqu'à un plancher

Comparer les prix dans le temps demande de raisonner à qualité égale. Des batteries de tests standardisées mesurent la qualité d'un modèle: MMLU pour la culture générale, GPQA pour les questions de niveau doctorat, SWE-Bench pour le code, et les classements Elo de LMArena pour la préférence humaine.
Ces mesures restent imparfaites, mais elles suffisent à définir des paliers de qualité et à poser la bonne question, celle du prix du modèle le moins cher qui atteint un palier donné à un instant donné. La réponse est sans ambiguïté, et trois études indépendantes la mesurent avec des méthodes différentes. Les tarifs publics prolongent leurs séries jusqu'en 2026.
Palier de qualitéTrajectoireFacteurPlancher atteintSource
MMLU 42 (2021)60 $ → 0,06 $ / M tokens en 3 ans÷ 1 0000,06 $, nov. 2024a16z, « LLMflation »
MMLU 65 (2022)20 $ → 0,07 $ en 23 mois÷ 2800,07 $, oct. 2024Stanford AI Index 2025
MMLU 86 (2023)37,50 $ → 0,11 $ en 37 mois÷ 3300,11 $, avr. 2026Epoch AI, tarifs publics
Qualité MMLU 42Qualité MMLU 65Qualité MMLU 86
plancher : le matériel et l'électricité0,01 $0,1 $1 $10 $100 $20222023202420252026$ par million de tokens×10Qualité MMLU 420,06 $Qualité MMLU 650,07 $Qualité MMLU 860,11 $GPT-3 davinci · OpenAInov. 2021 · 60 $ / M tokensGPT-3 davinci, après baisse · OpenAIsept. 2022 · 20 $ / M tokensLlama 3.2 3B · Together AInov. 2024 · 0,06 $ / M tokensplusieurs modèles au plancher · hébergeurs open-weightmars 2026 · 0,06 $ / M tokenstext-davinci-003 · OpenAInov. 2022 · 20 $ / M tokensGPT-3.5 Turbo · OpenAImars 2023 · 1,63 $ / M tokensGPT-3.5 Turbo 1106 · OpenAInov. 2023 · 0,75 $ / M tokensGemini 1.5 Flash-8B · Googleoct. 2024 · 0,07 $ / M tokensGPT-4 (8k) · OpenAImars 2023 · 37,5 $ / M tokensGPT-4 Turbo · OpenAInov. 2023 · 15 $ / M tokensGPT-4o · OpenAImai 2024 · 7,5 $ / M tokensGemini 2.0 Flash · Googlefévr. 2025 · 0,18 $ / M tokensGemini 2.5 Flash-Lite · Googlejuil. 2025 · 0,17 $ / M tokensDeepSeek V4 Flash · DeepInfraavr. 2026 · 0,11 $ / M tokens
En échelle logarithmique. Les trois courbes plongent parallèlement pendant trois ans jusqu'à atteindre un palier, où le coût d'un modèle assez petit se ramène à son matériel et à son électricité.
Epoch AI mesure sur six benchmarks un déclin médian d'un facteur cinquante par an. L'ordre de grandeur prudent à retenir est une division par dix chaque année à qualité constante, et aucune exception n'apparaît depuis 2021. Cette pente tient environ trois ans par palier, le temps de passer des dizaines de dollars à quelques centimes par million de tokens, puis elle s'arrête. Le palier GPT-3 vaut six centimes en novembre 2024 et six centimes encore en mars 2026, tandis que le palier GPT-4 met quatorze mois à descendre de dix-huit à onze centimes.
Ce plancher rend la suite lisible pour qui conçoit une application aujourd'hui. Un modèle assez petit finit par coûter le seul prix de son matériel et de son électricité, et la courbe s'immobilise là. Le palier de qualité visé perd donc un facteur cent à mille en trois ans, puis il reste à quelques centimes par million de tokens tant que le coût du calcul tient. Les observateurs qui suivent la série annoncent désormais un rythme de trois à cinq par an jusqu'en 2027 sur les paliers hauts, à mesure que les paliers bas achèvent leur descente.
Un exemple chiffré donne la mesure de ce que cela représente. Un pipeline d'extraction documentaire qui consomme 30 millions de tokens en entrée et 3 millions en sortie chaque mois coûtait environ 1 080 dollars par mois sur le GPT-4 de 2023. Un modèle de qualité équivalente ramène la même facture à un peu plus de 3 dollars par mois en 2026, soit un coût divisé par 330 pour le même service. La remise de cache, qui retire 90 % du prix de l'entrée répétée, et la remise de traitement par lots, qui en retire la moitié, se cumulent encore par-dessus.
0 $300 $600 $900 $1 200 $2023202420252026$ par mois, à périmètre constant1 080 $/mois3 $/moisplancher tenu depuis juil. 2025GPT-4 (8k) · OpenAImars 2023 · 30 $ en entrée, 60 $ en sortieGPT-4 Turbo · OpenAInov. 2023 · 10 $ en entrée, 30 $ en sortieGPT-4o · OpenAImai 2024 · 5 $ en entrée, 15 $ en sortieGPT-4o, après reprix · OpenAIoct. 2024 · 2,5 $ en entrée, 10 $ en sortieGPT-4.1 mini · OpenAIavr. 2025 · 0,4 $ en entrée, 1,6 $ en sortieGemini 2.5 Flash-Lite · Googlejuil. 2025 · 0,1 $ en entrée, 0,4 $ en sortieDeepSeek V4 Flash · DeepInfraavr. 2026 · 0,09 $ en entrée, 0,18 $ en sortie
La même trajectoire apparaît ici en échelle linéaire, où le graphique précédent démontrait un taux et où celui-ci fait sentir une facture. Il applique au même volume mensuel les prix d'entrée et de sortie réels du modèle le moins cher de qualité GPT-4 à chaque date, et il s'aplatit à partir de l'été 2025 parce que la facture a touché son plancher.

Pourquoi personne ne peut inverser cette courbe

Une tendance rassure à partir du moment où l'on comprend pourquoi elle tient, et trois mécanismes verrouillent celle-ci.
  1. Le plancher open source appartient à tout le monde. À chaque palier de qualité, un modèle à poids ouverts, comme Llama, Mistral, DeepSeek ou Qwen, arrive douze à vingt et un mois après le pionnier propriétaire, et ce délai se raccourcit. La concurrence entre des dizaines d'hébergeurs cloud fixe son prix, avec AWS, Azure, GCP ou Groq, dont les tarifs descendent jusqu'au coût du matériel et de l'électricité. Un fournisseur propriétaire qui augmenterait ses prix sortirait du marché. Janvier 2025 l'a illustré brutalement, quand DeepSeek a proposé une qualité comparable au meilleur modèle de raisonnement d'OpenAI pour environ 96 % moins cher. L'écart est devenu structurel, avec un prix mixte médian de cinquante-trois centimes par million de tokens chez les modèles à poids ouverts en 2026, contre trois dollars chez les propriétaires.
  2. Changer de modèle coûte presque rien. Le format d'API d'OpenAI est devenu un standard de fait, exposé à l'identique par la quasi-totalité du marché. Dans une application dont les appels au modèle vivent derrière une couche d'abstraction, la migration revient à changer une configuration et à faire passer au remplaçant un jeu d'évaluation. Cette substituabilité discipline les prix mieux qu'une négociation.
  3. Les prix actuels dégagent déjà une marge. Selon SemiAnalysis, la marge brute d'Anthropic sur son API dépasse 80 %, et ce qui perd de l'argent chez les grands laboratoires reste l'abonnement grand public illimité, à la différence du token facturé à l'usage. Aucune perte cachée n'attend donc d'être comblée par une hausse future. Le marché va même dans l'autre sens, puisque Google a baissé le prix de Gemini Flash de 78 % en août 2024, en réaction directe à un lancement d'OpenAI. OpenAI en a fait autant le 30 juillet 2026, en coupant de 80 % le tarif de GPT-5.6 Luna, ramené d'un dollar à vingt centimes le million de tokens en entrée.
Deux moteurs physiques s'ajoutent à ces mécanismes de marché. L'efficacité algorithmique double la performance par paramètre tous les 3,3 mois environ, et le matériel suit la même pente, avec un GPU H100 passé d'environ huit dollars de l'heure fin 2024 à moins de deux dollars chez les hébergeurs les moins chers en 2026.

Les quatre nuances à connaître

La frontière absolue, elle, renchérit. Le coût du meilleur modèle du moment augmente d'un facteur trois à dix-huit par an, selon l'étude MIT « The Price of Progress », car chaque gain marginal exige plus de calcul. Les tarifs de septembre 2026 le montrent, avec GPT-6 Astra à dix dollars le million de tokens en entrée et cinquante en sortie, quand les tiers Pro montent à trente et cent quatre-vingts dollars. Conserver le niveau de qualité de son application suit une trajectoire descendante, tandis que courir le dernier modèle peut suivre une trajectoire ascendante.
Le nombre de tokens par tâche monte. Les modèles de raisonnement facturent des tokens intermédiaires invisibles, et les architectures agentiques consomment dix à cent fois plus qu'un appel simple. À périmètre constant, le coût par tâche baisse, et il remonte dès que le périmètre s'enrichit.
L'énergie et le matériel ralentissent la pente sans la redresser. La tension sur la mémoire HBM tient jusqu'en 2027, l'électricité coûte plus cher, et les hyperscalers investissent autour de 700 milliards de dollars en 2026. Ces frictions sont réelles, et le plancher tient malgré elles, porté par des modèles toujours plus petits sur du matériel toujours plus efficace.
Le vrai risque est le retrait du catalogue. Les fournisseurs laissent les prix de leurs anciens modèles en place et retirent ces modèles du catalogue, avec des préavis constatés d'environ six mois chez OpenAI et d'au moins soixante jours chez Anthropic. L'exemple est en cours, puisque OpenAI a annoncé le 22 avril 2026 le retrait groupé de GPT-3.5 Turbo, GPT-4, GPT-4 Turbo, o1, o3-mini et o4-mini au 23 octobre 2026. Pour une application figée sur un modèle, cela impose une maintenance à date, et le successeur revient en pratique moins cher à qualité supérieure.

Ce qui en découle pour la conception

Le comportement du coût d'une application dans le temps dépend de son architecture bien plus que du marché. Quatre principes suffisent à la placer sur la frontière de prix, à distance de la grille tarifaire d'un fournisseur unique.
  1. On isole l'appel au modèle derrière une couche d'abstraction, de sorte que tout changement de modèle devienne un changement de configuration.
  2. On entretient un jeu d'évaluation métier, versionné, qui qualifie un modèle remplaçant en quelques jours, pour saisir une baisse de prix comme pour absorber une dépréciation.
  3. On mesure le coût par tâche, à la maille qui distingue la déflation du marché de l'inflation de ses propres usages.
  4. On explicite la politique de migration, car sur la période étudiée, un modèle de qualité équivalente et au moins trois fois moins cher est apparu tous les six à douze mois.
Pour une application conçue selon ces principes, à périmètre constant, le coût d'inférence baisse pendant environ trois ans, puis se pose sur un plancher que le marché tient à quelques centimes par million de tokens, et aucun fournisseur ne peut en décider autrement, puisque le plancher open source et votre capacité à partir lui échappent tous les deux.

Sources : a16z, « Welcome to LLMflation » (2024) · Epoch AI, « LLM inference price trends » (2025) · Stanford HAI, AI Index 2025 · Gundlach et al., « The Price of Progress » (arXiv:2511.23455) · Xiao et al., « Densing Law of LLMs » (Nature Machine Intelligence) · SemiAnalysis (2026) · grilles tarifaires et calendriers de dépréciation des éditeurs. Les prix « mixtes » d'entrée et de sortie sont pondérés trois pour un, selon la convention d'Epoch AI, et ce sont des prix affichés, hors remises, donc des majorants. Les points postérieurs à février 2025 sont reconstruits à partir des tarifs publics, Epoch AI n'ayant pas publié au-delà de cette date.
Cette étude vient de l'équipe Data & IA de Galadrim. Les clients de l'agence paient leur inférence directement auprès des fournisseurs, sans intermédiation sur le run, et la question revient assez souvent pour mériter une réponse par les données. Les principes de conception ci-dessus sont ceux que l'équipe applique sur ses propres projets.

Vous souhaitez être accompagné pour lancer votre projet digital ?

Déposez votre projet dès maintenant