Retour aux analyses
insights8 min

Le prix du token baisse, votre facture d'IA monte : pilotez au coût par résultat

Note exécutive TokenShift

Le prix du token baisse, votre facture d'IA monte : pilotez au coût par résultat

Le 13 août 2026, Google a réduit de moitié le prix de Gemini 3.7 Flash et OpenAI a dévoilé Ultrafast, un mode qui exécute GPT-5.6 Sol jusqu'à quatorze fois plus vite. Le token n'a jamais été aussi bon marché ni aussi rapide. Pourtant, dans les entreprises qui passent leurs agents IA en production, les factures continuent de dépasser les budgets. Ce paradoxe a désormais un nom, documenté par la recherche : l'inflation de tokens. Il change la façon dont un COMEX doit budgéter, contractualiser et gouverner ses systèmes d'IA.

L'inflation de tokens : pourquoi le prix catalogue ne prédit pas la facture

Un article de recherche publié sur arXiv en juillet 2026 (Fu et al., « Not All Tokens Are Equal ») formalise ce que les équipes constatent empiriquement : quand un agent échoue à sa première tentative, le système réessaie, recharge le contexte, escalade vers un autre modèle. Chaque cycle consomme des tokens supplémentaires. Les auteurs définissent l'inflation de tokens comme le rapport entre le coût complet du workflow et le coût d'un appel unique. Leurs mesures : jusqu'à 4,25 fois pour un petit modèle sur des tâches de question-réponse en plusieurs étapes, et des outils de routage classiques qui sous-estiment le coût réel de plus de deux fois sur les tâches difficiles.

Autrement dit, un business case construit sur le prix par million de tokens est structurellement optimiste. Ce biais n'est pas anecdotique. Le MIT (projet NANDA, 2025) a montré que 95 % des pilotes d'IA générative ne produisaient aucun impact mesurable sur le compte de résultat, et Gartner prévoyait dès juin 2025 que plus de 40 % des projets d'IA agentique seraient abandonnés d'ici fin 2027, en citant d'abord des coûts qui dérapent et une valeur métier floue. Le coût mal anticipé n'est pas un détail d'ingénierie ; c'est l'une des premières causes de mortalité des projets.

Des grilles tarifaires devenues mouvantes : promotions, paliers de vitesse, doublements

La journée du 13 août 2026 illustre une deuxième réalité : les prix des fournisseurs ne sont plus des constantes. Google a lancé Gemini 3.7 Flash à 0,75 dollar par million de tokens en entrée et 3,75 dollars en sortie, un tarif promotionnel valable jusqu'à fin 2026 ; au 1er janvier 2027, ces prix doublent (VentureBeat, août 2026). OpenAI, de son côté, vend désormais la vitesse comme un produit : Ultrafast atteint 750 tokens par seconde grâce aux puces Cerebras, en préversion réservée à certains clients, sans prix publié ; son mode Fast est déjà facturé au double du tarif Standard (The Decoder, août 2026).

Pour un CFO, la conséquence est directe : un cas d'usage rentable au tarif promotionnel de 2026 peut devenir déficitaire au tarif de 2027, et un besoin de latence mal qualifié peut faire basculer un workflow vers un palier de prix supérieur sans aucun gain métier. Les contrats et les business cases doivent intégrer des clauses de revoyure tarifaire et des scénarios de sensibilité, exactement comme pour l'énergie ou les matières premières.

La méthode en cinq étapes pour piloter au coût par résultat

  1. Définir l'unité de résultat. Par cas d'usage, une seule unité qui parle au métier : la réclamation traitée de bout en bout, le contrat analysé, la réponse client résolue sans reprise humaine. C'est elle qu'on budgète, pas le token.
  2. Instrumenter chaque workflow. Tracer par exécution : tokens consommés, nombre de tentatives, escalades de modèle, contexte rechargé. Cette télémétrie alimente au passage la documentation de traçabilité que l'AI Act exige pour les systèmes à haut risque.
  3. Mesurer le facteur d'inflation. C'est le rapport entre le coût complet observé et le coût nominal d'un appel réussi. En dessous de 1,5, le workflow est sain ; au-delà de 2, vous avez un problème de conception, pas un problème de fournisseur.
  4. Encadrer les escalades. Le papier arXiv apporte un résultat contre-intuitif : transmettre à un modèle plus puissant la chaîne de raisonnement d'un modèle qui a échoué dégrade sa précision jusqu'à 34,8 points. L'escalade efficace repart d'un contexte propre. Selon les auteurs, ce routage discipliné atteint 94,7 % de précision sur un banc d'essai mathématique, contre 91 % pour FrugalGPT, l'approche de référence, avec 31 % de tokens en moins.
  5. Gouverner en COMEX. Une revue mensuelle sur une page : coût par résultat, taux de complétion au premier passage, sensibilité aux tarifs fournisseurs. Le sponsor métier possède le chiffre ; la DSI possède l'instrumentation.

Mini-cas : la réclamation à 0,90 euro qui en coûtait 2,70

Cas type, chiffres arrondis pour l'illustration. Une direction des opérations d'un assureur budgète son agent de traitement des réclamations à 0,90 euro par dossier, sur la base du pilote. Six semaines après la mise en production, le coût constaté atteint 2,70 euros : 30 % des dossiers déclenchent des retentatives, chaque escalade renvoie l'intégralité du dossier au modèle supérieur, et l'orchestrateur relit les pièces jointes à chaque étape. Trois corrections suffisent : routage des dossiers simples vers un modèle léger, escalade repartant d'un contexte propre, plafond de tentatives avec bascule vers un gestionnaire humain. Le coût se stabilise autour de 1,10 euro, et le taux de complétion au premier passage devient l'indicateur de pilotage hebdomadaire. Aucune de ces corrections n'exigeait de changer de fournisseur.

Erreurs à éviter

  • Le business case au prix catalogue. Budgéter sur le prix par million de tokens du jour, sans facteur d'inflation ni scénario de hausse tarifaire. C'est l'erreur qui fabrique les 95 % du MIT.
  • L'escalade sale. Transmettre les chaînes de raisonnement échouées au modèle supérieur : vous payez plus cher pour une précision dégradée.
  • La prime de vitesse par défaut. Payer un palier Ultrafast ou Fast pour des workflows de back-office où la latence n'a aucune valeur métier.
  • Le pilote sous perfusion promotionnelle. Valider un ROI sur un tarif qui double au 1er janvier 2027 sans jamais tester le scénario plein tarif.
  • L'absence de compteur par workflow. Sans télémétrie par exécution, le coût par résultat est inconnaissable et la conversation budgétaire se fait au doigt mouillé.

Les indicateurs que votre COMEX doit voir chaque mois

  • Coût par résultat, en euros, par cas d'usage, comparé au coût du traitement humain équivalent.
  • Facteur d'inflation de tokens par workflow (coût réel divisé par coût nominal).
  • Taux de complétion au premier passage, sans retentative ni reprise humaine.
  • Part des dépenses liée aux retentatives et aux escalades.
  • Sensibilité tarifaire : impact sur la marge du cas d'usage d'un doublement des prix fournisseurs.

Ces cinq chiffres tiennent sur une page. S'ils n'existent pas aujourd'hui dans votre reporting, c'est l'enseignement le plus utile de cet article.

Par où commencer cette semaine

Demandez à vos équipes le coût par résultat de vos trois principaux workflows d'IA en production. Si la réponse arrive en 48 heures, accompagnée d'un facteur d'inflation, votre dispositif est gouverné. Si la réponse est un prix par million de tokens, vous budgétez une matière première alors que vous achetez un résultat. Dans les 30 jours : imposer l'unité de résultat par cas d'usage, instrumenter les workflows existants, et introduire une clause de revoyure tarifaire dans tout nouveau contrat fournisseur.

TokenShift accompagne les directions générales d'entreprises européennes régulées dans le passage de l'IA du pilote à la production gouvernée.

Sources

  • Fu et al., « Not All Tokens Are Equal: Inflation-Aware Routing for Agentic LLM Systems », arXiv, juillet 2026. https://arxiv.org/abs/2608.13571
  • OpenAI, « Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed », août 2026. https://openai.com/index/previewing-ultrafast/
  • The Decoder, « GPT-5.6 Sol goes 14x faster as OpenAI launches Ultrafast mode powered by Cerebras », août 2026. https://the-decoder.com/gpt-5-6-sol-goes-14x-faster-as-openai-launches-ultrafast-mode-powered-by-cerebras/
  • VentureBeat, « Google's Gemini 3.7 Flash targets coding and agents with a 50% introductory price cut », août 2026. https://venturebeat.com/technology/googles-gemini-3-7-flash-targets-coding-and-agents-with-a-50-introductory-price-cut
  • Gartner, « Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027 », juin 2025. https://www.gartner.com/en/newsroom/press-releases/2025-06-25-gartner-predicts-over-40-percent-of-agentic-ai-projects-will-be-canceled-by-end-of-2027
  • MIT NANDA, « The GenAI Divide: State of AI in Business 2025 », couverture Fortune, août 2025. https://finance.yahoo.com/news/mit-report-95-generative-ai-105412686.html

Continuer la lecture

Voir toutes les analyses