Du coût du token à la valeur d’entreprise : le mauvais réflexe
Les coûts de l’IA baissent. Les usages, eux, explosent. À mesure que les agents IA s’installent dans les processus métiers, les volumes consommés augmentent beaucoup plus vite que les prix ne diminuent. Dans ce contexte, compter les tokens ne suffit plus. La véritable question n’est pas combien l’IA coûte, mais quelle valeur elle produit. Pour les dirigeants, l’enjeu n’est plus de maîtriser une dépense technologique, mais de mesurer le rendement de chaque euro investi. C’est cette nouvelle équation économique que les organisations doivent désormais apprendre à piloter.
Le coût unitaire s’effondre, la facture accélère
Le prix d’un token d’inférence s’effondre et les projections sérieuses anticipent une baisse de plus de 90 pour cent du coût unitaire d’ici 2030. Cette perspective installe d’elle-même une lecture rassurante dans les comités exécutifs, celle d’un sujet qui se résoudrait tout seul pour peu qu’on attende. Les organisations qui opèrent déjà des agents en production constatent l’inverse. Un agent ne consomme pas comme un chatbot puisqu’il raisonne, enchaîne des étapes, mobilise des outils et itère jusqu’au résultat, ce qui représente cinq à trente fois plus de tokens qu’une requête GenAI standard pour une même tâche. Le coût unitaire baisse pendant que le volume explose et l’écart se creuse précisément au moment du scale. La facture n’attendra pas 2030 pour accélérer, elle accélère dès maintenant dans les organisations les plus avancées.
Le premier réflexe est de compter et c’est déjà la première erreur
Je le constate dans chaque organisation qui franchit le seuil de l’industrialisation. La consommation devient visible, un chiffre sort et il choque, des milliards de tokens ou une facture à six chiffres que personne n’avait anticipée. La réaction suit alors une séquence prévisible qui consiste à compter, plafonner puis réduire. Certaines organisations commettent l’erreur inverse avec la même logique de fond lorsqu’elles récompensent la consommation brute comme preuve d’adoption. Dans les deux cas on pilote un compteur qui ne dit rien de ce qui a été produit, rien de la valeur créée et rien du gain dégagé. Compter les tokens revient à juger un investissement à son montant en ignorant son rendement, alors que la seule question qui compte n’est presque jamais posée. Combien de valeur pour chaque euro dépensé ?
Le volume hurle, le coût chuchote, la valeur s’inverse
Un contraste rend la démonstration parlante, en ordres de grandeur observés sur le terrain. Un responsable avant-vente qui prépare des propositions commerciales consomme un minimum d’une quinzaine de millions de tokens par mois quand un développeur en vibe coding intensif en consomme plus de deux cents millions, parfois cinq cents ou davantage, soit treize fois plus au bas de la fourchette. Le dirigeant qui ne regarde que le volume conclut aussitôt que le second coûte treize fois plus cher, alors que l’essentiel des tokens du développeur relève de la relecture de contexte facturée une fraction du prix d’un token produit, quand ceux de l’avant-vente sont du texte généré, plus cher à l’unité. L’écart de facture réel est de trois environ et le compteur a donc menti d’un facteur quatre. La troisième marche renverse tout, parce que l’avant-vente qui consomme treize fois moins peut générer cent fois plus de valeur si sa proposition sécurise un contrat à sept chiffres. Trois lectures produisent trois classements différents et piloter le volume revient à récompenser exactement le mauvais comportement.
Le FinOps devient FinOps IA et le token entre dans le P&L
J’écrivais au printemps, dans ma série sur les plateformes agentiques, que l’économie agentique repose sur un modèle de coûts qui n’existait pas il y a trois ans et que sans lecture économique partagée le sujet reste indéfendable en comité budgétaire. Ce triptyque développe ce pilier. La discipline qui pilotait hier le coût du cloud a d’ailleurs changé d’objet cette année puisqu’elle ne gère plus la valeur du cloud mais la valeur de la technologie, la dépense IA étant passée en deux ans du statut d’exception à celui de périmètre standard. Le token est devenu une unité économique au même titre qu’une licence ou une heure de calcul. La guidance que je donne aux directions est claire. Le CIO construit la lisibilité, une dépense attribuable par équipe et par cas d’usage. Le CFO impose le langage du ratio, la valeur produite pour chaque euro dépensé plutôt que le volume consommé. Le CEO arbitre les usages sur leur rendement démontré et non sur leur visibilité. Les éditeurs eux-mêmes prennent cette direction et font glisser leurs modèles de facturation du token vers le résultat. Piloter au coût par résultat aujourd’hui, c’est parler la langue de vos contrats de demain. La question n’est plus de savoir combien de tokens consomme votre organisation mais de savoir qui, chez vous, sait relier chaque token dépensé à une valeur créée. Ceux qui mesurent le volume pilotent une illusion. Ceux qui mesurent le résultat construisent un avantage.
Le réflexe de compter une fois écarté, reste la vraie question, celle de la discipline qui relie chaque token à un résultat. C’est le sujet du prochain article.