Le vrai prix d'un token : bâtir une discipline FinOps pour l'inférence LLM sur GPU cloud
L'inférence est devenue le premier poste de dépense de l'IA en production, et les outils FinOps classiques ne savent ni la mesurer ni l'attribuer. Cet article propose une discipline complète : unités d'œuvre pertinentes, traque des fuites invisibles (tokens de raisonnement, inflation du contexte, retries d'agents), leviers d'optimisation au niveau du serveur d'inférence et de l'infrastructure, modèle d'allocation par fonctionnalité et tableau de bord minimal viable.
Il existe un moment, dans la vie de toute plateforme d’IA, où quelqu’un du contrôle de gestion pose une question simple : « combien nous coûte cette fonctionnalité ? » Et où l’équipe plateforme découvre qu’elle ne sait pas répondre. Elle connaît la facture GPU du mois. Elle ne sait pas la découper par équipe, par fonctionnalité, par utilisateur ni par tâche métier.
Ce décalage n’est plus anecdotique. Le State of FinOps 2026 de la FinOps Foundation identifie trois moteurs de dérive convergents : les tokens de raisonnement facturés mais absents de la réponse, l’inflation du contexte dans les workflows agentiques — où des prompts dépassant 50 000 tokens en entrée deviennent la norme —, et l’impossibilité pratique d’allouer la dépense. Côté budgets, l’inférence capte désormais environ 55 % des dépenses d’infrastructure IA, l’entraînement passant au second plan pour la majorité des entreprises. Une enquête Harness menée auprès de 700 responsables FinOps et ingénierie résume la situation sans détour : la dépense IA a dépassé les systèmes censés la suivre.
La bonne nouvelle, c’est que ce problème est un problème d’ingénierie avant d’être un problème financier.
Pourquoi la facture GPU échappe aux outils FinOps classiques
Le FinOps cloud traditionnel repose sur une hypothèse : la ressource facturée est la ressource consommée, ou du moins il existe un rapport lisible entre les deux. Une instance EC2 tourne, on la paie, on regarde son CPU pour savoir si elle est bien dimensionnée. Cette hypothèse s’effondre sur GPU.
D’abord parce que l’unité facturée est la réservation, pas l’usage.…