L’industrie de l’IA a passé la première moitié de 2026 à débattre du modèle le plus intelligent. Ses plus grands clients posent une question plus ciblée, celle qui apparaît sur leurs factures : combien coûte une unité de cette intelligence ?
OpenAI y a répondu en partie jeudi, en réduisant le prix de GPT-5.6 Luna, le modèle le plus rapide et le moins cher de sa plus récente famille, d’environ 80%. Luna coûte désormais 0,20 $ par million de tokens en entrée et 1,20 $ par million de tokens en sortie. Le modèle intermédiaire, GPT-5.6 Terra, baisse de 20%, à 2 $ et 12 $. Le vaisseau amiral, GPT-5.6 Sol, reste inchangé à 5 $ et 30 $. Ces baisses interviennent trois semaines après que la famille est devenue généralement disponible le 9 juillet.
La rapidité est ce qui rend cela inhabituel. Ina Fried, qui a rapporté ces réductions pour Axios, a souligné que des rabais comme ceux-ci arrivent normalement des mois après le lancement d’un modèle, et non quelques semaines après.
Les tokens sont l’unité de facturation des modèles d’IA, chacun représentant environ les trois quarts d’un mot. Les tokens en entrée sont ce que vous envoyez ; les tokens en sortie sont ce que le modèle renvoie. Une seule tâche de codage automatisée peut faire passer des millions de tokens par une interface en un après-midi. C’est la pression derrière les annonces tarifaires de ces derniers mois, alors que OpenAI et Anthropic ont tous deux remanié leurs tarifs, limites de débit et politiques d’usage tandis que les nouveaux modèles de raisonnement consomment bien plus de tokens sur des tâches de longue durée que leurs prédécesseurs.
OpenAI affirme que son propre modèle a contribué à réduire le coût de son exploitation
Mercredi, la veille du changement de prix, OpenAI a publié un billet d’ingénierie expliquant d’où venaient les économies. Jusqu’à présent, le coût de service d’un grand modèle diminuait principalement grâce à deux leviers : un meilleur matériel et des ingénieurs humains ajustant manuellement le logiciel qui l’exécute. OpenAI affirme qu’un troisième levier s’est ouvert.
L’entreprise écrit que, au sein de son outil de codage Codex, « GPT-5.6 Sol a réécrit et optimisé de manière autonome nos kernels de production. » Les kernels sont le code de bas niveau qui exécute les opérations mathématiques d’un modèle sur une puce graphique. OpenAI affirme que ce travail, combiné à des changements connexes, a réduit les coûts de service de bout en bout de 20%.
Pour un lecteur extérieur au secteur, l’enjeu n’est pas l’ingénierie. C’est la boucle. Si un modèle de pointe peut réduire de manière significative le coût d’exploitation des modèles de pointe, la courbe des prix s’accentue d’elle-même, sans attendre la prochaine génération de puces. C’est une histoire économique différente de celle racontée par les 700 milliards de dollars de dépenses d’infrastructure annoncées pour 2026.
Luna est moins cher, mais ce n’est pas le moins cher
Même après une baisse de 80%, Luna ne descend pas sous le plancher du marché. DeepSeek V4 Flash, un modèle chinois à poids ouverts, coûte 0,14 $ en entrée et 0,28 $ en sortie. Gemini 2.5 Flash-Lite de Google s’établit à 0,10 $ et 0,40 $. Le prix de sortie de Luna reste supérieur de plus de 4x à celui de DeepSeek, et la sortie est là où la plupart des charges de travail agentiques dépensent leur argent.
Les nouveaux tarifs de Terra, à 2 $ et 12 $, s’alignent exactement sur les tarifs publiés de Gemini 3.1 Pro, ce qui a peu de chances d’être une coïncidence. Anthropic, de son côté, propose Claude Sonnet 5 à un tarif promotionnel de 2 $ et 10 $ jusqu’au 31 août, avant un retour à 3 $ et 15 $ le 1er septembre. Les segments bon marché et intermédiaire convergent vers les mêmes chiffres. Ce n’est pas le cas du segment phare.
Les chiffres qu’OpenAI n’a pas publiés
L’amélioration de 20% des coûts de service est une mesure de production propre à OpenAI. Aucune partie extérieure ne l’a auditée, et l’entreprise n’a pas divulgué sa marge brute sur l’inférence à quelque niveau que ce soit ; il n’existe donc aucun moyen public de savoir si Luna est rentable à 0,20 $ ou si son prix est fixé pour défendre sa part face à des rivaux open-weight moins chers.
Plusieurs détails jouent aussi contre le chiffre mis en avant. Les trois niveaux de GPT-5.6 comportent un compteur de contexte long qui double à peu près les tarifs lorsqu’une requête dépasse la fenêtre standard. Écrire du nouveau contenu dans le cache de prompt coûte 1,25x le prix d’entrée sans cache, même si la lecture depuis celui-ci bénéficie d’une remise de 90%. Et Sol, le modèle le plus susceptible de gérer les exécutions agentiques coûteuses de plusieurs heures qui ont d’abord alimenté les plaintes sur les prix, n’a rien obtenu.
Ce qu’OpenAI a démontré, c’est un plancher qui continue de baisser et un plafond qui ne bouge pas. L’intelligence bon marché devient moins chère selon un rythme désormais mesuré en semaines. L’intelligence de pointe coûte toujours 30 $ par million de mots qu’elle écrit, et l’entreprise vient de refuser l’occasion de changer cela.
