La industria de la IA pasó la primera mitad de 2026 discutiendo qué modelo era el más inteligente. Sus clientes más grandes han estado haciendo una pregunta más específica, la que aparece en sus facturas: ¿cuánto cuesta una unidad de esa inteligencia?
OpenAI respondió parte de eso el jueves, recortando el precio de GPT-5.6 Luna, el modelo más rápido y de menor costo de su familia más nueva, en aproximadamente un 80%. Luna ahora cuesta $0.20 por millón de tokens de entrada y $1.20 por millón de tokens de salida. El modelo de gama media, GPT-5.6 Terra, baja un 20%, a $2 y $12. El buque insignia, GPT-5.6 Sol, no cambia y se mantiene en $5 y $30. Los recortes llegan tres semanas después de que la familia estuviera disponible de forma general el 9 de julio.
La velocidad es lo que hace que esto sea inusual. Ina Fried, quien informó sobre las reducciones para Axios, señaló que descuentos como estos normalmente llegan meses después del lanzamiento de un modelo y no semanas.
Los tokens son la unidad de facturación para los modelos de IA, y cada uno equivale aproximadamente a tres cuartos de una palabra. Los tokens de entrada son lo que envías; los tokens de salida son lo que el modelo devuelve por escrito. Una sola tarea automatizada de programación puede hacer pasar millones de tokens por una interfaz en una tarde. Esa es la presión detrás de los últimos meses de noticias sobre precios, ya que OpenAI y Anthropic han reajustado tarifas, límites de velocidad y políticas de uso mientras los modelos de razonamiento más nuevos consumen muchos más tokens en tareas de larga duración que sus predecesores.
OpenAI dice que su propio modelo ayudó a recortar el costo de ejecutarlo
El miércoles, el día antes del cambio de precio, OpenAI publicó una entrada de ingeniería explicando de dónde provenían los ahorros. Hasta ahora, el costo de servir un modelo grande había caído principalmente mediante dos palancas: mejor hardware e ingenieros humanos ajustando manualmente el software que corre sobre él. La afirmación de OpenAI es que se ha abierto una tercera palanca.
La empresa escribe que, trabajando dentro de su herramienta de programación Codex, "GPT-5.6 Sol reescribió y optimizó de forma autónoma nuestros kernels de producción". Los kernels son el código de bajo nivel que ejecuta las operaciones matemáticas de un modelo en un chip gráfico. OpenAI dice que ese trabajo, combinado con cambios relacionados, redujo los costos de servicio de extremo a extremo en un 20%.
Para un lector ajeno al campo, la importancia no está en la ingeniería. Está en el ciclo. Si un modelo de frontera puede reducir de forma significativa el costo de operar modelos de frontera, la curva de precios se vuelve más pronunciada por sí sola, sin esperar a la próxima generación de chips. Esa es una historia económica distinta de la contada por $700 mil millones en gasto de infraestructura anunciado para 2026.
Luna es más barato, pero no es el más barato
Incluso después de un recorte del 80%, Luna no perfora el piso del mercado. DeepSeek V4 Flash, un modelo chino de pesos abiertos, cuesta $0.14 de entrada y $0.28 de salida. Gemini 2.5 Flash-Lite de Google se sitúa en $0.10 y $0.40. El precio de salida de Luna sigue siendo más de 4x el de DeepSeek, y la salida es donde la mayoría de las cargas de trabajo de agentes gastan dinero.
Los nuevos $2 y $12 de Terra se ubican exactamente en las tarifas publicadas de Gemini 3.1 Pro, lo que difícilmente sea una coincidencia. Anthropic, por su parte, ofrece Claude Sonnet 5 a un precio promocional de $2 y $10 hasta el 31 de agosto, volviendo a $3 y $15 el 1 de septiembre. Los niveles barato e intermedio están convergiendo en las mismas cifras. El nivel insignia no.
Las cifras que OpenAI no ha publicado
La mejora del 20% en costos de servicio es una medición de producción de la propia OpenAI. Ninguna parte externa la ha auditado, y la empresa no ha revelado el margen bruto de la inferencia en ningún nivel, por lo que no hay manera pública de saber si Luna es rentable a $0.20 o si su precio está fijado para mantener cuota frente a rivales de pesos abiertos más baratos.
Varios detalles también juegan en contra de la cifra del titular. Los tres niveles de GPT-5.6 llevan un medidor de contexto largo que aproximadamente duplica las tarifas una vez que una solicitud supera la ventana estándar. Escribir contenido nuevo en la caché de prompts cuesta 1.25x el precio de entrada sin caché, aunque leer desde ella obtiene un descuento del 90%. Y Sol, el modelo con más probabilidades de encargarse de las costosas ejecuciones de agentes de varias horas que impulsaron las quejas sobre precios en primer lugar, no recibió nada.
Lo que OpenAI ha demostrado es un piso que sigue bajando y un techo que no se mueve. La inteligencia barata se está abaratando con un calendario que ahora se mide en semanas. La inteligencia de frontera todavía cuesta $30 por cada millón de palabras que escribe, y la empresa acaba de dejar pasar la oportunidad de cambiar eso.
