DeepSeek lanzó la versión oficial de su modelo V4-Flash en beta pública el viernes, y las pruebas independientes confirmaron rápidamente algo inusual: el modelo pequeño y barato del laboratorio chino ahora supera a su propio buque insignia. La firma de evaluación Artificial Analysis otorgó a la actualización, etiquetada como DeepSeek-V4-Flash-0731, una puntuación de 50 en su Intelligence Index, un salto de 10 puntos sobre la versión lanzada en abril de 2026 y 6 puntos por delante del DeepSeek V4 Pro, más grande y mucho más caro.

El momento aumenta la tensión. El lanzamiento se produjo un día después de que OpenAI redujera el precio de GPT-5.6 Luna, su modelo de frontera económico, en un 80% ante la presión de clientes sensibles a los costos. Incluso después de ese recorte, Artificial Analysis estima que el nuevo modelo de DeepSeek queda a solo 1 punto de Luna en inteligencia, mientras cuesta aproximadamente un 60% menos por tarea en la propia API de DeepSeek.

La gama económica alcanza al buque insignia

Cuando DeepSeek lanzó su línea V4 en abril, siguió la lógica estándar de dos niveles de la industria: Pro, un modelo de 1.6T parámetros, para máxima capacidad, y Flash para velocidad y bajo costo. Tres meses después, esa jerarquía se ha invertido, al menos temporalmente. La API de V4 Pro y los modelos detrás de la aplicación para consumidores de DeepSeek no han cambiado; solo la API de Flash recibió la actualización.

La propia explicación de la empresa sobre lo que cambió es directa. Su registro de actualizaciones afirma que el lanzamiento ha "mejorado significativamente las capacidades de agente, con resultados de referencia muy superiores a V4-Pro-Preview." Las tareas de agente son trabajos que un modelo completa por sí solo a lo largo de muchos pasos, operando una terminal, editando código y llamando a otro software, en lugar de responder a una sola pregunta. Son la categoría en la que la industria cree actualmente que está el dinero, por lo que un modelo económico que supere a una vista previa del buque insignia en ellas es más que una curiosidad de clasificación.

Igual de llamativo es lo que no cambió. El modelo mantiene la arquitectura y el tamaño exactos de la versión de abril: 284B parámetros totales, los ajustes internos que almacenan lo que sabe un modelo, con solo 13B activos para cualquier palabra dada, lo que mantiene bajos los costos de ejecución. DeepSeek dice que las mejoras provinieron por completo del post-entrenamiento, la etapa de refinamiento aplicada después de que se construye el conocimiento central de un modelo. El precio no cambia: $0.14 por 1M tokens de entrada y $0.28 por 1M tokens de salida, y DeepSeek ofrece un descuento del 98% en entrada en caché, texto que el sistema ya ha procesado, frente al 90% que ofrece la mayoría de sus rivales.

Las cifras independientes respaldan la afirmación sobre agentes. En GDPval-AA v2, la prueba de Artificial Analysis sobre tareas de trabajo del mundo real, la calificación del modelo subió a 1559 desde 1189, y Terminal-Bench 2.1, que mide qué tan bien opera un modelo una línea de comandos, subió 17 puntos hasta 79% en las pruebas de la firma.

Lo que la puntuación no resuelve

El modelo sigue inventando respuestas a una tasa alta. En la prueba de conocimiento de Artificial Analysis, cuando no sabe algo, fabrica una respuesta el 84% de las veces. Eso es 12 puntos mejor que su predecesor, pero toda la mejora provino de negarse a adivinar con más frecuencia; la proporción de preguntas que realmente acierta no se movió.

También es verboso. El modelo produjo aproximadamente 206M tokens de salida para completar el Intelligence Index, un 12% menos que la versión de abril, pero aún cerca del doble de la mediana para modelos comparables. En bucles largos de agentes, eso significa que las facturas reales resultan sensiblemente más altas de lo que sugiere el precio bajísimo por token.

Y todavía no se ha alcanzado el techo. Claude Opus 4.8 de Anthropic sigue liderando en cada referencia que publicó el propio DeepSeek, y entre los modelos abiertos Kimi K3 se mantiene 7 puntos por delante en el índice. El modelo solo maneja texto, sin imágenes, y sus pesos, los archivos que permitirían a cualquiera ejecutarlo por su cuenta, se esperan pero aún no han sido publicados, así que por ahora existe solo como una API de pago.

DeepSeek dice que la versión oficial de V4-Pro "llegará pronto." Si una sola pasada de post-entrenamiento elevó 10 puntos al modelo pequeño, la pregunta abierta es qué hace el mismo tratamiento con un modelo casi 6 veces más grande. El precio de la inteligencia casi de frontera cayó dos veces esta semana. Solo una de esas caídas requirió tocar una lista de precios.