La firma de evaluación comparativa de modelos de IA Artificial Analysis publicó esta semana su puntuación para la última versión del modelo ligero V4-Flash de DeepSeek, después de que entrara en beta pública el viernes. Sorprendentemente, el modelo más barato del desarrollador chino obtuvo 50 puntos en el Intelligence Index de la plataforma, situándose 6 puntos por encima de su modelo insignia DeepSeek V4 Pro-Preview.

DeepSeek también sigue siendo significativamente más barato que los principales modelos estadounidenses. Los competidores de EE. UU. han tomado medidas para intentar cerrar esta brecha en los últimos meses, especialmente OpenAI, que redujo el costo de su propio modelo económico en un 80 % apenas unos días después de su lanzamiento. En cualquier caso, a $0.14 por millón de tokens de entrada y $0.28 por millón de tokens de salida, el modelo de DeepSeek sigue siendo un 60 % más barato que GPT-Luna.

Cómo Flash superó a Pro-Preview en inteligencia

Los registros de actualización publicados por DeepSeek muestran que la última versión de Flash tiene la misma arquitectura fundamental y el mismo tamaño que su versión anterior de abril de este año.

La variable que cambió fue el perfeccionamiento posterior al entrenamiento. Mientras la API insignia V4-Pro-Preview sigue siendo la misma, la API de Flash recibió una importante renovación. El resultado son «capacidades de agente significativamente mejoradas, con resultados en las pruebas muy superiores a los de V4-Pro-Preview».

La capacidad de agente se está convirtiendo en una referencia cada vez más importante para los modelos de IA, lo que refleja su expansión mucho más allá de las capacidades básicas de los chatbots. Esto se refiere a la capacidad de un modelo para abordar tareas complejas de varias etapas, como escribir y probar código.

La firma de evaluación comparativa de IA Artificial Analysis corroboró los resultados de DeepSeek con respecto a su modelo más reciente. En pruebas independientes, Flash subió 17 puntos con respecto a su predecesor en Terminal-Bench 2.1, una prueba que mide qué tan bien opera un modelo en una línea de comandos.

En GDPval-AA v2 —la prueba de Artificial Analysis sobre tareas laborales del mundo real en sectores como las finanzas, la ingeniería y la atención médica—, la puntuación del modelo subió de 1,189 a 1,559.

Estos hallazgos sugieren que las capacidades agénticas de V4-Flash representan realmente un gran avance.

En qué aspectos el DeepSeek V4-Flash todavía se queda atrás

Aunque el modelo de DeepSeek ha logrado mejoras notables, todavía está lejos de ser líder del mercado. Claude Opus 4.8 de Anthropic sigue liderando en todas las pruebas comparativas que la propia DeepSeek publicó, mientras que el también desarrollador chino Moonshot sigue liderando entre los modelos de pesos abiertos con su modelo Kimi K3.

El informe de Artificial Analysis incluía una advertencia: V4-Flash también presenta una alta tasa de alucinaciones, del 84 %, entre las respuestas incorrectas. Esto significa que, en los casos en los que no puede proporcionar la respuesta correcta, V4-Flash generalmente prefiere responder de forma incorrecta en lugar de negarse a responder. La firma de evaluación comparativa señaló que la versión más reciente inventó respuestas basadas en la mejor estimación con menor frecuencia que las versiones anteriores, pero la tasa sigue siendo alta.

Otra posible deficiencia es la tendencia del modelo a ser demasiado prolijo. Durante las pruebas, según se informa, generó alrededor de 206 millones de tokens de salida en toda la serie de pruebas del Intelligence Index. Esto es más del doble de la mediana, lo que significa que los costos reales de uso del modelo pueden aumentar por encima de lo que sugieren sus tarifas anunciadas.