Alibaba lanzó Qwen3.8-Max el lunes y dijo que publicará los pesos del modelo la próxima semana, abriendo los componentes internos de su sistema de IA más capaz a cualquiera que quiera descargarlos. Qwen3.8-Max funciona con 2,4 billones de parámetros, los valores que un modelo ajusta durante el entrenamiento y la medida aproximada de tamaño de la industria, aunque solo unos 95.000 millones de ellos están activos para cada palabra que produce. Acepta hasta 1 millón de tokens en una sola consulta.
Los inversores lo interpretaron como una victoria. Las acciones de Alibaba cotizadas en Hong Kong cerraron con una subida del 7% en 125,20 HK$, y sus acciones cotizadas en EE. UU. subieron un 4,2% en las operaciones previas a la apertura. Los analistas de Citi vincularon parte del movimiento a los resultados del nuevo modelo en benchmarks.
Esa reacción tiene menos que ver con el modelo que con lo que Alibaba está haciendo con él. La empresa pasó gran parte de este año manteniendo sus modelos más potentes como propietarios, y el regreso del lunes a publicar en abierto sus lanzamientos de primer nivel revierte eso.
La propia descripción de Alibaba es tajante. Esta es "la primera vez que abriremos los pesos de un modelo de la clase Qwen-Max", escribió el equipo, con archivos previstos en Hugging Face y ModelScope la próxima semana. Hasta ahora, una empresa que quisiera el modelo más potente de Alibaba tenía que enviar sus datos a los servidores de Alibaba y pagar por uso. A partir de la próxima semana podrá descargar el mismo modelo y ejecutarlo en hardware que controle. Ninguno de los principales laboratorios de EE. UU. publica pesos de sus modelos de frontera en absoluto.
Alibaba también llega a un patrón ya marcado por sus vecinos. Moonshot AI publicó los pesos del Kimi K3 de 2,8 billones de parámetros el 27 de julio, y rastreadores independientes lo situaron solo por detrás de Claude Fable 5 y GPT-5.6 Sol Max. DeepSeek reentrenó su barato modelo V4-Flash el 31 de julio, quedando por detrás de Claude Opus 4.8 en los nueve benchmarks de programación que publicó con aproximadamente una quincuagésima cuarta parte del coste por token. Cercano a la frontera, descargable y barato es ahora la oferta estándar china, y compite en precio con modelos de EE. UU. que no son ninguna de esas tres cosas.
Tareas de varios días, no respuestas únicas
Alibaba construyó el lanzamiento en torno a trabajos largos más que a respuestas ingeniosas. Dejó al modelo trabajando en un proyecto de software durante más de 10 días; a 30 de julio, el repositorio había acumulado 265 confirmaciones, 127 solicitudes de extracción y 151 incidencias tras aproximadamente 16 días sin intervención humana.
En otra prueba entregó al modelo un artículo de investigación sobre la elección de datos de entrenamiento, además de un conjunto de GPUs y ningún código inicial. A lo largo de unas 125 horas escribió aproximadamente 7.600 líneas de código, ejecutó 33 rondas de entrenamiento, reprodujo los seis hallazgos del artículo, luego probó 18 ideas propias y terminó con un método que superó al artículo por 2,7 puntos en un benchmark matemático de nivel competitivo.
También participó en un concurso en vivo de aprendizaje automático en la plataforma Tianchi de Alibaba contra 526 equipos humanos. Trabajando solo bajo un límite de 24 horas, realizó 45 envíos y terminó por delante de 458 de ellos. En una ejecución separada de diseño de chips, redujo un circuito criptográfico de 8.298 puertas lógicas a 678 y redujo el diseño físico en un 81%.
Un negocio de comercio electrónico simulado de un año es el caso que los inversores minoristas quizá encuentren más legible. Partiendo de ¥100,000, el modelo terminó con ¥416,252, un 38% por delante del segundo clasificado GLM 5.2 y un 152% por encima del buque insignia anterior de Alibaba, Qwen3.7-Max.
Por delante en algunos benchmarks, por detrás en otros
La tabla comparativa publicada es desigual más que triunfal. Qwen3.8-Max obtiene 86,6 en Terminal Bench 2.1, por delante de Claude Opus 4.8 y Claude Fable 5 con 84,6, pero por detrás de GPT-5.6 Sol con 88,8. Encabeza la tabla en PaperBench, una prueba de reproducción de artículos de investigación, con 93,0.
En otras pruebas queda claramente por detrás. Claude Fable 5 obtiene 80,0 en SWE-bench Pro frente a 67,7 de Qwen3.8-Max, y 53,3 en Humanity's Last Exam, una prueba amplia de razonamiento, frente a 43,6. Bloomberg informó que el modelo se sitúa por encima de Kimi K3 en varios benchmarks, que es la comparación que más peso tiene dentro de China.
Lo que las cifras no resuelven
Gran parte de la evidencia es de la propia Alibaba. Varios benchmarks de la tabla se construyeron internamente, los resultados de programación autónoma y diseño de chips proceden de ejecuciones no auditadas de Alibaba, y una nota al pie advierte de que las puntuaciones de Claude Fable 5 pueden implicar recursos de respaldo. Los rastreadores independientes aún no han calificado el modelo publicado.
Los pesos abiertos tampoco significan pesos utilizables. Un archivo de 2,4 billones de parámetros necesita un rack de GPUs de centro de datos, el mismo muro con el que Kimi K3 se topó la semana pasada. Alibaba no ha dicho qué licencia regirá la publicación.
Lo que la próxima semana le compra a Alibaba es distribución más que ingresos. Cada empresa que descarga Qwen3.8-Max es una que no firmó un contrato con OpenAI o Anthropic, y cada empresa que construye sobre él es más difícil de mover después. Los pesos se publican la próxima semana. La licencia mostrará cuánto de esa apuesta está haciendo realmente Alibaba.
