Alibaba lançou o Qwen3.8-Max na segunda-feira e disse que publicará os pesos do modelo na próxima semana, abrindo os componentes internos de seu sistema de IA mais capaz para qualquer pessoa que queira baixá-los. O Qwen3.8-Max opera com 2,4 trilhões de parâmetros, os valores que um modelo ajusta durante o treinamento e a medida rudimentar de tamanho da indústria, embora apenas cerca de 95 bilhões deles estejam ativos para qualquer palavra que ele produza. Ele aceita até 1 milhão de tokens em uma única consulta.

Os investidores trataram isso como uma vitória. As ações da Alibaba listadas em Hong Kong fecharam com alta de 7%, a HK$125,20, e suas ações listadas nos EUA subiram 4,2% no premarket. Analistas do Citi relacionaram parte do movimento aos resultados de benchmark do novo modelo.

Essa reação tem menos a ver com o modelo do que com o que a Alibaba está fazendo com ele. A empresa passou boa parte deste ano mantendo seus modelos mais fortes como proprietários, e a retorno, na segunda-feira, à abertura de seus lançamentos de primeira linha inverte isso.

O enquadramento da própria Alibaba é direto. Esta é "a primeira vez que abriremos os pesos de um modelo da classe Qwen-Max", escreveu a equipe, com arquivos previstos no Hugging Face e no ModelScope na próxima semana. Até agora, uma empresa que quisesse o modelo mais forte da Alibaba precisava enviar seus dados aos servidores da Alibaba e pagar por uso. A partir da próxima semana, ela poderá baixar o mesmo modelo e executá-lo em hardware sob seu controle. Nenhum dos principais laboratórios dos EUA publica os pesos de seus modelos de fronteira.

A Alibaba também está chegando a um padrão já estabelecido por seus vizinhos. A Moonshot AI publicou os pesos do Kimi K3 de 2,8 trilhões de parâmetros em 27 de julho, e rastreadores independentes o colocaram atrás apenas de Claude Fable 5 e GPT-5.6 Sol Max. A DeepSeek retreinou seu modelo barato V4-Flash em 31 de julho, ficando atrás de Claude Opus 4.8 em todos os nove benchmarks de programação que publicou, a aproximadamente um cinquenta e quatro avos do custo por token. Quase fronteira, baixável e barato agora é a oferta padrão chinesa, e ela compete em preço com modelos dos EUA que não são nenhuma dessas três coisas.

Tarefas de dias, não respostas únicas

A Alibaba estruturou o lançamento em torno de trabalhos longos, e não de respostas inteligentes. Ela deixou o modelo solto em um projeto de software por mais de 10 dias; em 30 de julho, o repositório havia acumulado 265 commits, 127 pull requests e 151 issues após cerca de 16 dias sem envolvimento humano.

Em outro teste, ela entregou ao modelo um artigo de pesquisa sobre escolha de dados de treinamento, além de um conjunto de GPUs e nenhum código inicial. Ao longo de cerca de 125 horas, ele escreveu aproximadamente 7.600 linhas de código, executou 33 rodadas de treinamento, reproduziu as seis conclusões do artigo, depois testou 18 ideias próprias e chegou a um método que superou o artigo em 2,7 pontos em um benchmark de matemática de nível competitivo.

Ela também entrou em uma competição ao vivo de machine learning na plataforma Tianchi da Alibaba contra 526 equipes humanas. Trabalhando sozinho sob um limite de 24 horas, fez 45 submissões e terminou à frente de 458 delas. Em uma execução separada de design de chips, reduziu um circuito criptográfico de 8.298 portas lógicas para 678 e encolheu o layout físico em 81%.

Um negócio simulado de e-commerce ao longo de um ano é o caso que investidores de varejo podem achar mais compreensível. Começando com ¥100,000, o modelo terminou com ¥416,252, 38% à frente do GLM 5.2, em segundo lugar, e 152% acima do flagship anterior da Alibaba, Qwen3.7-Max.

À frente em alguns benchmarks, atrás em outros

A tabela de comparação publicada é mista, e não triunfante. O Qwen3.8-Max marca 86,6 no Terminal Bench 2.1, à frente de Claude Opus 4.8 e Claude Fable 5, com 84,6, mas atrás de GPT-5.6 Sol, com 88,8. Ele lidera a tabela no PaperBench, um teste de reprodução de artigos de pesquisa, com 93,0.

Em outros testes, ele fica claramente atrás. Claude Fable 5 marca 80,0 no SWE-bench Pro contra 67,7 do Qwen3.8-Max, e 53,3 no Humanity's Last Exam, um teste amplo de raciocínio, contra 43,6. A Bloomberg informou que o modelo fica acima do Kimi K3 em vários benchmarks, comparação que tem mais peso dentro da China.

O que os números não resolvem

Grande parte das evidências é da própria Alibaba. Vários benchmarks na tabela foram construídos internamente, os resultados de programação autônoma e design de chips vêm de execuções próprias da Alibaba sem auditoria, e uma nota de rodapé avisa que as pontuações de Claude Fable 5 podem envolver mecanismos de fallback. Rastreadores independentes ainda não avaliaram o modelo lançado.

Pesos abertos também não significam pesos utilizáveis. Um arquivo de 2,4 trilhões de parâmetros exige um rack de GPUs de datacenter, a mesma barreira na qual o Kimi K3 esbarrou na semana passada. A Alibaba não disse qual licença regerá o lançamento.

O que a próxima semana compra para a Alibaba é distribuição, não receita. Cada empresa que baixa o Qwen3.8-Max é uma que não assinou contrato com OpenAI ou Anthropic, e cada empresa que constrói sobre ele é mais difícil de deslocar depois. Os pesos chegam na próxima semana. A licença mostrará quanto dessa aposta a Alibaba está realmente fazendo.