阿里巴巴于周一发布了Qwen3.8-Max,并表示将于下周公布该模型的权重,向任何想下载的人开放其最强大AI系统的内部构造。Qwen3.8-Max拥有2.4万亿个参数,即模型在训练期间调整的数值,也是业内对规模的粗略衡量,尽管它在生成任意一个词时实际激活的参数只有约950亿个。它在单次查询中最多可接受100万个token。

投资者将此视为利好。阿里巴巴在香港上市的股票收涨7%,报125.20港元,其在美国上市的股票在盘前交易中上涨4.2%。花旗分析师将部分涨势归因于新模型的基准测试结果。

这种反应与其说是针对模型本身,不如说是针对阿里巴巴对它的处理方式。今年大部分时间里,该公司都将其最强模型保持为专有,而周一重新回到将其顶级发布开源,则逆转了这一做法。

阿里巴巴自己的表述很直接。团队写道,这是“我们第一次开源Qwen-Max级模型的权重”,相关文件将于下周登陆Hugging Face和ModelScope。此前,想使用阿里巴巴最强模型的企业必须将数据发送到阿里巴巴的服务器,并按使用付费。从下周开始,它们可以下载同一个模型,并在自己控制的硬件上运行。美国领先实验室没有一家会公布其前沿模型的权重。

阿里巴巴的这一动作也加入了其同行已设定好的模式。Moonshot AI于7月27日发布了2.8万亿参数Kimi K3的权重,独立追踪机构将其排在Claude Fable 5和GPT-5.6 Sol Max之后。DeepSeek于7月31日重新训练了其廉价的V4-Flash模型,在其公布的全部九项编程基准测试中落后于Claude Opus 4.8,但token成本约仅为后者的五十四分之一。接近前沿、可下载且便宜,如今已成为中国模型的标准卖点,而它定价对标的美国模型三者皆不具备。

持续数天的任务,而非单次回答

阿里巴巴围绕长时任务而非巧妙回答来打造这次发布。它让模型连续处理一个软件项目超过10天;截至7月30日,在大约16天无人类参与的情况下,该代码库已累计265次提交、127个拉取请求和151个问题。

在另一项测试中,它给了模型一篇关于如何选择训练数据的研究论文,以及一组GPU和没有任何起始代码。大约125小时内,它编写了约7,600行代码,进行了33轮训练,复现了论文的六项发现,随后测试了18个自己的想法,并最终得出一种方法,在竞赛级数学基准上比论文高出2.7分。

它还参加了阿里巴巴天池平台上一场实时机器学习竞赛,与526支人类团队同场竞技。在24小时限制下单独作战,它提交了45次,最终领先其中458支团队。在另一项芯片设计测试中,它将一个加密电路从8,298个逻辑门削减到678个,并将物理布局缩小了81%。

为期一年的模拟电商业务,可能是散户投资者最容易理解的案例。模型以¥100,000起步,最终达到¥416,252,领先第二名GLM 5.2达38%,并比阿里巴巴此前的旗舰模型Qwen3.7-Max高出152%。

在一些基准上领先,在另一些上落后

已公布的对比表并非一边倒的胜利,而是有喜有忧。Qwen3.8-Max在Terminal Bench 2.1上得分86.6,领先Claude Opus 4.8和Claude Fable 5的84.6,但落后于GPT-5.6 Sol的88.8。它还以93.0领跑PaperBench,这是一项复现研究论文的测试。

在其他测试中,它明显落后。Claude Fable 5在SWE-bench Pro上得分80.0,而Qwen3.8-Max为67.7;在广泛推理测试Humanity's Last Exam上,Claude Fable 5得分53.3,而Qwen3.8-Max为43.6。Bloomberg报道称,该模型在多个基准测试中排名高于Kimi K3,而这才是在中国国内最有分量的对比。

这些数字未能解决什么问题

许多证据都来自阿里巴巴自身。表中的若干基准测试由其内部构建,自主编程和芯片设计结果也来自阿里巴巴自己未经审计的运行,而脚注还警告称,Claude Fable 5的分数可能涉及回退机制。独立追踪机构尚未对已发布模型进行评级。

开源权重也并不意味着权重可用。一个2.4万亿参数的文件需要一整机架的数据中心GPU,这也是Kimi K3上周遇到的同一道门槛。阿里巴巴尚未说明此次发布将采用何种许可证。

对阿里巴巴而言,下周带来的将是分发而非收入。每一家下载Qwen3.8-Max的公司,都是一家没有与OpenAI或Anthropic签约的公司;而每一家基于它构建业务的公司,日后都更难被迁移。权重将于下周发布。许可证将显示阿里巴巴究竟在多大程度上押注这一策略。