中国正引领开放权重模型的分发趋势,许多顶尖 AI 实验室都将模型发布到网上,任何人只要拥有所需硬件,就可以下载并运行。最新获得这种待遇的是阿里巴巴的 Qwen3.8-Max。该公司透露,计划于下周在 ModelScope 和 Hugging Face 上发布其权重。
阿里巴巴股价对此作出积极反应,其在香港上市的股票周一收盘上涨 7%,随后在美国盘前交易中上涨 4.2%。
该公司一名发言人强调,这是“我们首次开源 Qwen-Max 级别模型的权重”。这是该公司功能最强大的模型;此前,阿里巴巴曾发布性能较弱的低价模型权重,但一直限制对旗舰产品的访问。
不过,中国开发者之间的趋势正日益转向开放权重访问。总部位于北京的 Moonshot AI 也在 7 月 27 日发布了自家拥有 2.8 万亿参数的模型 Kimi K3 的权重。
美国前沿 AI 实验室仍将模型权重严格作为专有资产,而中国的趋势则是以更低成本、可自由下载的形式提供可比的结果——尽管在许多方面并不那么强大。
Qwen3.8-Max 展示处理中长期任务的能力
阿里巴巴的 Qwen3.8-Max 拥有 2.4 万亿参数,每次查询最多可处理 100 万个 token。该模型的定位是处理时间跨度更长的工作,而不是用于聊天机器人式的互动。
为展示这些能力,开发者为其布置了复杂的机器学习和编码任务。其中包括一个持续数周的软件开发项目,在大约 16 天内、完全没有人工干预的情况下,产生了 265 次提交、127 个拉取请求和 151 个问题。另一项测试要求模型缩小加密电路芯片的尺寸;Qwen 通过将逻辑门数量从 8,298 个精简至 678 个,成功将该组件的物理尺寸缩小了 81%。
该模型也适用于电子商务场景。最后一项测试显示,模型获得 ¥100,000 的初始资金,并被要求在为期一年的模拟中尽可能赚取更多资金。在这段时间里,模型成功将资本增加至原来的四倍,最终表现比阿里巴巴旗舰模型的上一版本高出 152%。
据阿里巴巴介绍,这些测试均在公司内部按照自有规则和流程进行,未经独立审计。
Qwen3.8-Max 与竞争对手的比较
与美国前沿模型进行对比时,Qwen 的能力或许就没那么令人印象深刻了。阿里巴巴自有的对比表显示,它在某些任务类型上表现更好,但在其他任务上则落后。在 Terminal Bench 2.1 测试中——该测试考察模型完成复杂多部分任务的能力——Qwen3.8-Max 得分 86.6,领先于 Anthropic 的旗舰模型,但仍略低于 OpenAI 的 GPT-5.6 Sol,后者得分为 88.8。
不过,Qwen 在 PaperBench 测试中以 93.0 分超过了所有竞争者。该测试考察模型复现机器学习研究论文的能力。其他基准测试结果则不太理想:阿里巴巴的模型在编码测试 SWE-bench Pro 中仅得分 67.7,远低于 Claude Fable 5 的 80.0 分。
不过,如果仅与国内竞争对手比较,Qwen3.8-Max 的排名会有所提升。彭博社报道称,在多个关键基准测试中,它的排名高于备受赞誉的 Kimi K3——另一款规模相当的开放权重模型——尽管 Moonshot 的模型整体表现略胜一筹。
尽管如此,这仍使 Qwen3.8-Max 成为开放权重模型中的顶尖竞争者之一,尤其是在涉及时间跨度较长的任务方面。
