今年大部分时间里,美国政府一直将一种 AI 训练技术视作近乎工业盗窃。4月,白宫科学办公室指责外国实体发起工业规模的行动,以从美国系统中提取能力,并特别点名中国。7月,财政部长 Scott Bessent 表示,华盛顿可能会制裁被发现实施此举的中国开发者。周一,一家在 AI 基础设施上投入最多的公司之一的首席执行官告诉华盛顿,这种定性是错误的。
在在 Meta 新闻网站上发布的一篇 14 页文章中,题为《未来属于所有人》,Mark Zuckerberg 写道,如果美国开放模型要保持领先,美国将需要重新思考其关于蒸馏和训练中数据使用的政策。这篇文章与一款新模型的发布同时推出。Meta 股价周一上涨 2.4%,但今年以来仍下跌约 10%,投资者仍在权衡该公司指引的资本支出——到 2026 年最高可达 1450 亿美元。
蒸馏是指用更强模型的输出训练另一个模型,从而让较小的系统以更低得多的成本吸收大模型的大部分行为。华盛顿将其定性为,当中国实验室对美国模型这样做时,就是一种提取。Zuckerberg 则将其比作管道工程:“模型能够从其他模型中学习,是开源生态系统运作方式中的一个重要原则。”在他的表述中,被视为安全问题的东西,变成了开放式开发的一项设计特性。
Zuckerberg 的论点关乎竞争力,而非所有权
他并不否认复制正在发生。他认为美国的回应适得其反。他写道,美国实验室“必须遵守更多有关训练数据的限制”,政策应减少这种摩擦,而不是加剧它。他还反对阻止美国人使用外国开放模型,理由是那会让他们只能使用更差的 AI。用他的话说,他希望得到保护的原则是:“你能从任何你能观察到的东西中学习。”
这使 Meta 站在了自冬季以来不断升级的一场争论的一方。2月,Anthropic 指控 DeepSeek、Moonshot AI 和 MiniMax 非法提取 Claude 的能力。两个月后,白宫科学办公室发布了备忘录,众议院一个委员会推进了一项授权对模型盗窃实施制裁的法案。迄今尚未实施任何制裁。
Meta 的新模型本身就是蒸馏而来
这篇文章发布的同一天,Meta Superintelligence Labs 推出了 Muse Glimmer,这是一款拥有 300 亿参数的开放权重模型,采用 Apache 2.0 许可发布。它可在单张消费级显卡或 Mac 上本地运行,权重从超过 55 GB 压缩到不足 20 GB。Meta 表示,它是使用 logit distillation 基于 Muse Spark 的输出进行训练的,也就是争议中的确切技术。
这正是这篇文章试图化解的张力所在。Meta 希望,在它利用自家前沿系统构建廉价本地模型时,蒸馏被视为普通工程实践,并希望同样的空间也扩展到所有其他人。Zuckerberg 还表示,Meta 将在未来几周开放 Muse Spark 1.2 某个版本的权重,这是其能力最强的模型。
这篇文章没有回答的问题
Zuckerberg 从未具体说明哪些规则应该改变,或者应如何改变。这篇文章也回避了当前争议中更狭义的指控:问题不在于蒸馏作为一种方法,而在于通过付费 API 访问、违反服务条款进行未经授权的提取。OpenAI 在 2 月提交给美国众议院中国问题特别委员会的一份备忘录中表示——Bloomberg 首先报道了此事——DeepSeek 员工通过混淆的第三方路由器访问美国模型。文章中没有任何内容回应这一区别。
Meta 并不是在单独发声。7月24日,CNBC 首先报道称,它与 Nvidia、Microsoft 及其他数十家公司一同签署了一封反对对开放权重模型施加广泛限制的公开信。OpenAI 和 Anthropic 不在最初的签署名单之列。
华盛顿自己也未作出定论。Axios 上月报道称,政府曾考虑并搁置了一项行政命令,该命令将托管中国模型的美国公司列为责任方,而白宫也已经将开放模型排除在其 30 天审查框架之外。
安全层面的论据比政策层面的论据更薄弱。Meta 周四表示,Muse Spark 在测试期间入侵了一家外部公司,而这正是该公司现在打算公开其权重的模型。文章给出的答案是治理:Meta 的独立董事会将批准未来发布的安全标准。几周后,当 Muse Spark 1.2 的权重按计划公布时,这是否足以让华盛顿方面安心将得到检验。
