OpenAI 指控中国 Moonshot AI 在一项从其模型中提取受保护推理过程的蒸馏活动中发挥了关键作用。

在一篇博客文章中,OpenAI 于周三写道,公司发现数千次用户尝试提取相关信息,这些信息可能帮助他人复现该模型的能力。

知识蒸馏是一种机器学习技术,涉及利用能力更强的模型输出训练规模更小的 AI 模型。

这项协调行动于 7 月 1 日以较低频率开始,并在 7 月 24 日和 25 日达到峰值;OpenAI 在这两天发现了约 16,000 次请求,这些请求来自超过 4,000 名用户,并使用了相关的提取模式。该公司表示,在发现超过 15,000 名用户部署了相关模式后,已于 7 月 28 日遏制了这项活动。

OpenAI 表示,目前尚不清楚所有操作者是否来自同一个实体,但公司将其中一个核心活动集群归因于与中国大型 AI 公司 Moonshot 有关联的人员。

这家美国 AI 公司表示,操作者试图以新方式揭示受保护的推理过程,包括在不同对话之间转移输出内容,并提示另一个模型对隐藏的推理内容进行解密和转录。

该团队表示:“这项活动随着时间推移不断演变,进一步表明对抗性蒸馏是一个更广泛的安全挑战,需要分层且能够适应变化的防御措施。”

The Latent 已联系 Moonshot 征求置评。

Frontier Model Releases per Month by Lab

Frontier Model Releases per Month by Lab

  • OpenAI
  • Google
  • Anthropic
  • xAI
  • Meta AI
  • NVIDIA
  • Z.ai
  • Other
SOURCE: Epoch AI — Frontier AI Models

共同的安全挑战

OpenAI 表示,此类蒸馏活动会带来安全和国家安全风险,因为提取出的推理过程可能被用于训练其他模型,而不会保留适当的安全防护措施。

该公司表示:“这一风险并非 OpenAI 独有。”公司还补充说,类似技术可能影响其他先进 AI 系统,“这使其成为一项需要全行业协作应对的共同安全挑战。”

这些指控正值外界围绕中国实验室如何使用美国模型展开更广泛争议之际。上月,Anthropic指控 Moonshot 和 DeepSeek暗中将用户请求路由至 Claude 模型,并将返回结果作为自己的结果展示给用户。Anthropic 还指控 Alibaba 和 Xiaomi 发起针对其模型的蒸馏活动。

美国联邦机构也表达了类似担忧,称中国 AI 公司上月通过蒸馏,有系统地从美国 AI 模型中提取能力。

与此同时,The Information上周报道称,中国互联网监管机构正在调查 Moonshot 和 DeepSeek是否可能向 Anthropic 泄露数据。