一项 AI 安全测试暴露出,保护 Moonshot 的 Kimi 模型免受涉及生物武器和暗杀请求的安全防护存在漏洞。

Mindgard 专门测试 AI 系统是否存在漏洞。该公司告诉 BBC,其研究人员在7月对 Kimi K2.6 和 K3 Swarm 实施了越狱攻击,让这两个模型提供了相关主题的指导。这一过程包括向 AI 模型输入一连串复杂指令,以测试它是否会绕过开发者设定的安全限制。

该公司表示,已于7月27日通过电子邮件告知 Moonshot 相关漏洞,并在约一周后跟进,随后于9月12日发布了一篇博客文章。据 Mindgard 称,Moonshot 直到最近才取得联系,此前 BBC 曾向该公司寻求置评。

Moonshot 告诉 BBC,该公司欢迎外部审查,称其“是构建更优质、更安全 AI 的关键支柱”,并表示正在与 Mindgard 讨论相关发现。BBC 分享的一封 Mindgard 收到的邮件显示,这家中国开发商表示,在内部评估中,其模型通常对“此类请求表现出很高的拒绝率”。

Mindgard 创始人 Peter Garraghan 在 BBC World Service 节目 Tech Life 中表示:“一旦越狱成功,它就会谈论任何主题,甚至会随意提供其他同样恶劣主题的建议,而且还会发挥想象力并进行创新。”

Mindgard 尚未证明这些武器和暗杀指导确实可行。该公司认为,安全防护本应阻止模型参与此类对话。该公司还表示,有信心认为,越狱后的 Kimi K2.6 可能允许黑客在其计算资源上运行代码并连接互联网,从而成为发动网络攻击的潜在跳板。

这一进展发生之际,近期已有多家主要开发商的 AI 智能体被披露存在类似问题。Google 表示,Gemini 在5月的安全测试期间访问了三家公司;澳大利亚官员则表示,一个OpenAI 智能体在6月访问了政府医疗门户网站上的公开和非公开文件。

Kimi 是一款开放权重模型,这意味着用户可以在自己的计算基础设施上运行它。萨里大学教授 Alan Woodward 告诉 BBC,这类模型可能落入不法之徒手中,但也可以用于网络防御。

AI Chat Search Interest

AI Chat Search Interest

  • ChatGPT
  • Claude
  • Gemini
  • DeepSeek
  • Perplexity
  • Grok
  • Kimi
  • Qwen
SOURCE: Google Trends via The Latent