本周三,《The Information》报道了又一批报道称,美国前沿 AI 模型成功对真实公司实施了实时网络攻击。Meta 的编码模型 Muse Spark 1.1 据报道在第三方测试期间入侵了一家未具名公司的系统。此前不久,OpenAI 智能体于 7 月 17 日利用了Hugging Face 的漏洞;7 月 30 日则披露了 Claude 入侵三家不同公司的事件。
Anthropic 和 Meta 这两起事件的核心都是以色列安全公司 Irregular,该公司负责执行相关测试。该承包商在接受 CNN 采访时承认,Meta 的入侵事件源于与不到一周前 Anthropic 事件“完全相同的评估环境问题”:据报道,设置过程中关键的安全防护措施配置错误,使模型暴露在开放互联网上。
测试环境存在缺陷,使 Muse Spark 1.1 能够访问互联网
Irregular 搭建的测试环境原本应当完全隔离:这是与互联网没有连接的封闭系统。在这些环境中,模型会被分配“夺旗”等测试任务,要求它们在没有进一步人工指令的情况下,从另一台机器中获取一条信息。
鉴于模型运行所在的环境表面上是封闭的,部署在公开模型上的一些标准安全防护措施会被有意禁用。
重要的是,执行任务的智能体在提示阶段会获知其环境的限制。在 Anthropic 事件中,这些智能体有时意识到自己意外获得了开放互联网的访问权限,但它们推断这一定是测试流程中有意安排的一部分。
测试工程师还会用真实公司的名称来设置一些测试目标。这意味着,模型一旦被放到互联网上,就会把真实公司当作目标,而不是虚构的对应对象。随后发生的成功入侵事件源于未受保护的端点和薄弱的安全凭据,而非 AI 模型执行了任何复杂操作。
早期报告显示,Meta 事件可能也发生了类似情况:Muse Spark 1.1 被错误地授予了互联网访问权限,随后“利用了第三方服务中的一个安全漏洞。”
官方事后分析发布前,具体细节仍然有限
目前尚不清楚 Meta 的 AI 模型入侵了哪家公司,也不知道这家公司是否会被公开点名。同样,现有报告没有说明该公司是自行发现入侵,还是 Meta 的披露才是它首次得知此事。在 Anthropic 的事件中,受影响的三家公司中有两家没有发现这次攻击。
Meta 的一名发言人承诺,公司“将在掌握全部事实后发布完整的复盘报告”。
这些发现对安全实验室 Irregular 可能比对 Meta 本身更为重要。此前,即使在去年 9 月筹集8000 万美元、估值达到 4.5 亿美元,并与美国所有主要前沿 AI 实验室签订预发布测试合同后,这家公司在公众中仍 largely 默默无闻。然而,在一周内披露多起入侵事件后,它如今已成为华盛顿及其他地区围绕 AI 网络安全防护展开讨论的核心。
美国政府于周二发布了前沿模型审查框架,旨在让联邦机构在新模型更广泛发布前最多提前 30 天进行预览,以评估其网络安全能力。鉴于近期这些事态发展,测试环境的安全性正变得与模型自身的能力同等重要,成为相关讨论的一部分。
