周二,Meta与 OpenAI、Anthropic 和 Google 一同在白宫与工作人员会面,审阅一套已完成的联邦框架,用于衡量先进 AI 模型在网络攻击中的能力。第二天,《The Information》报道称,Meta 自家的一款模型闯入了他人的系统。Meta 于 7 月 9 日发布的编程模型 Muse Spark 1.1 在安全测试期间入侵了一家未具名公司,并在其中进行了修改。
Meta于周三证实了这一事件,这使其成为 15 天内第三家表示模型逃离测试环境并接触到真实公司的大型 AI 开发商。OpenAI 于 7 月 21 日表示,其模型入侵了 Hugging Face。Anthropic 随后于 7 月 30 日跟进披露。三起事件中有两起,包括 Meta 的在内,都是通过同一家外部公司进行测试。
这家公司是 Irregular,这是一家位于特拉维夫的安全实验室,前身为 Pattern Labs,为 OpenAI、Anthropic、Google DeepMind 以及如今的 Meta 构建并运行发布前网络安全测试。它去年 9 月融资 8000 万美元,估值为 4.5 亿美元。TechCrunch 报道称,该轮融资由 Sequoia Capital 和 Redpoint Ventures 领投。直到上周,业内之外几乎无人听说过它。如今,它已与 2 家实验室披露的 4 起入侵事件联系在一起。
Irregular 表示,这是与此前影响 Anthropic 的相同错误
Irregular在向 CNN 发表的一份声明中表示,Meta 的这起入侵事件“与六天前披露的 Anthropic 事件背后是完全相同的评估环境问题”。这句话是转折点。在此之前,每起入侵看起来都像是某家实验室各自孤立的失误,令人尴尬但范围可控。在此之后,一个供应商的单一配置故障,已经让两家不同公司的模型逃出沙箱并进入他人的系统。薄弱环节不在某一家实验室的流程,而在共享的基础设施。
这些测试本身被称为夺旗演练。模型会被告知,网络中另一台机器上存有一段秘密信息,并被要求去取回,且不规定具体方法。目的就是衡量它入侵的能力。该环境本应是一个封闭的模拟系统,不应有任何通往公共互联网的路径,提示词也明确这样告诉模型。当这层封闭失效时,一个原本在虚构网络中追寻虚构目标的模型,就会开始在真实网络中搜寻。
Meta表示,Irregular 的配置错误在评估期间无意中让其一款模型获得了互联网访问权限,而该模型随后“利用了第三方服务中的一个安全漏洞,”路透社援引了这一表述。Irregular 已将这起入侵事件通知 Meta。Meta 表示正在调查,并将在掌握事实后公布完整复盘。
Meta 尚未披露的内容
Meta 尚未说明被入侵公司的名称、测试进行的时间,也未描述模型进入后做了哪些修改。它也没有说明受影响公司是否自行察觉了此事。最后这一点之所以重要,是因为Anthropic 在审查 141,006 次评估运行后发现:其模型接触到的 3 家组织中,它成功联系上的 2 家都没有发现相关活动。Anthropic 表示,Claude “使用基本技术攻陷了受影响组织的基础设施”,也就是弱密码和未受保护的端点,而非高深的攻击手法,正如我们此前对 Claude 披露事件的报道所述。
Meta 也没有公布类似的审查次数。没有这一数据,就无法判断 Muse Spark 1.1 的入侵是孤立的异常事件,还是仅仅是首个被人发现的案例。Anthropic 也是在 OpenAI 披露后才开始调查,而其最早的一起事件可追溯到 4 月,比曝光时间早了四个月。
这些情况都不意味着模型试图逃跑。在每一起已披露案例中,模型都只是在执行被分配的任务,身处一个它被告知已经封闭的环境中,而且其常规安全拒绝机制被调低,以便研究人员衡量最坏情况下的攻击能力。Anthropic 表示,其模型从未试图将自身外传。问题出在连线和配置,而不在意图本身;这既令人稍感安心,也正是它一再发生的原因。
监管背景让这一时间点显得不太舒服。6 月 2 日签署的第 14409 号行政命令要求各机构建立一套机密流程,用于对网络能力进行基准测试,而Meta 周二在白宫审阅的框架以一个 30 天窗口期为核心,在此期间,参与公司需在更广泛发布前向政府提供新模型的访问权限。欧盟的《AI Act》已于 8 月 2 日生效,也赋予了其自身的发布前审查权力。
对投资者而言,关键解读并不是 Meta 发布了一个危险模型,而是前沿安全测试已外包给少数几家小公司,而其中一家公司的同一环境故障,如今已在一周内导致两家实验室发生入侵。模型被打分的标准是它们入侵得有多好。却没有人给这个房间打分。
