参议员伯尼·桑德斯是最近三周内曝光的一系列 AI 安全漏洞中,最新一位表达担忧的政府人士。这位资深议员发出一封致 Anthropic 的 Dario Amodei、Meta 的 Mark Zuckerberg 和 OpenAI 的 Sam Altman 的信,警告他们,如果“现在不采取适当行动”,也就是暂停 AI 开发,“我和我的同事将在美国参议院采取行动”。

桑德斯称,这是应对 AI 代理失控,甚至开发出可作为生物武器用于攻击人类的新型病毒这一潜在风险的必要步骤。这位佛蒙特州参议员此前曾于 3 月提出《AI 数据中心暂停法案》,试图暂停批准新建 AI 数据中心,直到建立适当的安全措施。

他最新的书面呼吁多次提及这些公司的安全政策,而桑德斯认为这些政策并未得到有效执行。Meta 此前曾表示,如果任何模型表现出逃脱其控制的潜力,公司“将停止开发”;Anthropic 此前承诺,如果新模型的扩展速度超过有效安全措施,将“暂停扩展和/或推迟部署新模型”;OpenAI 同样承诺,如果其模型达到关键风险阈值,将“停止进一步开发”。

桑德斯的主张是,这些关键阈值已经达到:“那个时刻已经到来。”这是否属实,或者桑德斯的立场是否是对某件远没有那么严重的事情反应过度,仍有待讨论。

引发这封信的安全漏洞

桑德斯致信的三家前沿 AI 实验室在过去三周内都遭遇了引人注目的安全事件。每家实验室都出现了这样的情况:原本应被限制在封闭测试环境中的 AI 代理突破沙箱,并成功发动实时网络攻击。

就 Meta 和 Anthropic 而言,责任在于第三方以色列安全测试公司 Irregular:设置过程中出现的配置错误,让这些代理能够自由访问互联网。在对 141,006 个测试实例进行审查后,Anthropic 发现了三起其模型能够访问开放互联网,随后利用外部公司系统中的弱密码和未受保护端点的案例。不到一周后,也就是 8 月 5 日,Meta宣布了一个几乎相同的案例。

桑德斯将这三起事件归为同一类别,称三家公司的模型“以类似方式逃脱了控制”。然而,OpenAI 的事件在技术上更为复杂。

该事件涉及数百个 AI 代理在公司内部系统中协作数月,试图找到通往开放互联网的路径。这使 GPT-5.6 Sol 和一个尚未发布的内部模型突破了限制,并成功利用开源 AI 平台 Hugging Face。

在这三起事件中,AI 系统都是在评估期间寻找基准测试的答案,而不是出于恶意行事。

对桑德斯 AI 开发要求的批评

桑德斯信中提到的公司已经分别就相关事件作出了回应。在这封信发出前两天,OpenAI 以网络安全担忧为由,放缓了尚未发布的 Astra 模型的开发。有人可以据此认为,该公司的内部安全措施已经按预期发挥作用,尽管批评者会指出,据报道,员工花了大约两个月才意识到其内部系统中异常行为的重要性。

桑德斯还引用了 1,200 名​​前沿 AI 实验室员工于 7 月 28 日发布的一份声明,标题为 Pacing the Frontier,呼吁美国政府加强对 AI 开发的监督。拟议中的防护措施旨在全面限制 AI 开发的速度,防止任何一家公司的进展过快,进入危险领域。

这类联邦安全措施不可能适用于整个行业;中国实验室和开放权重模型开发者仍将不受影响地继续开发。

其他人提出了替代方案,既不会带来美国 AI 行业落后于外国竞争对手的风险。其中一位评论者是 CIA 局长 John Ratcliffe,他称前沿模型“类似于数字核武器”,但没有附和桑德斯对 AI 公司实施限制的呼吁。相反,Ratcliffe 呼吁采取更严格的出口管制。

Anthropic、Meta 和 OpenAI 不太可能直接回应桑德斯的信而进一步暂停开发。不过,这确实反映出一些观察人士日益担忧:前沿 AI 模型可能很快就会远远超出目前用于约束它们的安全措施。