在有关前沿AI模型网络能力的问题成为讨论焦点之际,报道称,上月底的一次测试中,OpenAI的一个代理“突破了隔离”,入侵了开源AI平台Hugging Face,试图寻找基准测试的答案。令一些观察人士担忧的是,如果模型无法再被可靠地限制在测试环境内,这类事件可能很快会成为常态。

这并非OpenAI独有的问题;Anthropic本周四公布了其自身网络安全测试的全面审查结果。在据报告进行的141,006次运行中,该公司发现有3次测试中,其旗舰Claude模型能够访问开放互联网,尽管它们最初处于封闭环境中。

与Hugging Face事件非常相似,这些模型成功访问了3个组织的系统。当这家AI公司本周一通知其中两个组织遭到入侵时,两者都不知道曾发生过此类事件。

模型如何突破隔离

就Claude而言,最初的突破源于人为错误,而非复杂的漏洞利用。其测试环境在设置期间配置错误,导致机器仍连接到互联网。相比之下,OpenAI的模型通过发现测试环境软件中的一个未知漏洞实现了突破。

同样,这两个模型在进入开放互联网后的行动方式也有所不同。OpenAI代理在Hugging Face的系统内执行了17,600项操作,探查薄弱环节。而Claude则依靠猜测弱密码并利用未受保护的端点。

针对自身安全防护的失效,该公司表示,测试环境应遵循“与模型开发中使用的任何其他系统相同的安全标准”。

事件复盘

据报道,在漏洞利用发生时,Claude将这些真实目标系统视为据报道,在漏洞利用发生时,Claude将这些真实目标系统视为测试游戏的一部分,因为它认为自己没有连接到互联网。在正常测试中,模型会在沙箱内对模拟的公司网络发起操作。当沙箱的防护屏障意外失效时,模型转而直接攻击真实网站。

在一次事件中,一个尚未发布的内部模型搜索其被分配的虚构目标,但未能找到。随后,它扫描了大约另外9,000个系统,最终利用一个暴露的调试页面入侵了一家公司的Web应用。有趣的是,在此案例中,该模型最终意识到自己的目标是一家真实公司,并停止了攻击。

这些内置安全防护并不总能有效发挥作用。在另一次测试中,Claude Opus 4.7被要求入侵一个与真实公司同名的虚构网站。在找不到模拟目标后,该模型最终将目标转向真实公司,并闯入了一个数据库。在4次运行中,该模型反复意识到目标是真实的,却仍然继续行动,认为这个真实网站一定是测试的一部分。

最后一起事件涉及Mythos 5,这是Claude的最新版本,于6月向受信任的合作伙伴发布。测试环境中隐藏的指令要求开发者安装一个虚构的Python软件包,模型对此决定自行编写一个。

随后,它成功将该软件包发布到公共软件包注册表PyPI上,几乎所有Python开发者都会使用该注册表。该软件包在该网站上公开存在了大约1小时,并在15台真实机器上运行。其中一台机器属于一家安全公司,该公司运行该软件包后将其凭据暴露给了Mythos。

Anthropic目前正与外部评估机构METR洽谈,以对每起事件进行独立审计。

立法者如何应对

需要注意的是,在内部测试期间,施加于面向消费者模型的安全防护通常会被关闭;Anthropic称,使用其公开发布的模型时,这些攻击会被拦截。这也是为什么Hugging Face事件曝光后,有报道称Claude Opus和Fable拒绝协助该公司的数字取证工作,因为它们无法区分撰写攻击复盘报告与策划攻击本身。

在OpenAI遭到入侵后,立法者已经开始推动立法,以应对AI网络安全威胁和失控模型。参议员Mark Warner提出了一项强制发布前国家安全测试的提案,而《AI紧急关闭开关法案》将赋予国土安全部关闭危险或发生故障模型的权力。