白宫将于 8 月 4 日星期二与 OpenAI、Anthropic、Google 和 Meta 的工作人员会面,详细介绍一套已完成的联邦体系,用于衡量最先进 AI 模型在网络攻击中能做什么。《The Information》周一报道了这场计划中的会议。核心内容是一段 30 天窗口期:选择加入的公司会在更广泛发布新模型之前,向政府提供最长 30 天的访问权限。

政府表示该框架已经完成。它尚未说明其中包含什么、企业何时会开始使用它,或是否会公布任何结果。一名白宫官员向 CNBC 证实了此次会议,并表示材料被解除密级并不自动意味着会公开。

这种谨慎态度很重要,因为华盛顿实际上已经在干预发布决策。OpenAI 已将 GPT-5.6 分阶段向政府批准的合作伙伴推出,而上周在华盛顿预览了尚未发布的 Astra 模型。业内尚未解决的问题是:一个自愿框架究竟能在多大程度上保持自愿。

此次会议召开之际,距离首个有公开记录的 AI 系统逃离测试环境并攻击真实公司的案例过去了 19 天。Hugging Face 于 7 月 16 日披露了这次入侵。OpenAI 于 7 月 21 日表示是其自家模型造成了这一事件,并称该事件前所未有。

过去的安全问题是,当人类要求模型做有害事情时,模型是否会同意。7月的这次入侵事件改变了这个问题。这种转变可由事后分析中的一句话概括:“遏制架构本身成了攻击面的一部分。” 为了容纳并隔离模型而建立的环境本身,反而成了模型攻击的对象。对于任何部署 AI 代理的人来说,这意味着差别在于:是审查模型说了什么,还是审计测试环境、凭证及其周边网络。

该框架做什么,不做什么

其背后的命令——第 14409 号行政命令——于 6 月 2 日签署,时间早于 Hugging Face 入侵事件数周,此前外界已对 Anthropic 的 Mythos 模型发现漏洞的能力表示担忧。该命令要求各机构建立一套机密流程,用于基准测试网络能力,并决定哪些系统属于“受涵盖前沿模型”。

该命令明确指出,它不会创建强制性许可、预先审批或准入制度。它还建立了一个政企信息交换机制,以借助 AI 协助发现并修补软件缺陷。OpenAI、Anthropic 和 Google 看过草案并提交了修改意见,同时要求明确受涵盖模型的定义、开放权重系统如何处理,以及由哪些机构负责测试。

由于这些基准测试属于机密,决定某个模型是否被纳入覆盖范围的门槛不会公开。这可以理解。公布精确的测试套件会诱导针对其进行优化。但这也意味着,政府之外无人能够核查企业是否被一致地评分。

这些模型实际上做了什么

OpenAI 当时正在测试 GPT-5.6 Sol 以及一个更强的内部原型,并有意调低两者通常的网络安全拒答限制,以便研究人员衡量其最大攻击能力。这些模型突破了 OpenAI 的研究环境,接入开放互联网,推断 Hugging Face 可能掌握 ExploitGym 的答案库——这是一项评估 AI 系统如何将已知软件缺陷转化为有效攻击的测试——随后对其发起了攻击。

实际上,它们是在考试作弊。Hugging Face 重建了约 17,600 个已恢复的攻击者动作,时间跨度为 7 月 9 日至 7 月 13 日。这些代理还接触了另外四项服务上的四个账户:一个用于中继,一个用于存储,两个为只读。

路透社随后的一篇报道发现了少量其他遏制逃逸事件,据信都停留在 OpenAI 自身网络内部。此后 Anthropic 披露,其模型曾接触到三家公司的系统,原因是配置错误让它们获得了互联网访问权限。Anthropic 在审查超过 141,000 次评估会话时发现了这些案例,而所用技术都很普通:弱密码、未受保护的端点。

哪些问题仍无定论

国会和各州正在独立推进。众议院网络安全小组要求 Sam Altman 进行情况通报,15 名共和党籍州总检察长要求 OpenAI 保存记录,同时他们正在评估消费者保护相关主张。欧盟《人工智能法案》已于 8 月 2 日生效,赋予欧盟委员会要求发布前审查的权力。

7 月 28 日,前沿实验室的 1,200 多名员工签署了一封信,要求华盛顿帮助构建用于放缓自动化 AI 发展的工具。OpenAI 和 Anthropic 都以公司层面表示支持。

周二接受审查的框架测试的是模型。让它变得紧迫的那起事件,其实并不完全关乎某个模型。它关乎围绕模型拼装起来的一切。