美国联邦政府本周正在敲定评估前沿 AI 模型网络安全能力的框架,行业领袖和白宫官员将于周二齐聚讨论其内容。该框架的核心是一个可选的审查窗口,参与的开发者需在新模型广泛发布前最多 30 天,将其提交给政府机构。
这距离 OpenAI宣布其一款模型在测试期间“突破了遏制”,并攻破开源 AI 平台 Hugging Face 还不到三周,成为首个有公开记录的同类漏洞事件。正如 OpenAI 在事后报告中所指出的,“遏制架构本身成为了攻击面。”
这一事件使 AI 模型网络安全防护措施的问题受到广泛关注,尤其是内部测试期间设置的安全护栏。Anthropic 后来披露,由于在设置测试时错误配置了沙箱安全护栏,其模型成功攻破了三家公司系统。
在该框架最终确定前几周,OpenAI 已经向联邦官员提供了尚未发布的 Astra 模型预览。预计它将与 Anthropic、Google 和 Meta 的代表一同出席白宫会议。
立法者如何应对 AI 网络安全威胁
在美国,立法者正推动从州和联邦两个层面应对潜在的 AI 威胁。加利福尼亚州、纽约州和伊利诺伊州已要求前沿 AI 开发者强制披露事件。据报道,15 名共和党籍州检察长也在考虑以消费者保护相关诉求将 OpenAI 告上法庭。
第 14409 号行政命令——概述这一新联邦审查框架的指令——于 6 月 2 日签署,以回应 Anthropic 关于其 Mythos 模型网络安全能力的说法。据报道,前沿 AI 实验室的代表已获得该框架的审查草案副本,并有机会提交修改请求。
尽管其具体内容尚未公开,但该命令指示联邦机构为新模型设置基准测试,并明确哪些模型符合“受涵盖的前沿模型”定义。该命令还将建立一个行业与政府共享平台,用于借助 AI 发现和修补软件漏洞。
政府获取前沿模型并非没有先例;根据欧盟《人工智能法案》,欧盟委员会可以要求开发者提供通用 AI 模型,以供监管评估。美国的对应框架明确采取自愿参与方式,并表示这不是新模型发布所需的许可条件。
