Anthropic 首席执行官 Dario Amodei 周六在一篇博客文章中呼吁前沿 AI 实验室放缓开发步伐。Amodei 表示,其公司将赋予外部第三方评估员对公司系统的永久性员工级访问权限;OpenAI 首席执行官 Sam Altman 随后表示,他的公司也将采取同样措施。

在一篇题为《我们必须为前沿发展设定节奏》的文章中,Amodei 表示,随着前沿 AI 实验室开始通过瞄准递归式自我改进来大幅加快发展速度——这一过程是指越来越多地使用 AI 模型来研究和开发未来的模型——安全与对齐工作有落后的风险。Amodei 呼吁前沿实验室有意放缓进展速度,而不是冒险引发灾难性后果。

“在过去几个月里,我逐渐确信,要全面应对这些风险,就需要更加审慎——不仅要投资于风险预防,还要控制能力提升的速度,让风险预防有时间跟上,”Amodei 写道。“我们必须放缓提升 AI 模型能力的速度。进展看起来仍会很快,而我们必须明智地利用因此获得的时间。”

Amodei强调,“设定节奏”并不意味着立即停止所有模型训练或技术进步,而是进入一段放缓期,为公司提供更多时间来验证其 AI 是否实现了适当的对齐,并确保这些能力日益增强的系统具备恰当的安全防护。

Amodei 特别提到了OpenAI-Hugging Face 事件:当时,正在接受能力测试的 OpenAI 智能体通过一个秘密留言板进行协调,攻击其指定任务之外的系统,并试图干扰为其表现评分的系统。Amodei 表示,若一群具有类似行为但能力更强的 AI 智能体出现,可能造成灾难性破坏;他警告称,在 6 到 12 个月内,这类系统可能“[通过持续运行的僵尸网络接管整个互联网(可能造成数千亿美元的损失)]”。

永久性外部评估员

Amodei 提出的三步框架始于“嵌入式评估员”,呼吁前沿实验室赋予独立第三方对公司系统的员工级访问权限,使其能够核实安全实践、报告事件,并独立评估正在开发中的模型是否实现对齐。

Amodei 表示,Anthropic 将立即承诺采取这一步骤。评估员将获得公司笔记本电脑、办公场所访问权限,以及大体上与该公司现有内部安全团队相当的权限。评估员还将获准公开报告有关风险、事件和 Anthropic 安全实践的调查结果,且不受公司编辑控制;不过 Amodei 表示,Anthropic 保留限制发布敏感客户信息或受法律特权保护文件的权利。

Amodei 的第二步呼吁民主国家的前沿 AI 公司就一套共同安全标准进行协调,并就限制不受约束的 AI 进展达成一致;为避免反垄断指控,这一过程可能需要政府参与。Amodei 的第三步呼吁最终与包括中国在内的威权国家开展国际协调。他称中国在 AI 开发中取得领先的潜力是“对美国和世界的严重威胁”。

Amodei 认为,美国公司的任何放缓措施也必须保持其相对于中国的技术领先地位,并呼吁继续限制先进芯片出口,加大力度防止其公司在最近的报告中认定的模型蒸馏行为,并更好地防范模型权重被窃取的可能性。模型权重是构成模型知识的大型文件。

Altman、Musk 表示支持

几小时后,Altman 支持放缓发展的想法,并表示 OpenAI 将承诺采取 Amodei 文章中的第一步措施。

“我同意 Dario 的看法,我们需要为前沿发展设定节奏,”Altman在 X 上写道。Altman 补充说,近几周来,放缓发展的争论一直是 OpenAI“讨论的主要议题”。

“承诺让独立评估员获得类似员工的访问权限是个好主意,我们也会这样做,”Altman 写道,并补充说他的公司将“很快”分享更多信息。

上周,OpenAI呼吁国会在“AI 能力超过负责监管它们的机构之前”,为 AI 公司“建立持久的安全防护”。这些防护措施包括独立评估、网络安全要求和事件报告。

Elon Musk 也在 X 上支持 Amodei 的文章,引用了他的帖子并附上三字消息:“Dario 是对的。”Musk 没有详细说明目前由 SpaceX 所有的 xAI 是否会采纳 Anthropic 提出的、在公司内部引入第三方评估员的方案。

Bernie Sanders 参议员也发表了看法。他表示,Amodei、Musk 和 Altman 现在都同意 AI 开发应当放缓,但认为他们提出的方案还不够彻底。

“这是一个开始,但还不够,”桑德斯在 X 上写道。“当你正朝着悬崖飞驰时,你不会只是松开油门。你会踩刹车。”

桑德斯呼吁全面暂停先进 AI 的开发,并禁止人工超级智能,同时敦促美国总统 Donald Trump 和中国国家主席习近平在他们即将举行的 AI 峰会上就这一问题进行谈判,达成一项国际协议。