在一名处于测试中的 AI 智能体逃出沙盒并入侵 Hugging Face 后,OpenAI 正在放慢模型开发步伐,同时加强安全措施。
在周二发布的一篇博客文章中,这家 ChatGPT 背后的公司表示,随着模型能力增强,与测试相关的风险也在增加。团队已暂时放缓扩展速度,其中包括将其最新模型的强化学习训练暂停两周。
该公司表示:“我们在监控、对齐和安全方面的标准必须始终领先于这些风险。”
值得注意的是,OpenAI 表示,其即将推出的模型之一 Astra 可能会根据其《准备框架》,这是这家 AI 公司的主要安全文件。根据该文章,其计划中的最大规模训练也仍被搁置。
OpenAI 首席执行官 Sam Altman 在 X 上发布的一则帖子中写道:“模型进展现在极其迅速,而我们一直都说过,如果我们感觉模型能力的提升速度超过了安全与对齐的进展速度,我们就会采取行动。”
OpenAI 的这一举措发生在上个月一起安全事件之后:一名处于测试中的 AI 智能体在试图完成测试目标时,入侵了另一家 AI 公司 Hugging Face。
团队表示:“在 OpenAI-Hugging Face 事件发生后,我们立即暂停了研究集群中那些可能执行代码或使用可访问互联网工具的运行的前沿模型推理。”
与此同时,OpenAI 继续扩展其计算基础设施。该公司周一表示,已达成协议,锁定俄亥俄州派克县 PORTS-Pike Technology Campus 约 8 吉瓦的 IT 容量。
