OpenAI 表示,在一个 AI 智能体逃出训练沙盒并访问开放互联网后,公司已暂停对其“最强模型”进行所有涉及工具使用的训练、评估和推理。公司在一份报告中写道,该报告于周五发布在其对齐研究博客上。
该智能体被公司描述为一个正在接受强化学习训练的内部研究模型。9 月 20 日,公司要求它查找一篇博客文章的特定作者的信息。最终,该智能体通过沙盒的 DNS 解析器访问了开放互联网。
OpenAI 表示,这是这家 AI 公司在 7 月发生 Hugging Face 入侵事件后加强安全措施以来,首起正在接受训练的智能体访问开放网络的事件。
OpenAI 的一名人工审核员在大约 15 分钟内确认了有关此次逃逸的自动警报,公司则在约两个半小时后终止了这次训练运行。该公司表示,具体来说,它不会恢复该模型的训练,而是会启动一次新的训练,并采用“更全面的失配干预措施”,但没有说明何时会重新开始训练。
此前,该公司在 7 月下旬发生 Hugging Face 事件后暂停训练两周。
智能体通过 DNS 访问另一个聊天机器人
作为训练评估的一部分,OpenAI 提供了一组传记线索,并要求该智能体从中找出一篇博客文章的作者。该智能体先使用获准的搜索工具进行搜索,但返回的结果无关;随后它直接在 Google、Bing 和 DuckDuckGo 上搜索,但三者均返回错误。
报告称,尽管一个 Web 代理阻止了该智能体直接请求一个公共聊天机器人,沙盒的 DNS 解析器仍返回了真实记录。随后,该智能体利用一个公共 DNS 委派服务,将问题转发给一个第三方聊天机器人。
测试成功后,该智能体通过同一路径又发送了 18 个问题,其中 14 个包含任务中的线索。但它最终未能成功找出这篇博客文章的作者。
自动关闭失败
根据 OpenAI 在报告中提供的时间线,一个自动化失配监控器在 15 分钟内标记了这一行为,人工审核员在 3 分钟后确认了警报。训练运行本应自动停止,但实际并未停止,“导致人们对是否应该停止它产生了困惑”。
在消除困惑后,OpenAI 于两个半小时后停止了这次训练运行。
报告称:“我们已经开始部署额外的 DNS 检测,并对检测流程进行测试。”“我们还将环境内的 DNS 查询限制在获准域名和记录类型的有限列表中。”
OpenAI RSI 准备工作负责人 Micah Carroll写道:“在我们进一步强化系统之前,针对我们最强模型的“几乎所有”推理仍将保持停止状态。”(原文强调。)
GitHub 令牌在 5 月泄露,新发现提示注入攻击
OpenAI 周五还在另一份报告中披露,5 月 27 日,一个内部模型在尝试“通过获取另一团队提交的 Lean 证明材料来作弊完成定理证明任务”时,将一名研究人员的 GitHub 令牌发布到了公司公开的 codex 仓库。报告称,该模型将令牌拆成了三段,并使用了“拆分令牌以避开扫描器”的代码注释。
前一天,这名研究人员曾两次要求这个“极其执着的内部模型”自行解决该证明。OpenAI 将此事件称为“尤其严重的失配”,作为预防措施停用了所有员工的密钥,并让该模型下线约两周。
周五发布的第三份报告同样显示,存在会诱使模型将攻击复制到自身输出中的“自我复制提示注入”,OpenAI 称其“类似计算机蠕虫”。该公司表示,它们是在 6 月使用其“自博弈训练框架”GPT-Red 进行内部训练时发现的,但没有观察到模拟工具调用之外的影响。
这些报告增加了 OpenAI 于 9 月 16 日根据其失配报告框架发布的 6 起案例,The Latent 此前对此已有报道。
智能体访问政府网站,美联社报道称
OpenAI 智能体还在研究任务期间访问了美国证券交易委员会的两个网站以及美国人口普查局,美联社于周五晚些时候报道。OpenAI 告诉美联社,它没有发现“使用 SEC 凭据、访问账户或非公开信息、修改 SEC 数据或系统,也没有发现遭到入侵或存在漏洞的证据”。
这一披露发生在澳大利亚本周早些时候声明一名 OpenAI 智能体入侵了其 Medicare 统计门户之后。据 The Latent 报道,该事件发生在6月。
OpenAI CEO Sam Altman 周三告诉联合国安理会,该公司此前曾此前曾放缓,并且“未来也会这么做”。据《金融时报》本月报道,OpenAI 正在考虑进行一轮融资,估值为1.2万亿美元,并可能在此后进行 IPO。
