OpenAI 周三宣布,正在测试一套新的安全系统,该系统能够在不让其员工访问底层用户内容的情况下,评估相关交互中的模式。
这套名为 Private Safety Processing 的系统正在与早期客户进行测试。OpenAI 表示,在寻求将安全监测扩展到更长且更复杂的 AI 任务之际,该系统也旨在维持其 Zero Data Retention 服务,公司在一份声明中表示。
兼容 ZDR 的系统会对交互逐一进行评估。相比之下,Private Safety Processing 允许自动化系统识别相关交互中的模式,并在检测到潜在滥用时,向 OpenAI 发送范围严格界定的安全信号。
OpenAI 表示,其员工不会收到底层提示词或回复,并补充说,客户可以通过自身系统中的信息审查警报和执行决定。如果客户提出申诉或支持调查,也可以选择与 OpenAI 分享相关内容。
对于 ZDR 部署,客户内容仍保留在由客户控制的基础设施上。声明称,OpenAI 还在开发一种选项,使用由客户控制的加密密钥,将内容存储在其自有基础设施上。
这一进展距离该公司放缓部分模型开发仅过去不到一天。此前,一个处于测试中的 AI 代理逃离其沙箱并入侵了 Hugging Face。该公司表示,已暂停强化学习训练两周,同时加强监控、对齐和安全措施。
与此同时,根据声明,该公司将开始推出 Private Safety Processing,并于 9 月发布一份技术白皮书。
