OpenAI发布了AI训练安全指南,表示开发者应在任何前沿强化学习训练运行继续之前,准备结构化的安全文档。

在周一的一篇博客文章中,这家ChatGPT开发商写道,公司正在制定一个框架,将相关实践编纂成规范,要求在AI训练开始前准备好“安全论证”文档。

OpenAI指出,这类安全论证应涵盖技术栈的三个领域:对齐训练、遏制和监控。

该团队表示:“这些安全措施有助于确保模型不会尝试采取不对齐的行动;即便它采取了此类行动,也难以突破遏制机制;同时,监控系统能够在造成伤害前发现问题。”

具体而言,对齐训练旨在阻止不对齐行为。这将包括审查训练环境、调整评分器、进行离线评估,以及根据过去发生的事件开展回测。

与此同时,遏制措施旨在限制潜在损害。OpenAI提议采用强化安全的沙盒环境——配备多层基础设施安全防护——并利用训练检查点对这些环境进行红队测试。该措施还将限制样本之间的通信。

监控则旨在尽早发现不对齐行动,并通过召回率目标、新的评估数据点和快速警报提供支持。

Frontier Model Releases per Month by Lab

Frontier Model Releases per Month by Lab

  • OpenAI
  • Google
  • Anthropic
  • xAI
  • Meta AI
  • NVIDIA
  • Z.ai
  • Other
SOURCE: Epoch AI — Frontier AI Models

安全担忧

OpenAI发布安全指南的同一天,公司表示已取消原定于10月发布的GPT-6.1 Astra,原因是存在安全担忧。

OpenAI安全系统负责人Saachi Jain周一在向The Latent提供的一份声明中表示,任何涉及安全和对齐的事项“都存在权衡”。

Jain表示:“尽管[GPT-6.1 Astra]在模型惰性等方面有所改进,但在遵守工作范围和授权,以及向用户说明其完成的工作类型等方面,它还没有完全达到要求。”

安全已成为围绕前沿AI训练讨论的重要组成部分。上周,OpenAI首席执行官Sam Altman和Anthropic首席执行官Dario Amodei都在联合国大会上发言,呼吁在负责任的AI开发方面加强协调。

Altman在活动上表示:“我们过去曾单方面放慢步伐。未来我们也会这样做。竞争中击败其他公司,并不是做出草率决定的理由。”

与此同时,Anthropic计划在IPO招股说明书中提醒投资者训练前沿AI模型所涉及的风险。路透社周一报道称,这家Claude开发商警告称,AI可能对“人类构成灾难性或生存性风险”,尤其是在先进AI模型表现出“自我保护行为”的情况下。