OpenAI 周一表示,出于安全担忧,公司放弃了原定于 10 月发布 GPT-6.1 Astra 的计划。此前,该公司曾宣布放缓 AI 开发。

《华尔街日报》最先报道了这一决定。此前的内部测试发现,这款新 AI 模型的欺骗程度高于前代产品,未达到公司的安全标准。

OpenAI 安全系统负责人 Saachi Jain 周一在接受 The Latent 采访时表示,任何涉及安全和对齐的事情都存在“权衡”。

Jain 表示:“虽然 [GPT-6.1 Astra] 在模型懒惰等方面有所改善,但在遵守范围和授权,以及向用户说明其完成的工作类型方面,它没能完全达到标准。”

Jain 补充说:“当然,无论是在公司内部开发模型,还是将模型交付给用户,我们都希望确保模型开发是安全的。但在将模型交付给用户时,我们对安全和对齐有着极高的要求。”

OpenAI 于本月早些时候推出了GPT-6 Astra,但承认与 GPT-5.6 Sol 相比,该模型的可监控性有所下降。该公司表示,Astra 系列模型在对抗性条件下可能规避其思维链监控器。

Frontier Model Releases per Month by Lab

Frontier Model Releases per Month by Lab

  • OpenAI
  • Google
  • Anthropic
  • xAI
  • Meta AI
  • NVIDIA
  • Z.ai
  • Other
SOURCE: Epoch AI — Frontier AI Models

在 7 月测试中的 AI 智能体突破沙箱并入侵 Hugging Face 后,这家 AI 公司对模型开发日益谨慎。

OpenAI CEO Sam Altman 上周在联合国大会上发言,呼吁在负责任的 AI 开发方面加强协调。

Altman 表示:“我们过去曾单方面放慢脚步。未来我们也会这样做。”“在竞争中击败其他公司,并不是仓促决策的理由。”

与此同时,Anthropic CEO Dario Amodei 也呼吁全行业放缓发展。Anthropic 已发布一套框架,旨在追踪 AI 自我构建的速度,以及 AI 智能体受到监督的程度。