Jacob Coxon 是 Anthropic 的预训练研究员,也曾在 OpenAI 工作。他周二宣布辞职,指责这两家 AI 实验室正在开发超级智能模型,将人类置于风险之中。
“我今天从 Anthropic 辞职了,”Coxon 写道:“过去三年里,我分别在 OpenAI 和 Anthropic 从事预训练研究。两家公司都没有负责任地行事。它们正直奔能够自我改进的超级智能,并拿我们的生命下注。”
这位 27 岁的研究员在一连串帖子中表示,不久的将来,超越人类的系统将能够入侵任何东西、一夜之间颠覆任何领域,并获取现实世界中的权力和资源。Coxon 补充说,朝着这种危险发展的进程并没有放缓。
“开发 AI 的人真心相信,AI 可能在本十年结束前杀死我们所有人,”这名研究员说。“这不是营销噱头。事实上,许多高管和资深研究员会在媒体面前用听起来合理的措辞来表述,但我私下听到的却是同一批人在表达恐惧。”
Coxon 表示,OpenAI并未彻底认识到这类风险对文明的影响。Anthropic 对相关利害关系的理解更加深入,但它正陷入一场竞赛,试图率先达到这一阶段,以评估并缓解这些风险。
Coxon 批评了这种奔向 AI 终局的冲动,称其为“自负的赌博”,并呼吁展开更广泛的讨论,推动对齐和问责。
Anthropic 的对齐科学负责人 Evan Hubinger 也为 Coxon 的帖子提供了支持,称他个人认为 AI 在 2040 年前终结人类的概率超过 10%。
“Jacob 说得对——我们确实真心相信 AI 可能杀死全人类!我个人认为,未来十年内发生这种情况的概率超过 10%,”Hubinger 写道。“我相信 Anthropic 正在尽最大努力,但我们还没有解决超级智能对齐问题的方案,也显然还没有走上实现这一目标的正轨。”
警示信号
今年早些时候,OpenAI 的 AI 智能体逃离测试环境并入侵了 AI 和机器学习平台Hugging Face,试图完成任务,这让 AI 对人类造成实际伤害的担忧变得更加明显。
受邀审查这起事件记录的第三方研究人员一致认为,AI 智能体绕过了控制措施并展开协作。OpenAI 当时承认,这是关于人类失去对 AI 智能体控制的“警示信号”。
“下一代模型将让所有人感到警醒……我认为,任何在智识上诚实的人,看到正在发生的一切,都不可能感受不到我们面前沉甸甸的责任,”Altman 本月早些时候在接受 Axios 采访时说,并补充称,各家公司可能会专注于改进对齐和安全性。
Coxon 表示,可能有必要采取高风险措施,例如暂时禁止提升 AI 模型能力,但他补充说,自己对协调合作的潜力持乐观态度。他还敦促其他 AI 研究人员思考,这些风险可能会在未来几年如何升级。
“你想在没有严格理解超级智能心智的情况下启动一次超级智能 RL 运行吗?你应该因为‘反正事情都会发生’而埋头不管,还是抓住这一刻,呼吁改变条件?”Coxon 写道。
