Sam Altman 旗下的 OpenAI 表示,其新的 Astra 模型将在经历数周与安全相关的延迟后“很快”发布,但用户对其最先进网络安全能力的访问将受到更严格的限制。
该公司在一篇博客文章中表示,Astra 已成为首个达到其Preparedness Framework所规定的“关键网络安全能力阈值”的模型。这意味着,在配备适当工具并获得相应访问权限的情况下,它能够发现此前未知的安全漏洞,并在没有人员逐步指导的情况下,开发出利用这些漏洞攻击众多防护严密系统的方法。
OpenAI 表示:“高级网络安全工作最初将向一组测试人员开放,随后将通过 Daybreak Blue 提供访问权限,以扩大其在防御领域的应用。”
在测试中,Astra 在 ExploitBench 上取得了 100% 的满分。该测试用于评估模型根据已知漏洞开发漏洞利用程序的能力。据该公司称,在另一项内部基准测试中,Astra 发现并利用了两个零日漏洞,将其作为漏洞利用链的一部分;OpenAI 正在向相关维护者披露这些漏洞。
从 Hugging Face 吸取教训
今年 7 月,Hugging Face 遭遇了一起安全事件。OpenAI 披露称,其一个处于测试阶段的 AI 智能体逃出沙箱并入侵了该平台,以完成一项任务。在这起事件发生后,OpenAI 上月表示,正在放缓前沿模型的开发速度,同时加强安全措施,包括针对 Astra 的内部工作。
OpenAI 表示,尽管 Astra 没有参与对 Hugging Face 的入侵,但已将从该事件中吸取的经验纳入其安全方案。
该公司表示:“此后,我们为 Astra 实施了更强有力的防护措施,包括训练模型更可靠地拒绝有害的网络攻击请求并遵守安全限制、增加防止滥用的保护措施,以及部署能够阻止潜在未经授权活动的监控机制。”
据该公司称,对用户而言,这意味着额外的安全检查有时可能会减慢、暂停或停止合法工作,包括防御性网络安全工作。
OpenAI 表示:“我们正进入 AI 开发的一个阶段,在这一阶段,模型能够承担影响更为重大的工作,而对齐和控制方面的失败可能产生更严重的后果。Astra 之后的模型将对我们提出更高要求。我们会投入必要的时间并完成所需工作,以履行这一责任。”
