Anthropic 发布了一项新框架,用于追踪 AI 自我构建的速度以及 AI 智能体受到监督的程度;与此同时,CEO Dario Amodei 正推动全行业放缓步伐。

在一篇博客文章中,Anthropic 周四概述了三项衡量指标,涵盖其 AI 研发中由 AI 完成的比例、智能体受到监控的情况,以及计算能力的分配方式。

公司在另一篇 X帖子中表示:“当全世界都在考虑如何控制前沿技术的发展速度时,我们应尽一切可能,缩小前沿实验室所知与公众所知之间的差距。这意味着更好地衡量 AI 的发展、发布我们的研究结果,并让社会有机会决定如何使用这些信息。”

公司表示,计划让第三方评估人员接入内部系统和数据,其访问权限将与公司自身风险评估团队所使用的权限相当。

View on X

AI 主导的研发

值得注意的是,Anthropic 报告称,截至 2026 年 8 月,Claude “主导”了公司 26% 的 AI 研发工作,高于 7 月的 25% 和 6 月的 14%。这表明,该 AI 模型可以在人工监督下,根据“高层级提示词”端到端完成一项任务的大部分工作。

公司指出,目前公司超过 90% 的 AI 研发工作都涉及 AI 与人类协作,或由 AI 独立完成。

关于第二项指标,Anthropic 表示,截至 8 月,其最常用的内部平台在任何给定时间大约运行着 30,000 个从事研究和工程工作的 AI 智能体。公司称,所有智能体的操作都会经过自动化监控系统。

具体而言,在超过 10 亿次决策中,其在线监控系统拦截了 0.002% 的操作,即大约每 47,000 次中拦截 1 次。离线监控系统还标记了每 1,000 份记录中的 1 至 2 份,以便进一步审查。

公司表示,在每周约 100,000 个标记中,大约有 50 个高优先级案例被升级处理。根据这篇文章,这类被拦截的操作应在一周内接受人工审查。

计算资源分配

Anthropic 还在监控计算资源如何在安全工作和其他研发工作之间分配。

公司表示,研究了 7 月 13 日至 7 月 20 日这一周的总计算资源使用情况。在 AI 研发所使用的计算资源中,约 6% 被分配给安全工作;而在 AI 驱动的 AI 研发所使用的计算资源中,约 12% 用于安全工作。

这家 Claude 开发商还指出,它发布这一框架是为了将其作为全行业透明度的原型。公司表示:“我们希望通过发布这些衡量结果来树立透明度的典范,并将继续这样做。”

Anthropic 的最新框架发布之前,CEO Dario Amodei 在周末呼吁放缓前沿 AI 的开发速度,并称安全风险正在加剧。OpenAI 的 Sam Altman、Google DeepMind 的 Demis Hassabis 以及 xAI 创始人 Elon Musk 也表达了类似担忧,或支持这一想法。

OpenAI vs. Anthropic Revenue Run Rate

OpenAI vs. Anthropic Revenue Run Rate

  • OpenAI
  • Anthropic
SOURCE: The Latent

同样,OpenAI 于周三发布了一项新框架,用于报告 AI 模型的失准问题,并披露了团队在过去 6 个月中记录的模型意外行为的 6 份案例报告。

OpenAI 写道:“失准案例有助于识别其他 AI 开发者在其系统达到类似能力时可能遇到的问题,揭示安全防护措施中的薄弱环节,或挑战人们对模型行为的假设。分享这些发现可以让其他人调查同样的问题、检验我们的解释,并改进缓解措施。”