Anthropic于周二正式发布了Claude Opus 5.5,这是该公司Claude 5.5系列中的首个模型。最新模型在使用更少令牌的同时,智能体编程性能实现大幅跃升,并被定位为能力更强的自主“工作者”。Anthropic还表示,与Opus 5相比,Opus 5.5将任务级成本降低了40%。

Anthropic表示,一名测试人员在不到一天内完成了68万行代码的迁移,而通常情况下,这项工作需要一个工程团队数周时间。

“Claude Opus 5.5是我们呼吁放缓前沿技术推进步伐以来发布的首个模型,”该公司在一份公告中表示。“发布前,外部评估机构已对其进行测试,其中包括Frontier Design和METR。在我们开展的自动化行为审计中——这是我们进行的最全面的对齐测试——Opus 5.5是截至目前表现最强的模型。它还配备了我们为能力最强的模型开发的安全防护措施。”

Opus 5.5的API公开定价也低于上一代产品。Anthropic将输入令牌价格从每百万令牌5美元下调至4美元,将输出令牌价格从每百万令牌25美元下调至20美元。该公司表示,在未计入因使用更少令牌完成任务而产生的额外节省之前,输入和输出价格均已降低20%。

在Terminal-Bench、FrontierCode和CursorBench等Anthropic引用的智能体编程基准测试中,Opus 5.5均处于领先地位。在一项早期测试中,该模型跨六个代码仓库自主工作了超过18小时;其他测试则显示,它能够进行金融分析、构建Excel模型和演示文稿,并开展研究。Anthropic表示,18份内部研究报告中有16份达到了质量门槛,而Opus 5和Fable 5.1一份都没有达到。

Anthropic Quarterly Revenue

Anthropic Quarterly Revenue

SOURCE: The Latent

Anthropic也提醒称,在这一能力水平上,基准测试之间的差异正变得越来越难以作为可靠依据,并表示Opus 5.5与Fable 5.1在现实世界中的差距小于基准测试数据所显示的差距。

该公司表示,Claude Sonnet 5.5和Claude Haiku 5.5将在未来几周内推出。

Opus 5.5的亮相之际,整个AI行业仍在应对一名前研究人员发文引发的公众反弹,该研究人员称Anthropic可能毁灭人类,时间就在未来10年内。

上周,Anthropic发布了一份AI透明度框架,此前其CEO Dario Amodei呼吁整个行业放缓发展步伐。周一,OpenAI表示,在安全担忧不断加剧之际,美国应牵头制定全球AI框架。