Anthropicは火曜日、同社のClaude 5.5ファミリー初のモデルとなるClaude Opus 5.5を正式にリリースした。今回の最新モデルは、より少ないトークンでエージェント型コーディングの性能を大幅に向上させ、より高性能な自律型「ワーカー」として位置付けられている。Anthropicはまた、Opus 5.5のタスク単位のコストがOpus 5と比べて40%低下すると説明した。
通常ならエンジニアリングチームで数週間かかる作業だが、Anthropicによると、あるテスターは68万行のコード移行を1日未満で完了した。
「Claude Opus 5.5は、私たちが最先端技術の進展を抑制するよう求めて以来、初めてのリリースです」と同社はリリースで述べた。「リリース前には、Frontier DesignやMETRを含む外部評価者によるテストを実施しました。私たちが行う最も包括的なアラインメントテストである自動行動監査では、Opus 5.5はこれまでにテストしたモデルの中で最高の性能を示しました。また、最も高性能なモデル向けに開発した安全対策も備えています」
Opus 5.5のAPIの標準価格も、前モデルより安くなっている。Anthropicは入力トークンのコストを100万トークンあたり5ドルから4ドルに、出力トークンを100万トークンあたり25ドルから20ドルに引き下げる。同社によると、これは、タスク完了に必要なトークン数が少ないことによる追加の節約を考慮する前の段階で、入力と出力の価格がそれぞれ20%低下することを意味する。
Opus 5.5は、Terminal-Bench、FrontierCode、CursorBenchなど、Anthropicが挙げるエージェント型コーディングのベンチマークで首位に立っている。初期テストの1つでは、このモデルは6つのコードリポジトリにまたがって18時間以上自律的に作業した。また別のテストでは、財務分析やExcelモデルとプレゼンテーションの作成、調査が可能であることが示された。Anthropicによると、社内の研究報告書18本のうち16本が品質基準を満たしたのに対し、Opus 5やFable 5.1では1本も基準を満たさなかった。
Anthropicは、この性能レベルではベンチマーク間の差が信頼性を失いつつあると注意を促し、実世界におけるOpus 5.5とFable 5.1の差は、ベンチマークの数値が示すほど大きくないと述べた。
同社によると、Claude Sonnet 5.5とClaude Haiku 5.5は今後数週間以内に続いて登場する。
Opus 5.5の登場は、元研究者の投稿が今後10年以内に人類を滅ぼす可能性があると指摘したことを受け、AI業界全体が世論の反発への対応を続ける中で実現した。
先週、AnthropicはAIの透明性に関する枠組みを公開した。CEOのDario Amodei氏が業界全体に開発ペースの減速を求める中、月曜日には、OpenAIが安全性への懸念が高まる中、米国は世界的なAI枠組みを主導すべきだと述べた。
