Anthropic은 화요일 공식적으로 Claude Opus 5.5를 출시했다. 이 모델은 이 회사의 Claude 5.5 제품군 중 첫 번째 모델이다. 최신 모델은 더 적은 토큰을 사용하면서 에이전트형 코딩 성능을 크게 향상했으며, 더욱 뛰어난 자율형 "작업자"로 포지셔닝되고 있다. Anthropic은 또한 Opus 5.5가 Opus 5에 비해 작업 단위 비용을 40% 낮춘다고 밝혔다.

일반적으로 엔지니어링 팀이 몇 주에 걸쳐 수행했을 작업을 Anthropic은 한 테스터가 68만 줄의 코드 마이그레이션을 하루도 안 돼 완료했다고 밝혔다.

"Claude Opus 5.5는 우리가 최첨단 기술 개발 속도 조절을 촉구한 이후 처음으로 출시하는 모델입니다"라고 회사는 보도자료에서 밝혔다. "출시에 앞서 Frontier Design과 METR을 비롯한 외부 평가 기관이 테스트를 진행했습니다. 우리가 수행하는 가장 포괄적인 정렬 테스트인 자동화 행동 감사에서 Opus 5.5는 지금까지 테스트한 모델 중 가장 뛰어난 성능을 보였습니다. 또한 가장 성능이 뛰어난 모델을 위해 개발한 안전장치도 적용됐습니다."

Opus 5.5의 주요 API 가격도 이전 모델보다 낮아졌다. Anthropic은 입력 토큰 가격을 100만 토큰당 $5에서 $4로, 출력 토큰 가격을 100만 토큰당 $25에서 $20로 인하한다. 회사는 작업 완료에 필요한 토큰 수가 줄어들면서 발생하는 추가 절감 효과를 제외하고도 입력 및 출력 가격이 각각 20% 인하된 것이라고 밝혔다.

Opus 5.5는 Terminal-Bench, FrontierCode, CursorBench 등 Anthropic이 제시한 에이전트형 코딩 벤치마크에서 선두를 기록했다. 초기 테스트 중 하나에서는 이 모델이 6개 코드 저장소에서 18시간 넘게 자율적으로 작업했으며, 다른 테스트에서는 금융 분석을 수행하고 Excel 모델과 프레젠테이션을 제작하며 조사를 진행할 수 있는 것으로 나타났다. Anthropic은 내부 연구 보고서 18건 중 16건이 품질 기준을 충족했으며, Opus 5와 Fable 5.1에서는 한 건도 없었다고 밝혔다.

Anthropic Quarterly Revenue

Anthropic Quarterly Revenue

SOURCE: The Latent

Anthropic은 이 수준의 성능에서는 벤치마크 간 차이가 점점 신뢰하기 어려워지고 있다며, Opus 5.5와 Fable 5.1의 실제 성능 격차는 벤치마크 수치가 시사하는 것보다 좁다고 밝혔다.

회사는 Claude Sonnet 5.5와 Claude Haiku 5.5도 앞으로 몇 주 안에 출시할 예정이라고 밝혔다.

Opus 5.5의 출시는 한 전직 연구원이 앞으로 10년 안에 인류를 멸망시킬 수 있다고 주장한 게시물로 인해 AI 업계 전반이 대중의 역풍에 계속 직면하는 가운데 이뤄졌다.

지난주 Anthropic은 CEO Dario Amodei가 업계 전반의 속도 조절을 촉구한 가운데 AI 투명성 프레임워크를 공개했다. 월요일에는 OpenAI가 밝혔다 안전에 대한 우려가 커지는 가운데 미국이 글로벌 AI 프레임워크를 주도해야 한다고.