A Anthropic oficialmente lançou o Claude Opus 5.5 na terça-feira, o primeiro modelo da família Claude 5.5 da empresa. O modelo mais recente apresenta um grande salto no desempenho em programação agentiva, usando menos tokens, e é apresentado como um "trabalhador" autônomo mais capaz. A Anthropic também afirmou que o Opus 5.5 reduz os custos por tarefa em 40% em comparação com o Opus 5.
Em uma tarefa que normalmente levaria semanas para uma equipe de engenharia, a Anthropic afirmou que um testador concluiu uma migração de código com 680.000 linhas em menos de um dia.
"O Claude Opus 5.5 é nosso primeiro lançamento desde que defendemos um ritmo mais cauteloso para o avanço da fronteira tecnológica", afirmou a empresa em um comunicado. "Antes do lançamento, ele foi testado por avaliadores externos, incluindo a Frontier Design e a METR. Em nossa auditoria comportamental automatizada, o teste de alinhamento mais abrangente que realizamos, o Opus 5.5 é o modelo com melhor desempenho que testamos até hoje. Ele também conta com as proteções que desenvolvemos para nossos modelos mais capazes."
O preço de destaque da API do Opus 5.5 também é menor que o de seu antecessor. A Anthropic está reduzindo o custo dos tokens de entrada de US$ 5 para US$ 4 por milhão de tokens e dos tokens de saída de US$ 25 para US$ 20 por milhão de tokens. Isso representa uma redução de 20% nos preços de entrada e saída, antes de considerar a economia adicional decorrente do uso de menos tokens para concluir tarefas, afirmou a empresa.
O Opus 5.5 lidera os benchmarks citados pela Anthropic para programação agentiva, incluindo Terminal-Bench, FrontierCode e CursorBench. Em um teste inicial, o modelo trabalhou de forma autônoma por mais de 18 horas em seis repositórios de código, enquanto outros testes mostraram que ele consegue fazer análises financeiras, criar modelos e apresentações no Excel e realizar pesquisas. A Anthropic afirmou que 16 de 18 relatórios internos de pesquisa atingiram seu limite de qualidade, contra nenhum no caso do Opus 5 ou do Fable 5.1.
A empresa alertou que as diferenças entre benchmarks estão se tornando menos confiáveis nesse nível de capacidade e afirmou que a diferença no mundo real entre o Opus 5.5 e o Fable 5.1 é menor do que sugerem os números dos benchmarks.
A empresa afirmou que o Claude Sonnet 5.5 e o Claude Haiku 5.5 serão lançados nas próximas semanas.
A estreia do Opus 5.5 ocorre enquanto o setor de IA como um todo continua enfrentando reações negativas do público após a publicação de um ex-pesquisador de que a IA poderia destruir a humanidade nos próximos 10 anos.
Na semana passada, a Anthropic publicou uma estrutura de transparência para IA enquanto o CEO Dario Amodei defendia uma desaceleração em todo o setor. Na segunda-feira, a OpenAI afirmou que os EUA deveriam liderar uma estrutura global para IA diante do aumento das preocupações com segurança.
