Anthropic a officiellement lancé Claude Opus 5.5 mardi, premier modèle de la famille Claude 5.5 de l’entreprise. Le nouveau modèle affiche un bond majeur en matière de performances de programmation agentique tout en utilisant moins de tokens, et se présente comme un « travailleur » autonome plus performant. Anthropic a également déclaré qu’Opus 5.5 réduisait les coûts par tâche de 40 % par rapport à Opus 5.
Alors qu’une équipe d’ingénierie aurait normalement mis des semaines, Anthropic a déclaré qu’un testeur avait réalisé une migration de code de 680,000 lignes en moins d’une journée.
« Claude Opus 5.5 est notre premier lancement depuis que nous avons appelé à ralentir la course aux limites de l’IA », a déclaré l’entreprise dans un communiqué. « Il a été testé avant son lancement par des évaluateurs externes, notamment Frontier Design et METR. Lors de notre audit comportemental automatisé, le test d’alignement le plus complet que nous réalisons, Opus 5.5 est le modèle affichant les meilleures performances parmi ceux que nous avons testés à ce jour. Il intègre également les garde-fous que nous avons développés pour nos modèles les plus performants. »
Le tarif affiché de l’API d’Opus 5.5 est également inférieur à celui de son prédécesseur. Anthropic réduit le coût des tokens d’entrée de 5 $ à 4 $ par million de tokens, et celui des tokens de sortie de 25 $ à 20 $ par million de tokens. Cela représente une baisse de 20 % des tarifs d’entrée comme de sortie, sans compter les économies supplémentaires liées à l’utilisation d’un nombre inférieur de tokens pour accomplir les tâches, a indiqué l’entreprise.
Opus 5.5 arrive en tête des benchmarks cités par Anthropic pour la programmation agentique, notamment Terminal-Bench, FrontierCode et CursorBench. Lors d’un test préliminaire, le modèle a travaillé de manière autonome pendant plus de 18 heures sur six dépôts de code, tandis que d’autres tests ont montré qu’il pouvait effectuer des analyses financières, créer des modèles et des présentations Excel, et mener des recherches. Anthropic a déclaré que 16 de ses 18 rapports de recherche internes avaient atteint son seuil de qualité, contre aucun pour Opus 5 ou Fable 5.1.
Anthropic a toutefois averti que les écarts entre les benchmarks devenaient moins fiables à ce niveau de capacités, et a déclaré que l’écart observé dans le monde réel entre Opus 5.5 et Fable 5.1 était plus réduit que ne le laissaient penser les chiffres des benchmarks.
L’entreprise a déclaré que Claude Sonnet 5.5 et Claude Haiku 5.5 suivraient dans les prochaines semaines.
Le lancement d’Opus 5.5 intervient alors que le monde de l’IA dans son ensemble continue de subir un retour de bâton public après la publication d’un ancien chercheur affirmant qu’elle pourrait détruire l’humanité au cours des 10 prochaines années.
La semaine dernière, Anthropic a publié un cadre de transparence pour l’IA, alors que son PDG Dario Amodei appelait à un ralentissement à l’échelle du secteur. Lundi, OpenAI a déclaré que les États-Unis devraient prendre la tête de l’élaboration d’un cadre mondial pour l’IA, alors que les inquiétudes en matière de sécurité augmentent.
