Anthropic presentó oficialmente Claude Opus 5.5 el martes, el primer modelo de la familia Claude 5.5 de la empresa. El modelo más reciente ofrece un gran salto en rendimiento de programación autónoma basada en agentes, al tiempo que utiliza menos tokens, y se presenta como un «trabajador» autónomo más capaz. Anthropic también afirmó que Opus 5.5 reduce los costos por tarea en un 40% frente a Opus 5.
En un trabajo que normalmente habría requerido semanas a un equipo de ingeniería, Anthropic afirmó que un evaluador completó la migración de 680.000 líneas de código en menos de un día.
«Claude Opus 5.5 es nuestro primer lanzamiento desde que pedimos moderar el avance de la frontera tecnológica», afirmó la empresa en un comunicado. «Fue probado antes de su lanzamiento por evaluadores externos, incluidos Frontier Design y METR. En nuestra auditoría conductual automatizada, la prueba de alineación más exhaustiva que realizamos, Opus 5.5 es el modelo con mejor rendimiento que hemos probado hasta la fecha. También incluye las medidas de protección que hemos desarrollado para nuestros modelos más capaces».
El precio de referencia de la API de Opus 5.5 también es inferior al de su predecesor. Anthropic reducirá el costo de los tokens de entrada de $5 a $4 por millón de tokens y el de los tokens de salida de $25 a $20 por millón de tokens. Esto representa una reducción del 20% tanto en el precio de entrada como en el de salida, sin contar el ahorro adicional derivado del uso de menos tokens para completar las tareas, afirmó la empresa.
Opus 5.5 encabeza las pruebas de referencia citadas por Anthropic para la programación autónoma basada en agentes, incluidas Terminal-Bench, FrontierCode y CursorBench. En una prueba preliminar, el modelo trabajó de forma autónoma durante más de 18 horas en seis repositorios de código, mientras que otras pruebas demostraron que podía realizar análisis financieros, crear modelos y presentaciones de Excel y llevar a cabo investigaciones. Anthropic afirmó que 16 de 18 informes de investigación internos superaron su umbral de calidad, mientras que ninguno lo hizo con Opus 5 ni con Fable 5.1.Fable 5.1.
Anthropic advirtió que las diferencias entre las pruebas de referencia son cada vez menos fiables en este nivel de capacidad y afirmó que la diferencia en el mundo real entre Opus 5.5 y Fable 5.1 es menor de lo que sugieren sus resultados.
La empresa afirmó que Claude Sonnet 5.5 y Claude Haiku 5.5 llegarán en las próximas semanas.
El debut de Opus 5.5 se produce mientras el mundo de la IA en general sigue lidiando con la reacción pública adversa después de que un antiguo investigador publicara que podría destruir a la humanidad en los próximos 10 años.
La semana pasada, Anthropic publicó un marco de transparencia para la IA, mientras su director ejecutivo, Dario Amodei, pedía una ralentización en toda la industria. El lunes, OpenAI afirmó que EE. UU. debería liderar un marco global para la IA ante el aumento de las preocupaciones sobre la seguridad.
