Anthropic ha publicado un nuevo marco diseñado para hacer un seguimiento de la velocidad a la que la IA se está desarrollando a sí misma y de la eficacia con la que se supervisa a los agentes de IA, mientras el CEO Dario Amodei presiona para lograr una desaceleración en toda la industria.
En una publicación de blog publicada el jueves, Anthropic describió tres mediciones que abarcan cuánto de su investigación y desarrollo de IA realiza la propia IA, cómo se supervisa a los agentes y cómo se asigna la capacidad de computación.
"Mientras el mundo considera cómo marcar el ritmo de la frontera tecnológica, deberíamos hacer todo lo posible para minimizar la brecha entre lo que saben los laboratorios punteros y lo que sabe el público", afirmó la empresa en una publicación independiente en X. "Esto implica medir mejor el desarrollo de la IA, publicar nuestros hallazgos y dar a la sociedad la oportunidad de decidir cómo utilizar esta información."
La empresa afirmó que planea integrar evaluadores externos con acceso a sistemas y datos internos comparables a los que utilizan sus propios equipos de evaluación de riesgos.
I+D liderada por IA
Cabe destacar que Anthropic informó que Claude "lidera" el 26% del trabajo de I+D de IA de la empresa en agosto de 2026, frente al 25% en julio y el 14% en junio, lo que indica que el modelo de IA puede completar la mayor parte de una tarea "de principio a fin a partir de una instrucción de alto nivel", mientras el ser humano supervisa.
La empresa señaló que más del 90% de su trabajo de I+D de IA ahora implica la colaboración de la IA con humanos o va más allá de ella.
En cuanto a la segunda métrica, Anthropic afirmó que en agosto ejecutaba aproximadamente 30.000 agentes de IA que realizaban trabajos de investigación e ingeniería en un momento dado en su plataforma interna más utilizada. La empresa indicó que todas las acciones de los agentes pasaban por un sistema de supervisión automatizado.
En concreto, de más de 1.000 millones de decisiones, sus supervisores en línea bloquearon el 0,002% de las acciones —aproximadamente 1 de cada 47.000—. Los supervisores fuera de línea también señalaron para una revisión adicional entre uno y dos de cada 1.000 registros.
La empresa afirmó que, de unas 100.000 alertas semanales, alrededor de 50 casos prioritarios fueron escalados. Según la publicación, estas acciones bloqueadas deben someterse a una revisión humana en el plazo de una semana.
Asignación de computación
Anthropic también supervisa cómo se divide la computación entre el trabajo de seguridad y otras actividades de I+D.
La empresa afirmó que examinó su uso total de computación durante una semana de referencia, del 13 al 20 de julio. Aproximadamente el 6% de la computación utilizada para la I+D de IA se destinó a la seguridad, mientras que cerca del 12% de la computación utilizada para la I+D de IA impulsada por IA se destinó a la seguridad.
El desarrollador de Claude también señaló que publicó el marco como un prototipo de transparencia para toda la industria. "Esperamos dar ejemplo de esa transparencia mediante la publicación de estas mediciones, y seguiremos haciéndolo", afirmó la empresa.
El último marco de Anthropic llegó después de que el CEO Dario Amodei pidiera ralentizar el ritmo del desarrollo de la IA de frontera durante el fin de semana, citando el aumento de los riesgos de seguridad. Sam Altman, de OpenAI, Demis Hassabis, de Google DeepMind, y el fundador de xAI, Elon Musk, también expresaron preocupaciones similares o respaldaron la idea.
De forma similar, OpenAI publicó un nuevo marco el miércoles para informar sobre la desalineación de los modelos de IA y reveló seis informes de casos de comportamiento no intencionado en modelos que el equipo ha documentado durante los últimos seis meses.
"Los ejemplos de desalineación pueden ayudar a identificar problemas que otros desarrolladores de IA podrían encontrar cuando sus sistemas alcancen capacidades similares, revelar debilidades en las salvaguardas o cuestionar las suposiciones sobre el comportamiento de los modelos", escribió OpenAI. "Compartir estos hallazgos permite a otros investigar los mismos problemas, poner a prueba nuestras explicaciones y mejorar las medidas de mitigación."
