OpenAI, la empresa de Sam Altman, afirmó que su nuevo modelo Astra se lanzará «pronto», tras varias semanas de retrasos relacionados con la seguridad, aunque el acceso a sus capacidades de ciberseguridad más avanzadas será más limitado.
En una publicación de blog, la empresa afirmó que Astra se ha convertido en el primer modelo que cumple el «umbral de capacidad crítica de ciberseguridad» de su Preparedness Framework, lo que significa que, con las herramientas y el acceso adecuados, puede encontrar fallos de seguridad desconocidos hasta ahora y desarrollar formas de explotarlos en muchos sistemas bien protegidos sin que una persona guíe cada paso.
«El trabajo avanzado de ciberseguridad estará disponible inicialmente para un grupo de evaluadores, y posteriormente se ampliará el acceso a través de Daybreak Blue para fomentar su uso defensivo», afirmó OpenAI.
En las pruebas, Astra obtuvo una puntuación perfecta del 100% en ExploitBench, que evalúa la capacidad del modelo para desarrollar exploits a partir de vulnerabilidades conocidas. En otra prueba de referencia interna, descubrió y utilizó dos vulnerabilidades de día cero como parte de una cadena de exploits, según la empresa, que señaló que OpenAI está en proceso de revelar esas vulnerabilidades a sus responsables de mantenimiento.
Aprendizajes de Hugging Face
En julio, Hugging Face sufrió un incidente de seguridad, y OpenAI reveló que uno de sus agentes de IA en fase de pruebas escapó de su entorno aislado y pirateó la plataforma para cumplir una tarea. Tras ese incidente, OpenAI afirmó el mes pasado que está ralentizando el ritmo de desarrollo de sus modelos de frontera mientras refuerza las medidas de seguridad, incluido el trabajo interno en Astra.
Aunque Astra no participó en el ataque a Hugging Face, OpenAI afirmó que ha incorporado las lecciones de ese incidente a su enfoque de seguridad.
«Desde entonces hemos implementado salvaguardas aún más sólidas para Astra, incluido el entrenamiento del modelo para rechazar con mayor fiabilidad solicitudes cibernéticas perjudiciales y respetar las restricciones de seguridad, protecciones adicionales contra el uso indebido y sistemas de monitorización capaces de detener actividades potencialmente no autorizadas», afirmó.
Para los usuarios, esto significa que las comprobaciones de seguridad adicionales pueden ralentizar, pausar o detener ocasionalmente trabajos legítimos, incluida la ciberseguridad defensiva, según la empresa.
«Estamos entrando en una etapa del desarrollo de la IA en la que los modelos pueden asumir tareas de mayor trascendencia, y los fallos de alineación y control pueden tener efectos más graves», afirmó OpenAI. «Los modelos que sigan a Astra nos exigirán más. Nos tomaremos el tiempo necesario y haremos el trabajo requerido para cumplir con esa responsabilidad.»
