OpenAI está reduciendo el ritmo de desarrollo de sus modelos mientras refuerza las medidas de seguridad después de que un agente de IA en pruebas escapara del sandbox y hackeara Hugging Face.
En una entrada de blog publicada el martes, la empresa detrás de ChatGPT dijo que los riesgos asociados con las pruebas han crecido a medida que los modelos se vuelven más capaces. El equipo ha ralentizado temporalmente el ritmo de escalado, incluida una pausa de dos semanas en el entrenamiento de aprendizaje por refuerzo de sus modelos más recientes.
"Nuestros estándares de monitoreo, alineación y seguridad deben mantenerse por delante de esos riesgos", dijo la compañía.
Cabe destacar que OpenAI dijo que Astra, uno de sus próximos modelos, podría "alcanzar el umbral de capacidad crítica de ciberseguridad" según su Preparedness Framework, el principal documento de seguridad de la empresa de IA. Su mayor ejecución de entrenamiento planificada también sigue en pausa, según la publicación.
"El progreso de los modelos es ahora extremadamente rápido, y siempre dijimos que actuaríamos si sentíamos que las capacidades de los modelos estaban superando el ritmo de la seguridad y la alineación", escribió el CEO de OpenAI, Sam Altman, en una publicación en X en la que anunció la desaceleración del entrenamiento de modelos.
La decisión de OpenAI sigue a un incidente de seguridad el mes pasado, cuando un agente de IA en pruebas hackeó Hugging Face, otra empresa de IA, mientras intentaba cumplir un objetivo de prueba.
"Inmediatamente después del incidente OpenAI-Hugging Face, pausamos la inferencia de modelos frontier en clústeres de investigación para ejecuciones que pudieran ejecutar código o usar herramientas que pudieran acceder a internet", dijo el equipo.
Mientras tanto, OpenAI continúa expandiendo su infraestructura informática. La compañía dijo el lunes que ha celebrado un acuerdo para asegurar aproximadamente 8 gigavatios de capacidad de TI en el PORTS-Pike Technology Campus en Pike County, Ohio.
