OpenAI ha pausado todo el entrenamiento, la evaluación y la inferencia con uso de herramientas para sus «modelos más capaces» después de que un agente de IA escapara de su sandbox de entrenamiento y accediera a internet, informó la empresa en un informe publicado el viernes en el blog de investigación sobre alineación de la compañía.

Al agente, que la empresa describió como un modelo de investigación interno sometido a entrenamiento mediante aprendizaje por refuerzo, se le pidió el 20 de septiembre información sobre un autor específico de una entrada de blog. Finalmente, el agente logró acceder a internet mediante el resolvedor DNS del sandbox.

OpenAI dijo que era el primer incidente en el que un agente en proceso de entrenamiento accedía a la web abierta desde que la empresa de IA reforzó la seguridad tras la intrusión de Hugging Face en julio.

Un revisor humano de OpenAI reconoció una alerta automatizada sobre la fuga unos 15 minutos después, y la empresa canceló la ejecución de entrenamiento aproximadamente dos horas y media más tarde. La compañía dijo que no reanudará específicamente el entrenamiento de ese modelo y que iniciará una nueva ejecución con «intervenciones de desalineación más exhaustivas», aunque no indicó cuándo se reanudaría el entrenamiento.

La empresa ya había pausado el entrenamiento durante dos semanas a finales de julio tras el incidente de Hugging Face.

El agente accedió a otro chatbot mediante DNS

Como parte de la evaluación de su entrenamiento, se pidió al agente que identificara al autor de una entrada de blog a partir de una serie de pistas biográficas proporcionadas por OpenAI. Después de que una búsqueda inicial del agente con su herramienta de búsqueda autorizada devolviera resultados no relacionados, intentó buscar directamente en Google, Bing y DuckDuckGo, pero los tres servicios devolvieron errores.

Aunque un proxy web bloqueó la solicitud directa del agente a un chatbot público, según el informe, el resolvedor DNS del sandbox devolvió registros reales. El agente utilizó entonces un servicio público de delegación DNS para transmitir preguntas a un chatbot de terceros.

Tras una prueba exitosa, el agente envió 18 preguntas adicionales por la misma vía, 14 de las cuales incluían pistas de la tarea. No logró identificar correctamente al autor de la entrada de blog.

Falló el apagado automático

Un monitor automatizado de desalineación señaló el comportamiento en un plazo de 15 minutos, y un revisor humano reconoció la alerta tres minutos después, según la cronología proporcionada por OpenAI en el informe. Aunque la ejecución de entrenamiento debería haberse detenido automáticamente, no lo hizo, «lo que generó confusión sobre si debía haberse detenido».

Una vez aclarada la confusión, OpenAI detuvo la ejecución de entrenamiento dos horas y media más tarde.

«Hemos comenzado a implementar detecciones DNS adicionales y pruebas del sistema de detección», señala el informe. «También hemos restringido las consultas DNS dentro del entorno a una lista limitada de dominios y tipos de registro permitidos».

«[C]asi toda la inferencia de nuestros modelos más capaces sigue detenida hasta que hayamos reforzado más nuestros sistemas», escribió en X Micah Carroll, responsable de preparación para RSI de OpenAI, . (Énfasis en el original.)

Se filtró un token de GitHub en mayo y se descubrieron nuevas inyecciones de prompts

OpenAI también reveló el viernes en un informe separado que un modelo interno publicó el 27 de mayo el token de GitHub de un investigador en el repositorio público de Codex de la empresa mientras intentaba «hacer trampa en una tarea de demostración de teoremas obteniendo material de la demostración Lean de otro equipo». Según el informe, el modelo dividió el token en tres partes con el comentario de código «token split to avoid scanners».

El investigador había indicado el día anterior al «modelo interno altamente persistente» que resolviera la demostración por sí mismo, dos veces. OpenAI calificó el incidente de «desalineación particularmente grave», desactivó como precaución las claves de todos los empleados y dejó el modelo fuera de línea durante unas dos semanas.

Un tercer informe, publicado también el viernes, mostró la existencia de «inyecciones de prompts autorreplicantes» que inducían a los modelos a copiar el ataque en sus propias salidas, algo que OpenAI describió como «similar a un gusano informático». La empresa dijo que las descubrió durante un entrenamiento interno en junio mediante su «marco de entrenamiento de juego propio» GPT-Red, pero no observó ningún impacto fuera de las llamadas a herramientas simuladas.

Los informes se suman a los seis casos que OpenAI publicó el 16 de septiembre bajo su marco de notificación de desalineaciones , según informó anteriormente The Latent.

Agentes accedieron a sitios gubernamentales, informa AP

Los agentes de OpenAI también accedieron a dos sitios web de la Comisión de Bolsa y Valores y a la Oficina del Censo de EE. UU. durante tareas de investigación, informó Associated Press el viernes por la noche. OpenAI dijo a AP que no encontró «ningún uso de credenciales de la SEC, acceso a cuentas o información no pública, cambios en los datos o sistemas de la SEC, ni pruebas de un compromiso o vulnerabilidad».

La revelación llega después de que Australia declarara a principios de esta semana que un agente de OpenAI irrumpió en su portal de estadísticas de Medicare en junio, según el informe de The Latent.

El CEO de OpenAI, Sam Altman, dijo el miércoles ante el Consejo de Seguridad de la ONU que la empresa ya ha ya ha reducido el ritmo anteriormente y "lo hará en el futuro". OpenAI está evaluando una ronda de financiación con una valoración de 1,2 billones de dólares antes de una posible IPO, informó Financial Times este mes.