OpenAI ha publicado directrices de seguridad para el entrenamiento de IA y afirma que los desarrolladores deben preparar documentación de seguridad estructurada antes de que pueda continuar cualquier ejecución de aprendizaje por refuerzo de IA de frontera.
En una publicación de blog, la empresa creadora de ChatGPT escribió que está trabajando en un marco para codificar prácticas que exijan disponer de documentación de «casos de seguridad» antes de comenzar el entrenamiento de IA.
OpenAI señaló que esos casos de seguridad deberían abarcar tres áreas de la pila tecnológica: entrenamiento de alineación, contención y monitorización.
«Estas salvaguardas ayudan a garantizar que el modelo no intente llevar a cabo acciones desalineadas y que, incluso si lo hiciera, resulte difícil romper la contención y la monitorización lo detecte antes de que pueda producirse algún daño», afirmó el equipo.
En concreto, el entrenamiento de alineación está diseñado para detener comportamientos desalineados. Incluiría revisiones de los entornos de entrenamiento, ajustes de los evaluadores, evaluaciones fuera de línea y pruebas retrospectivas basadas en incidentes pasados.
La contención tiene como objetivo limitar los posibles daños. OpenAI propuso entornos aislados reforzados —con múltiples capas de seguridad de infraestructura—, así como someterlos a ejercicios de red team con puntos de control del entrenamiento. También impondría restricciones a la comunicación entre muestras.
La monitorización, por su parte, pretende detectar pronto las acciones desalineadas, con el apoyo de objetivos de recuperación, nuevos datos puntuales de evaluación y alertas rápidas.
Problemas de seguridad
Las directrices de seguridad de OpenAI se publicaron el mismo día en que la empresa anunció que había cancelado el lanzamiento previsto de GPT-6.1 Astra en octubre por motivos de seguridad.
En una declaración del lunes compartida con The Latent, Saachi Jain, responsable de sistemas de seguridad de OpenAI, afirmó que «existe un equilibrio» en todo lo relacionado con la seguridad y la alineación.
«Aunque [GPT-6.1 Astra] mejoró en aspectos como la pereza del modelo, no alcanzó del todo el nivel requerido en cuanto a mantenerse dentro del alcance y la autorización, ni en la forma en que comunica al usuario el tipo de trabajo que ha realizado», afirmó Jain.
La seguridad se ha convertido en una parte destacada de los debates sobre el entrenamiento de IA de frontera. La semana pasada, el CEO de OpenAI, Sam Altman, y el CEO de Anthropic, Dario Amodei, ambos intervinieron en la Asamblea General de la ONU para pedir una mayor coordinación en el desarrollo responsable de la IA.
«En el pasado hemos reducido unilateralmente el ritmo. Lo volveremos a hacer en el futuro», afirmó Altman en el acto. «Vencer a otras empresas en una carrera competitiva no es motivo para tomar decisiones precipitadas».
Mientras tanto, Anthropic planea advertir a los inversores en el folleto de su salida a bolsa sobre los riesgos asociados al entrenamiento de modelos de IA de frontera, informó Reuters el lunes. La empresa creadora de Claude advierte de que la IA podría plantear «riesgos catastróficos o existenciales para la humanidad», especialmente si los modelos avanzados de IA muestran «comportamientos de autopreservación».
