Investigadores de la firma de seguridad Hacktron AI usaron Claude, de Anthropic, para ayudar a descubrir vulnerabilidades y obtener acceso a varias cuentas de ChatGPT de empleados de OpenAI. Desde una de estas cuentas, el equipo demostró que podía acceder a los repositorios internos de software del laboratorio de IA.
Tres investigadores —Harsh Jaiswal, Mohan Pedhapati y Rahul Maini— dijeron que obtuvieron ejecución remota de código (RCE) y acceso administrativo al entorno Discourse del foro comunitario de OpenAI el 25 de julio, que utilizaron para explotar una falla en el sistema de identidad.
Esto permitió que una sesión comprometida del foro tomara el control de las cuentas de ChatGPT y Codex. Una de esas cuentas comprometidas tenía Codex conectado a GitHub.
"Para demostrar el impacto práctico de la vulnerabilidad, creamos una solicitud de incorporación de cambios de prueba inofensiva en el monorepositorio interno de OpenAI", explicó el equipo.
Los investigadores usaron específicamente Claude para examinar cómo el foro comunitario procesaba las cargas de imágenes HEIC y HEIF y para escribir un exploit dirigido a un error en el flujo de carga de imágenes. Aunque Opus 4.8 no pudo producir un exploit fiable, los investigadores dijeron que Opus 5 logró producir uno en un entorno de prueba en unas pocas horas. Todo el proceso, desde el descubrimiento inicial hasta el acceso al repositorio, tomó menos de 72 horas.
"Hasta hace dos meses, cualquier usuario o empleado de OpenAI que iniciara sesión en el propio foro de ayuda de OpenAI podía haber sufrido la toma de control de sus cuentas de ChatGPT y Codex", escribieron los investigadores en su informe. "Dado que las personas pueden conectar varios servicios a Codex y ChatGPT, el alcance de lo que teóricamente podíamos haber obtenido era enorme, incluidos GitHub, Slack y los correos electrónicos."
Los investigadores de Hacktron AI informaron de la vulnerabilidad a OpenAI y Discourse, y recibieron una recompensa de 6.500 dólares por el hallazgo relacionado con OpenAI. OpenAI confirmó al equipo que el error había sido corregido, aproximadamente 14 horas después del informe. Discourse también corrigió el error en los días siguientes.
La seguridad debe «ponerse al día»
Este descubrimiento se produce en un momento en que el desarrollo de la IA ha reducido drásticamente el costo de lanzar un exploit de seguridad serio.
"Esto no fue un hackeo completamente autónomo y la orientación de personas con experiencia siguió siendo importante, pero la cantidad de trabajo que un equipo pequeño podía realizar aumentó drásticamente", señaló el equipo.
El equipo de Hacktron AI afirmó que los supuestos de seguridad "deben ponerse al día" con las capacidades de los atacantes, ya que la IA ha eliminado la capa de complejidad de la seguridad en línea que antes requería conocimientos especializados poco comunes y mucho tiempo para vulnerarla.
"Un modelo de amenazas realista debería tener en cuenta la economía de la explotación actual, en lugar de basarse en supuestos obsoletos sobre quién puede llevar a cabo ataques sofisticados", afirmó el equipo.
