Este miércoles, The Information informó sobre el último de una oleada de informes sobre modelos de IA de frontera estadounidenses que ejecutaron con éxito ciberataques reales contra empresas reales. Según informes, el modelo de programación de Meta, Muse Spark 1.1, vulneró los sistemas de una empresa no identificada durante unas pruebas realizadas por terceros. Esto ocurre poco después del ataque contra Hugging Face por parte del agente de OpenAI, detectado el 17 de julio, y de la vulneración de tres empresas distintas por parte de Claude, divulgada el 30 de julio.

En el centro de los incidentes de Anthropic y Meta se encuentra la empresa israelí de seguridad Irregular, que llevó a cabo las pruebas en ambos casos. En declaraciones a CNN, el contratista admitió que la vulneración de Meta se debió al «mismo problema exacto del entorno de evaluación» que la de Anthropic menos de una semana antes: según los informes, durante la configuración se establecieron incorrectamente medidas de protección esenciales, lo que dejó los modelos expuestos a internet abierto.

Fallos en el entorno de pruebas permitieron a Muse Spark 1.1 acceder a internet

Los entornos de prueba configurados por Irregular están concebidos para estar completamente aislados: son sistemas cerrados sin conexión a internet. En estos entornos, a los modelos se les asignan ejercicios como pruebas de «captura la bandera», en las que deben recuperar información de otra máquina sin recibir más instrucciones humanas.

Dado que operan en entornos aparentemente sellados, algunas de las medidas de protección habituales implementadas en los modelos públicos se desactivan intencionadamente.

Es importante señalar que, durante la fase de instrucciones, se informa a los agentes que realizan las tareas sobre las limitaciones de su entorno. Durante el ataque de Anthropic, estos agentes reconocieron en ocasiones que se les había concedido accidentalmente acceso a internet abierto, pero razonaron que debía tratarse de una parte prevista del proceso de prueba.

Los ingenieros de pruebas también configuraron algunos objetivos de prueba con los nombres de empresas reales. Esto significó que, una vez conectados a internet, los modelos atacaron a las empresas reales en lugar de a sus equivalentes ficticios. Las vulneraciones exitosas que se produjeron fueron consecuencia de terminales sin protección y credenciales de seguridad débiles, no de ninguna operación compleja por parte de los modelos de IA.

Los primeros informes sugieren que algo similar ocurrió en el incidente de Meta: a Muse Spark 1.1 se le concedió acceso a internet por error y después «explotó una vulnerabilidad de seguridad en un servicio de terceros».

Los detalles siguen siendo escasos, a la espera de un análisis oficial posterior al incidente

Todavía se desconoce qué empresa vulneró el modelo de IA de Meta o si alguna vez se hará pública su identidad. Del mismo modo, los informes actuales no indican si la propia empresa detectó la intrusión o si la divulgación de Meta fue su primer indicio. En el caso de Anthropic, dos de las tres empresas afectadas no detectaron el ataque.

Un portavoz de Meta prometió que la empresa «publicará un análisis retrospectivo completo cuando tengamos todos los datos».

Las conclusiones podrían resultar más relevantes para la empresa de seguridad Irregular que para la propia Meta. Hasta entonces, la empresa era prácticamente desconocida para el público general, incluso después de recaudar 80 millones de dólares el pasado septiembre con una valoración de 450 millones de dólares y conseguir contratos de pruebas previas al lanzamiento con todos los principales laboratorios estadounidenses de IA de frontera. Sin embargo, tras la divulgación de varias vulneraciones en una sola semana, ahora se encuentra en el centro del debate sobre las medidas de protección de la ciberseguridad de la IA en Washington y más allá.

El Gobierno de Estados Unidos publicó el martes su marco de revisión de modelos de frontera, cuyo objetivo es ofrecer a las autoridades federales una vista previa de los nuevos modelos hasta 30 días antes de su lanzamiento generalizado para evaluar sus capacidades cibernéticas. A la luz de estos acontecimientos recientes, la seguridad de los entornos de prueba está adquiriendo tanta importancia en el debate como las propias capacidades de los modelos.