Una prueba de seguridad de IA ha dejado al descubierto una deficiencia en las medidas de seguridad que protegen los modelos Kimi de Moonshot frente a solicitudes relacionadas con armas biológicas y asesinatos.

Mindgard, que prueba la existencia de vulnerabilidades en sistemas de IA, dijo a la BBC que sus investigadores hicieron jailbreak a Kimi K2.6 y K3 Swarm en julio y lograron que ambos modelos proporcionaran instrucciones sobre esos temas. El proceso consiste en introducir en un modelo de IA una cadena de instrucciones complejas para comprobar si eludirá los límites de seguridad establecidos por sus desarrolladores.

La empresa dijo que envió un correo electrónico a Moonshot sobre las vulnerabilidades el 27 de julio, hizo un seguimiento aproximadamente una semana después y publicó un blog el 12 de septiembre. Según Mindgard, Moonshot no se puso en contacto hasta hace poco, después de que la BBC pidiera comentarios a la empresa.

Moonshot dijo a la BBC que acogía con satisfacción el escrutinio externo «como un pilar clave para construir una IA mejor y más segura» y señaló que estaba analizando los hallazgos con Mindgard. En un correo electrónico enviado a Mindgard y compartido con la BBC, el desarrollador chino dijo que, en las evaluaciones internas, su modelo había mostrado en general «una alta tasa de rechazo para este tipo de solicitudes».

«Una vez que el jailbreak funciona, hablará de cualquier tema, incluso ofrecerá libremente recomendaciones sobre otros temas que también son nefastos, y será ingenioso y creativo», declaró a la BBC Peter Garraghan, fundador de Mindgard, en el programa Tech Life del Servicio Mundial de la BBC.

Mindgard no ha demostrado que las instrucciones sobre armas y asesinatos fueran a funcionar realmente. La empresa sostiene que las barreras de seguridad deberían haber impedido que los modelos interactuaran con esas solicitudes. También afirmó estar convencida de que un Kimi K2.6 sometido a jailbreak podría permitir a los hackers ejecutar código en sus recursos informáticos y conectarse a internet, lo que lo convertiría en una posible plataforma de lanzamiento para ciberataques.

El desarrollo se produce después de revelaciones recientes relacionadas con agentes de IA de varios grandes desarrolladores. Google dijo que Gemini accedió a tres empresas durante pruebas de seguridad realizadas en mayo, mientras que funcionarios australianos dijeron que un agente de OpenAI accedió a archivos públicos y no públicos de un portal gubernamental de salud en junio.

Kimi es un modelo de pesos abiertos, lo que significa que los usuarios pueden ejecutarlo en su propia infraestructura informática. Alan Woodward, profesor de la Universidad de Surrey, dijo a la BBC que estos modelos podrían acabar en las manos equivocadas, pero también podrían utilizarse para la ciberdefensa.

Interés de búsqueda en chat de IA

Interés de búsqueda en chat de IA

  • ChatGPT
  • Claude
  • Gemini
  • DeepSeek
  • Perplexity
  • Grok
  • Kimi
  • Qwen
FUENTE: Google Trends vía The Latent