El modelo de IA Gemini de Google hackeó a tres empresas mientras se sometía a pruebas en mayo, según reconoció la compañía el viernes tras un informe del Wall Street Journal.
Google afirma que Gemini detuvo sus ataques cuando se dio cuenta de que había entrado en los sistemas de empresas reales. No obstante, las intrusiones suman a Google a la lista de desarrolladores de IA cuyas evaluaciones de seguridad se han extendido más allá de los objetivos previstos, después de revelaciones similares sobre incidentes de hackeo relacionados con agentes de IA desarrollados por OpenAI, Anthropic y Meta.
Irregular, el laboratorio de seguridad que llevaba a cabo las pruebas de IA, había creado empresas simuladas para que los modelos las atacaran. Sin embargo, el entorno de pruebas permitió inadvertidamente que los modelos accedieran a internet abierta. El Journal informó que al menos uno de los nombres de empresas ficticias utilizados en los ejercicios de Irregular también pertenecía a una empresa real.
Gemini entró en el sistema de una empresa mediante un ataque de fuerza bruta, probando contraseñas hasta encontrar la correcta. Según el informe del Journal, obtuvo acceso a otras dos utilizando credenciales que encontró en repositorios públicos.
Google afirmó que no consideró necesario revelar públicamente las intrusiones porque no causaron daños aparentes a las empresas.
También hubo un lapso entre las pruebas y el momento en que Google se enteró de lo ocurrido. Irregular afirmó que informó a los laboratorios pertinentes a finales de julio, mientras que la vicepresidenta de ingeniería de seguridad de Google, Heather Adkins, declaró a Reuters que se había notificado a las tres empresas atacadas y que Google trabajó con su socio de pruebas para modificar sus procedimientos.
Irregular afirmó que el problema era el mismo que había intervenido en incidentes que afectaron a otros laboratorios de IA. Todos los problemas conocidos de su parte se habían resuelto semanas antes, declaró un portavoz a Reuters.
Las versiones de esos incidentes varían. En su investigación sobre la intrusión en Hugging Face de OpenAI, METR descubrió que unos 700 agentes participaron en un ataque coordinado a través de un tablón de mensajes no autorizado y que llegaron a desarrollar comunicaciones de tipo sectario entre varios agentes. La versión de Google sobre el ataque de Gemini describe un modelo que confundió sistemas reales con objetivos de prueba y se detuvo después de descubrir el error.
