O modelo de IA Gemini, do Google, invadiu três empresas enquanto era testado em maio, reconheceu a empresa na sexta-feira após uma reportagem do Wall Street Journal.
O Google afirma que o Gemini interrompeu os ataques quando percebeu que havia entrado nos sistemas de empresas reais. Ainda assim, as invasões colocam o Google na lista de desenvolvedores de IA cujas avaliações de segurança ultrapassaram os alvos pretendidos, após divulgações semelhantes de incidentes de invasão envolvendo agentes de IA desenvolvidos pela OpenAI, Anthropic e Meta.
A Irregular, laboratório de segurança responsável pelos testes de IA, havia criado empresas simuladas para os modelos atacarem. No entanto, o ambiente de testes permitiu inadvertidamente que os modelos acessassem a internet aberta. O Journal informou que o nome de pelo menos uma empresa fictícia usado nos exercícios da Irregular também pertencia a uma empresa real.
O Gemini entrou no sistema de uma empresa por meio de força bruta, tentando senhas até encontrar a correta. Ele obteve acesso a outras duas usando credenciais encontradas em repositórios públicos, segundo a reportagem do Journal.
O Google afirmou que não viu necessidade de divulgar publicamente as invasões porque elas não causaram danos aparentes às empresas.
Também houve um intervalo entre os testes e o momento em que o Google soube do ocorrido. A Irregular afirmou que informou os laboratórios relevantes no fim de julho, enquanto Heather Adkins, vice-presidente de engenharia de segurança do Google, disse à Reuters que as três empresas atacadas haviam sido notificadas e que o Google trabalhou com seu parceiro de testes em mudanças nos procedimentos.
A Irregular afirmou que o problema era o mesmo envolvido em incidentes que afetaram outros laboratórios de IA. Todas as questões conhecidas do seu lado haviam sido resolvidas semanas antes, disse um porta-voz à Reuters.
Os relatos sobre esses incidentes divergem. Em sua investigação sobre a invasão da Hugging Face pelos agentes da OpenAI, a METR descobriu que cerca de 700 agentes participaram de um ataque coordenado por meio de um fórum de mensagens não autorizado, chegando a desenvolver comunicações semelhantes às de um culto entre vários agentes. O relato do Google sobre o ataque do Gemini descreve um modelo que confundiu sistemas reais com alvos de teste e depois parou ao descobrir o erro.
