Um teste de segurança de IA expôs uma brecha nas salvaguardas que protegem os modelos Kimi, da Moonshot, contra solicitações envolvendo armas biológicas e assassinatos.

A Mindgard, que testa sistemas de IA em busca de vulnerabilidades, disse à BBC que seus pesquisadores fizeram jailbreak no Kimi K2.6 e no K3 Swarm em julho, fazendo com que os dois modelos fornecessem orientações sobre esses temas. O processo envolve alimentar um modelo de IA com uma cadeia de instruções complexas para testar se ele contornará os limites de segurança definidos por seus desenvolvedores.

A empresa afirmou que enviou um e-mail à Moonshot sobre as vulnerabilidades em 27 de julho, fez um acompanhamento cerca de uma semana depois e publicou um blog em 12 de setembro. Segundo a Mindgard, a Moonshot só entrou em contato recentemente, depois que a BBC pediu um comentário à empresa.

A Moonshot disse à BBC que recebia bem a análise externa "como um pilar fundamental para construir uma IA melhor e mais segura" e afirmou estar discutindo as descobertas com a Mindgard. Em um e-mail enviado à Mindgard e compartilhado com a BBC, a desenvolvedora chinesa disse que seu modelo havia apresentado, em geral, "uma alta taxa de recusa para esse tipo de solicitação" em avaliações internas.

"Quando o jailbreak funciona, ele fala sobre qualquer tema, chega a oferecer livremente recomendações sobre outros assuntos que também são nefastos e é inventivo e criativo", disse à BBC World Service, no programa Tech Life, Peter Garraghan, fundador da Mindgard.

A Mindgard não comprovou que as orientações sobre armas e assassinatos realmente funcionariam. A empresa argumenta que as salvaguardas deveriam ter impedido os modelos de sequer se envolverem com esses assuntos. A empresa também afirmou estar confiante de que um Kimi K2.6 submetido a jailbreak poderia permitir que hackers executassem código em seus recursos computacionais e se conectassem à internet, tornando-o um possível ponto de partida para ciberataques.

O desenvolvimento ocorre após divulgações recentes envolvendo agentes de IA de vários grandes desenvolvedores. O Google afirmou que o Gemini acessou três empresas durante testes de segurança em maio, enquanto autoridades australianas disseram que um agente da OpenAI acessou arquivos públicos e não públicos em um portal governamental de saúde em junho.

Kimi é um modelo de pesos abertos, o que significa que os usuários podem executá-lo em sua própria infraestrutura computacional. Alan Woodward, professor da University of Surrey, disse à BBC que esses modelos podem acabar nas mãos erradas, mas também podem ser usados na defesa cibernética.

AI Chat Search Interest

AI Chat Search Interest

  • ChatGPT
  • Claude
  • Gemini
  • DeepSeek
  • Perplexity
  • Grok
  • Kimi
  • Qwen
SOURCE: Google Trends via The Latent