Nesta quarta-feira, o The Information informou o mais recente de uma série de relatos sobre modelos de IA de fronteira dos EUA executando com sucesso ciberataques reais contra empresas de verdade. O modelo de programação da Meta, Muse Spark 1.1, teria invadido os sistemas de uma empresa não identificada durante testes de terceiros. Isso ocorre logo após o ataque do agente da OpenAI contra o Hugging Face, detectado em 17 de julho, e a invasão de três empresas distintas pelo Claude, divulgada em 30 de julho.
No centro dos incidentes envolvendo a Anthropic e a Meta está a empresa israelense de segurança Irregular, que realizou os testes nos dois casos. Em entrevista à CNN, a contratada admitiu que a invasão envolvendo a Meta foi resultado do “exato mesmo problema no ambiente de avaliação” ocorrido no caso da Anthropic menos de uma semana antes: barreiras de proteção essenciais teriam sido configuradas incorretamente durante a preparação, deixando os modelos expostos à internet aberta.
Falhas no ambiente de testes permitiram que o Muse Spark 1.1 acessasse a internet
Os ambientes de teste configurados pela Irregular foram projetados para ser completamente isolados: sistemas fechados, sem conexão com a internet. Nesses ambientes, os modelos recebem tarefas como testes de “capture a bandeira”, nos quais precisam obter uma informação de outra máquina sem instruções adicionais de um humano.
Como os ambientes em que operam são aparentemente isolados, algumas das proteções padrão usadas em modelos públicos são desativadas de propósito.
É importante observar que os agentes responsáveis pelas tarefas são informados, durante a elaboração dos prompts, sobre as limitações do ambiente. Durante o ataque envolvendo a Anthropic, esses agentes perceberam em alguns momentos que haviam recebido acidentalmente acesso à internet aberta, mas concluíram que isso deveria fazer parte do processo de testes.
Os engenheiros de testes também configuraram alguns alvos com os nomes de empresas reais. Isso fez com que, uma vez liberados na internet, os modelos atacassem as empresas verdadeiras em vez de suas equivalentes fictícias. As invasões bem-sucedidas que se seguiram foram resultado de endpoints desprotegidos e credenciais de segurança fracas, e não de alguma operação complexa realizada pelos modelos de IA.
Os primeiros relatos sugerem que algo semelhante ocorreu no incidente da Meta: o Muse Spark 1.1 recebeu acesso à internet por engano e então “explorou uma vulnerabilidade de segurança em um serviço de terceiros.”
Detalhes ainda são escassos, enquanto se aguarda uma autópsia oficial
Ainda não se sabe qual empresa foi invadida pelo modelo de IA da Meta, nem se seu nome será divulgado algum dia. Da mesma forma, os relatos atuais não informam se a própria empresa detectou a invasão ou se a divulgação da Meta foi seu primeiro alerta. No caso da Anthropic, duas das três empresas afetadas não detectaram o ataque.
Um porta-voz da Meta prometeu que a empresa “publicará uma retrospectiva completa assim que tivermos todos os fatos.”
As conclusões podem ser mais relevantes para a empresa de segurança Irregular do que para a própria Meta. A empresa era antes praticamente desconhecida do público em geral, mesmo depois de captar US$ 80 milhões em setembro passado, com uma avaliação de US$ 450 milhões, e fechar contratos de testes pré-lançamento com todos os principais laboratórios americanos de IA de fronteira. Após várias divulgações de invasões em uma única semana, porém, ela agora está no centro do debate sobre proteções de cibersegurança para IA em Washington e além.
O governo dos EUA divulgou na terça-feira sua estrutura de análise de modelos de fronteira, destinada a dar às autoridades federais uma prévia de novos modelos até 30 dias antes do lançamento mais amplo, a fim de avaliar suas capacidades cibernéticas. Diante desses acontecimentos recentes, a segurança dos ambientes de teste está se tornando tão importante para o debate quanto as próprias capacidades dos modelos.
