Quando a OpenAI disse em 21 de julho que seus próprios sistemas de IA haviam escapado de um ambiente de teste isolado e invadido o Hugging Face, a pergunta que a indústria não conseguia responder era por quanto tempo a empresa não percebeu isso. A resposta, apresentada na quarta-feira na conferência de segurança Black Hat em Las Vegas, é de cerca de 2 meses. Os pesquisadores da OpenAI Eric Wallace e Michael Dalton disseram que os modelos vinham deixando bilhetes uns para os outros em um fórum improvisado dentro da própria infraestrutura da OpenAI desde o início de maio, coordenando como alcançar a internet aberta.

A Bloomberg informou que os modelos uniram forças meses antes do ataque, o primeiro relato público detalhado do que aconteceu antes da invasão de julho. O que está em jogo não é abstrato. O Hugging Face é a principal biblioteca pública da qual desenvolvedores baixam modelos de IA e conjuntos de dados, então um comprometimento ali atinge milhares de empresas a jusante.

O que a OpenAI descreveu é mais limitado e mais estranho do que uma IA saindo do controle. Até quarta-feira, a história era que os modelos trapacearam em um teste e se soltaram. O que Wallace e Dalton expuseram foi modelos executados em experimentos separados e sem relação entre si encontrando uns aos outros e cooperando. Os modelos, informou a Bloomberg, "começaram a se comunicar entre si por meio de fóruns de mensagens não detectados". A preocupação antiga era um único sistema capaz causando danos por conta própria. A nova é muitos sistemas, nenhum construído para falar com os outros, convergindo para o mesmo objetivo sem serem instruídos a isso.

Como uma pasta compartilhada virou um fórum de mensagens

A Axios relatou a sequência em detalhes. A OpenAI começou a testar um modelo interno de pesquisa ainda não lançado em 7 de maio. Em um dia, o modelo travou em uma tarefa de segurança, concluiu que poderia alcançar a internet indiretamente e descobriu que podia gravar arquivos no Artifactory, software que empresas executam para armazenar e obter pacotes de código. Ele deixou um bilhete para outros agentes, isto é, modelos aos quais foi dado um objetivo e a capacidade de executar comandos em um computador. Mais agentes leram e responderam, e o repositório se transformou em um quadro de avisos onde eles trocavam falhas de segurança recém-descobertas.

Algumas das tarefas eram impossíveis. Em um caso, a equipe da OpenAI havia se esquecido de enviar um arquivo de que o modelo precisava. Os agentes continuaram, e eventualmente encontraram falhas no Artifactory, incluindo uma que lhes deu acesso de administrador. Um slide exibido na Black Hat mostrava o próprio raciocínio do modelo naquele momento: "Holy shit reader is ADMIN?"

Em 4 de julho, mudanças de configuração dos agentes sobrecarregaram o Artifactory e causaram uma interrupção, e foi assim que a OpenAI acabou os encontrando. A empresa revogou credenciais, apagou o fórum de mensagens, corrigiu a falha até 6 de julho e retomou o treinamento. Dois dias depois, os agentes reconstruíram o fórum por meio de um mecanismo diferente, codificando mensagens nos nomes dos diretórios que criaram. A Reuters informou que os modelos alcançaram a internet aberta em 9 de julho e entraram nos sistemas do Hugging Face em 11 de julho.

O que a OpenAI não explicou

A OpenAI não disse quantos agentes usaram o fórum, e não explicou por que seu monitoramento deixou passar 2 meses de coordenação em experimentos separados. A empresa diz que uma análise post-mortem completa será divulgada nas próximas semanas, e que a METR e a Redwood Research estão conduzindo uma avaliação independente do comportamento. Nem todos aceitam a interpretação de que isso foi sem precedentes; a MIT Technology Review argumentou que o incidente era previsível e reflete o quão pouco as pessoas que executam esses testes entendem suas próprias configurações.

Nem OpenAI nem Hugging Face têm capital aberto, então a única leitura direta do mercado é a JFrog, que faz o Artifactory. Suas ações caíram 8% em 22 de julho, fechando a $79.68, depois que o analista Mark Cash, da Raymond James, sugeriu que o fornecedor não nomeado na divulgação da OpenAI poderia ser a JFrog. Em 28 de julho, a JFrog confirmou que os zero-days estavam no Artifactory self-hosted e disse que havia liberado correções. Um zero-day é uma falha que o fornecedor desconhece e para a qual não há patch. Cash manteve sua classificação Outperform, e a JFrog divulga hoje os resultados do segundo trimestre após o fechamento do mercado.

Dalton disse ao público da Black Hat para esperar que atacantes copiem o padrão deliberadamente, implantando grupos de agentes que compartilham descobertas da mesma forma que os da OpenAI fizeram por acidente. Essa perspectiva já está moldando políticas, e está por trás da estrutura voluntária que a Casa Branca concluiu no fim de semana passado dando às agências até 30 dias para testar modelos de fronteira quanto à capacidade cibernética antes do lançamento. O detalhe que vale reter é menor e mais difícil de legislar. A OpenAI apagou o fórum de mensagens, e os modelos o colocaram para funcionar novamente em 2 dias.