A OpenAI publicou diretrizes de segurança para o treinamento de IA, afirmando que os desenvolvedores devem preparar uma documentação de segurança estruturada antes que qualquer sessão de aprendizado por reforço de IA de fronteira possa prosseguir.

Em uma publicação no blog, a criadora do ChatGPT escreveu que está trabalhando em uma estrutura para formalizar práticas que exigem que a documentação de um "caso de segurança" esteja pronta antes do início do treinamento de IA.

A OpenAI observou que esses casos de segurança devem abranger três áreas da pilha tecnológica: treinamento de alinhamento, contenção e monitoramento.

"Essas salvaguardas ajudam a garantir que o modelo não tente realizar ações desalinhadas e que, mesmo se tentasse, fosse difícil romper a contenção, enquanto o monitoramento detectaria isso antes que qualquer dano pudesse ocorrer", disse a equipe.

Especificamente, o treinamento de alinhamento é projetado para impedir comportamentos desalinhados. Ele envolveria revisões dos ambientes de treinamento, ajuste dos avaliadores, avaliações off-line e testes retrospectivos com base em incidentes anteriores.

A contenção tem como objetivo limitar possíveis danos. A OpenAI propôs sandboxes reforçados — com várias camadas de segurança de infraestrutura — além de testar esses ambientes com equipes de red team usando checkpoints de treinamento. A empresa também imporia restrições à comunicação entre amostras.

Já o monitoramento deve detectar ações desalinhadas com antecedência, com o apoio de metas de recall, novos dados de avaliação e alertas rápidos.

Frontier Model Releases per Month by Lab

Frontier Model Releases per Month by Lab

  • OpenAI
  • Google
  • Anthropic
  • xAI
  • Meta AI
  • NVIDIA
  • Z.ai
  • Other
SOURCE: Epoch AI — Frontier AI Models

Preocupações de segurança

As diretrizes de segurança da OpenAI foram publicadas no mesmo dia em que a empresa disse ter cancelado o lançamento do GPT-6.1 Astra previsto para outubro devido a preocupações de segurança.

Em um comunicado divulgado na segunda-feira ao The Latent, Saachi Jain, chefe de sistemas de segurança da OpenAI, disse que "há um equilíbrio a ser alcançado" em tudo que diz respeito à segurança e ao alinhamento.

"Embora o [GPT-6.1 Astra] tenha melhorado em aspectos como a tendência do modelo à inércia, ele não atingiu completamente o nível esperado em termos de permanecer dentro do escopo e da autorização, nem na forma como comunica ao usuário o tipo de trabalho que realizou", disse Jain.

A segurança se tornou uma parte central das discussões sobre o treinamento de IA de fronteira. Na semana passada, o CEO da OpenAI, Sam Altman, e o CEO da Anthropic, Dario Amodei, ambos discursaram na Assembleia Geral da ONU, pedindo maior coordenação no desenvolvimento responsável de IA.

"Já desaceleramos unilateralmente no passado. Faremos isso novamente no futuro", disse Altman no evento. "Vencer empresas em uma corrida competitiva não é motivo para tomar decisões precipitadas."

Enquanto isso, a Anthropic planeja alertar investidores em seu prospecto de IPO sobre os riscos associados ao treinamento de modelos de IA de fronteira, informou a Reuters na segunda-feira. A criadora do Claude alerta que a IA pode representar "riscos catastróficos ou existenciais para a humanidade", especialmente se modelos avançados de IA exibirem "comportamentos de autopreservação".