A OpenAI exige documentação de segurança antes de iniciar o treinamento por reforço de IA de fronteira
A OpenAI diz que os casos devem cobrir alinhamento, contenção e monitoramento
A OpenAI cancelou o GPT-6.1 Astra, previsto para outubro, por preocupações de segurança
Saachi Jain disse que o GPT-6.1 Astra não atingiu o nível esperado de segurança e autorização
A Reuters informou que a Anthropic alertará investidores sobre riscos catastróficos da IA
A OpenAI publicou diretrizes de segurança para o treinamento de IA, afirmando que os desenvolvedores devem preparar uma documentação de segurança estruturada antes que qualquer sessão de aprendizado por reforço de IA de fronteira possa prosseguir.
Em uma publicação no blog, a criadora do ChatGPT escreveu que está trabalhando em uma estrutura para formalizar práticas que exigem que a documentação de um "caso de segurança" esteja pronta antes do início do treinamento de IA.
A OpenAI observou que esses casos de segurança devem abranger três áreas da pilha tecnológica: treinamento de alinhamento, contenção e monitoramento.
"Essas salvaguardas ajudam a garantir que o modelo não tente realizar ações desalinhadas e que, mesmo se tentasse, fosse difícil romper a contenção, enquanto o monitoramento detectaria isso antes que qualquer dano pudesse ocorrer", disse a equipe.
Especificamente, o treinamento de alinhamento é projetado para impedir comportamentos desalinhados. Ele envolveria revisões dos ambientes de treinamento, ajuste dos avaliadores, avaliações off-line e testes retrospectivos com base em incidentes anteriores.
A contenção tem como objetivo limitar possíveis danos. A OpenAI propôs sandboxes reforçados — com várias camadas de segurança de infraestrutura — além de testar esses ambientes com equipes de red team usando checkpoints de treinamento. A empresa também imporia restrições à comunicação entre amostras.
Já o monitoramento deve detectar ações desalinhadas com antecedência, com o apoio de metas de recall, novos dados de avaliação e alertas rápidos.
Em um comunicado divulgado na segunda-feira ao The Latent, Saachi Jain, chefe de sistemas de segurança da OpenAI, disse que "há um equilíbrio a ser alcançado" em tudo que diz respeito à segurança e ao alinhamento.
"Embora o [GPT-6.1 Astra] tenha melhorado em aspectos como a tendência do modelo à inércia, ele não atingiu completamente o nível esperado em termos de permanecer dentro do escopo e da autorização, nem na forma como comunica ao usuário o tipo de trabalho que realizou", disse Jain.
A segurança se tornou uma parte central das discussões sobre o treinamento de IA de fronteira. Na semana passada, o CEO da OpenAI, Sam Altman, e o CEO da Anthropic, Dario Amodei, ambos discursaram na Assembleia Geral da ONU, pedindo maior coordenação no desenvolvimento responsável de IA.
"Já desaceleramos unilateralmente no passado. Faremos isso novamente no futuro", disse Altman no evento. "Vencer empresas em uma corrida competitiva não é motivo para tomar decisões precipitadas."
Enquanto isso, a Anthropic planeja alertar investidores em seu prospecto de IPO sobre os riscos associados ao treinamento de modelos de IA de fronteira, informou a Reuters na segunda-feira. A criadora do Claude alerta que a IA pode representar "riscos catastróficos ou existenciais para a humanidade", especialmente se modelos avançados de IA exibirem "comportamentos de autopreservação".