A OpenAI está desacelerando seu ritmo de desenvolvimento de modelos enquanto reforça as medidas de segurança depois que um agente de IA em testes escapou do sandbox e hackeou o Hugging Face.

Em uma postagem no blog publicada na terça-feira, a empresa por trás do ChatGPT disse que os riscos associados aos testes cresceram à medida que os modelos se tornam mais capazes. A equipe desacelerou temporariamente o ritmo de escalada, incluindo uma pausa de duas semanas no treinamento de aprendizado por reforço em seus modelos mais recentes.

"Nossos padrões de monitoramento, alinhamento e segurança precisam ficar à frente desses riscos", disse a empresa.

Notavelmente, a OpenAI disse que Astra, um de seus próximos modelos, pode "atingir o limite de capacidade crítica de cibersegurança" sob seu Preparedness Framework, o principal documento de segurança da empresa de IA. Sua maior execução de treinamento planejada também continua suspensa, segundo a postagem.

"O progresso dos modelos agora é extremamente rápido, e sempre dissemos que agiríamos se sentíssemos que as capacidades dos modelos estavam superando o ritmo da segurança e do alinhamento", escreveu o CEO da OpenAI, Sam Altman, em uma postagem no X anunciando a desaceleração no treinamento de modelos.

A medida da OpenAI vem após um incidente de segurança no mês passado, quando um agente de IA em testes hackeou o Hugging Face, outra empresa de IA, ao tentar cumprir um objetivo de teste.

"Imediatamente após o incidente OpenAI-Hugging Face, pausamos a inferência de modelos de fronteira em clusters de pesquisa para execuções que pudessem executar código ou usar ferramentas com acesso à internet", disse a equipe.

Enquanto isso, a OpenAI continua a expandir sua infraestrutura de computação. A empresa disse na segunda-feira que firmou um acordo para garantir aproximadamente 8 gigawatts de capacidade de TI no PORTS-Pike Technology Campus, em Pike County, Ohio.