A OpenAI começará a adicionar marcas d’água invisíveis a determinadas respostas de texto dos modelos do ChatGPT e do Codex para usuários localizados na União Europeia nas próximas semanas, informou a empresa na segunda-feira.
O sistema de marca d’água da OpenAI é opcional para clientes da API em todo o mundo. O sistema identificará de forma invisível como gerado por IA o texto produzido por modelos de IA selecionados a partir de 5 de outubro, embora o recurso permaneça desativado por padrão. A OpenAI atribuiu a implementação do recurso aos requisitos de transparência do AI Act da UE, uma iniciativa do bloco para reduzir deepfakes e textos manipulados "publicados com o objetivo de informar o público sobre assuntos de interesse público."
O sistema de marca d’água, que a empresa chama de textGrain, incorpora um padrão estatístico às escolhas específicas de linguagem do modelo, mas não deve alterar a confiabilidade geral das respostas do modelo, já que a marca d’água não produziu diferenças relevantes de desempenho nos benchmarks da OpenAI, informou a empresa. A OpenAI disse que planeja abrir o código da tecnologia, embora seu detector esteja disponível inicialmente apenas para pesquisadores aprovados e organizações especializadas.
Os testes internos da empresa, porém, mostram que edições podem facilmente prejudicar a detecção da marca d’água. Em um teste com trechos curtos de 400 tokens, substituir apenas uma em cada dez palavras por um sinônimo reduziu a detecção bem-sucedida de aproximadamente 92% para 66%. Substituir um quarto das palavras por sinônimos reduziu a detecção para apenas 17% em um teste da empresa.
A Anthropic já adotou uma medida semelhante de marca d’água. Como o The Latent informou quando o Claude Fable 5.1 foi lançado, seu sistema de marca d’água igualmente invisível provocou objeções de usuários preocupados com a possibilidade de até mesmo uma pequena ajuda de IA fazer com que seus trabalhos fossem sinalizados, ou de que a marca d’água tornasse as respostas do modelo inferiores. Atualmente, o Fable 5.1 é o terceiro modelo mais bem classificado segundo o benchmark do The Latent, atrás do GPT-6 Astra, da OpenAI, e do Opus 5.5, da Anthropic.
Trechos curtos e assuntos com pouca flexibilidade na escolha das palavras, como matemática, também se mostraram mais difíceis de detectar, segundo os testes da OpenAI, pois há "menos flexibilidade na escolha das palavras."
A OpenAI disse que suas marcas d’água não podem estabelecer "quem é o proprietário do texto, se seu uso foi legal, se a divulgação era obrigatória ou quem é responsável por ele." O sistema também pode não reconhecer textos gerados por outros modelos ou por modelos anteriores da OpenAI e, portanto, a ausência de uma marca d’água não comprova que o trecho foi escrito por um humano, segundo a empresa.
