OpenAI는 앞으로 몇 주에 걸쳐 유럽연합 내 사용자를 대상으로 ChatGPT와 Codex의 일부 모델 텍스트 출력물에 보이지 않는 워터마크를 추가하기 시작할 것이라고 월요일 밝혔다.

OpenAI의 워터마킹 시스템은 전 세계 API 고객을 대상으로 선택 적용된다. 이 시스템은 10월 5일부터 일부 AI 모델이 생성한 텍스트임을 눈에 보이지 않게 표시하지만, 이 기능은 기본적으로 꺼진 상태로 유지된다. OpenAI는 이 기능을 도입하는 이유로 EU AI 법의 투명성 요건, 즉 공익 사안에 대해 대중에게 알릴 목적으로 "게시된" 딥페이크와 조작된 텍스트를 줄이려는 EU의 노력을 들었다.

이 회사가 textGrain이라고 부르는 워터마킹 시스템은 모델이 언어를 선택하는 방식에 통계적 패턴을 삽입하지만, 워터마킹으로 인해 OpenAI의 벤치마크에서 유의미한 성능 차이가 나타나지 않았기 때문에 모델 출력물의 전반적인 신뢰성을 바꾸지는 않을 것이라고 회사는 밝혔다. OpenAI는 이 기술을 오픈소스로 공개할 계획이지만, 탐지기는 처음에는 승인된 연구자와 전문 기관에만 제공할 예정이다.

다만 회사의 내부 테스트에 따르면 편집 작업만으로도 워터마크 탐지가 쉽게 방해될 수 있다. 400토큰 분량의 짧은 문단을 대상으로 한 한 테스트에서는 단어 10개 중 1개만 동의어로 바꿔도 탐지 성공률이 약 92%에서 66%로 떨어졌다. 한 회사 테스트에서는 단어의 4분의 1을 동의어로 바꾸자 탐지율이 17%에 불과했다.

Anthropic은 이미 비슷한 워터마킹 조치를 취했다. The Latent가 Claude Fable 5.1 출시 당시 보도했듯이, 이와 유사한 보이지 않는 워터마킹 시스템은 사소한 AI 지원만으로도 작업물이 AI 생성물로 표시될 수 있다고 우려하거나 워터마킹으로 모델 출력물의 품질이 떨어질 수 있다고 걱정하는 사용자들의 반발을 불러왔다. Fable 5.1은 현재 The Latent의 벤치마크에서 OpenAI의 GPT-6 Astra와 Anthropic의 Opus 5.5에 이어 세 번째로 높은 순위를 기록하고 있다.

OpenAI의 테스트에 따르면 수학처럼 표현의 유연성이 제한적인 짧은 문단과 주제도 탐지가 더 어려운 것으로 나타났다. "단어 선택의 유연성이 낮기" 때문이다.

OpenAI는 자사의 워터마크만으로는 "텍스트의 소유자가 누구인지, 사용이 합법적이었는지, 공개가 필요한지, 또는 이에 대한 책임자가 누구인지" 확인할 수 없다고 밝혔다. 또한 이 시스템은 다른 모델이나 OpenAI의 이전 모델이 생성한 텍스트를 인식하지 못할 수 있으므로, 워터마크가 없다고 해서 해당 문단을 인간이 작성했다는 의미는 아니라고 회사는 설명했다.