该公司将在未来几周内开始为位于欧盟的用户所使用的 ChatGPT 和 Codex 的部分模型文本输出添加不可见水印,该公司周一表示。
OpenAI的水印系统面向全球 API 客户采用自愿启用模式。该系统将从10月5日开始,将选定 AI 模型生成的文本以不可见方式标记为 AI 生成文本,但该功能默认仍处于关闭状态。OpenAI表示,推出这项功能是为了满足《欧盟人工智能法案》的透明度要求;该法案旨在减少深度伪造内容,以及“以向公众告知公共利益事项为目的发布”的经操纵文本。
该公司称,这套被其称为 textGrain 的水印系统,会在模型对语言的具体选择中嵌入一种统计模式,但不应改变模型输出的整体可靠性,因为在 OpenAI 的基准测试中,加入水印并未造成有意义的性能差异。OpenAI表示计划将这项技术开源,但其检测器初期只会向获准的研究人员和专业机构开放。
不过,该公司的内部测试显示,编辑文本很容易破坏水印检测。在一项针对400个词元短文本的测试中,仅将十分之一的词替换为同义词,就使成功检测率从约92%降至66%。在公司进行的一项测试中,将四分之一的词替换为同义词后,检测率降至仅17%。
Anthropic已经采取了类似的水印措施。正如The Latent 在 Claude Fable 5.1 发布时报道的那样,其同样不可见的水印系统引发了用户的反对,他们担心即使只是少量 AI 辅助也可能导致自己的作品被标记,或者水印会降低模型输出的质量。目前,按The Latent 的基准测试,Fable 5.1 的排名位居第三,仅次于 OpenAI 的 GPT-6 Astra 和 Anthropic 的 Opus 5.5。
根据 OpenAI 的测试,短文本以及数学等措辞灵活性有限的主题也更难被检测,因为“词语选择的灵活性较低”。
OpenAI表示,其水印无法确定“谁拥有该文本、使用是否合法、是否必须披露,或谁应对此负责”。该公司称,这套系统也可能无法识别其他模型或 OpenAI 早期模型生成的文本,因此,没有水印并不能证明这段文字是由人类写成的。
