
为符合欧盟《人工智能法案》关于生成式 AI 输出需具备机器可读标识的规定,OpenAI 现已向 API 客户提供名为 textGrain 的水印选项。该公司计划在几周内,强制对欧盟境内符合条件的 ChatGPT 和 Codex 文本输出应用数字水印,无论用户意愿如何。
合规策略差异与技术局限
与竞争对手 Anthropic 不同,OpenAI 并未将水印技术默认应用于欧洲以外的内容生成,尽管 API 客户可自主选择在全球范围启用该标记。Anthropic 此前已宣布采用 Google 的 SynthID-Text 算法,并在全球范围内实施其合规方案。
与此同时,微软和 Meta 正致力于开发基于图像的 AI 水印技术,以应对市场对虚假信息及内容来源的担忧。OpenAI 已对其生成的 AI 图像、音频和视频应用了其他内容来源信号。
textGrain 原理与性能瓶颈
textGrain 通过在模型词汇选择中嵌入不可见的统计信号来工作。大型语言模型通常基于概率分布预测词元,该技术通过定期选择同义词替代原词,使生成文本偏离无偏见模型的统计模式,供检测器识别。
然而,实际检测效果受文本长度和类型影响显著。尽管目标错误率为 1%,但在 200 字的短段落中,检测器仅能标记出 80% 的水印;在 400 字段落中,这一比例升至 95%。在数学或代码等功能性文本中,由于替换易引入错误,检测效果更差。
此外,该技术面临语义改变和易被规避的风险。研究未完全解决词汇替换可能扭曲关键事实的问题。测试显示,textGrain 极易被简单的同义词替换击败:在 400 词元的段落中,替换 10% 的词汇会使检测率从 92% 降至 66%;若替换 25% 的词汇,检测率则骤降至 17%。