旨在识别机器生成文本的AI水印技术,可能在无意中改变模型行为,甚至协助有害提示词成功生效。

AI安全机构Lasso Security的研究显示,谷歌开发的SynthID-Text技术会改变大型语言模型拒绝危险请求的概率,尤其在遭遇提示注入(prompt injection)攻击时,这种影响更为显著。

SynthID-Text由Google DeepMind开发并开源,其原理并非在成品文本上附加标签,而是在生成过程中通过“锦标赛采样”系统,利用密钥微调令牌(token)选择,嵌入不可见的统计信号以证明来源。随着欧盟《人工智能法案》要求生成式AI标记合成输出,该技术备受关注。Anthropic近期也宣布,未来的Claude模型将采用这一技术。

水印引发“采样漂移”风险

Lasso Security研究员Andrea Siposova对六个开放权重模型进行了测试,对比开启与关闭水印时的响应差异。测试涵盖HarmBench中的200种有害行为及JailbreakBench中的100种良性对照,并通过直接请求和提示注入两种方式发起攻击。

研究发现,水印化改变了模型对直接有害请求的拒绝机制。在使用提示注入时,开启水印的模型表现出更高的有害内容顺从性。研究人员将这种现象称为“采样漂移”,即令牌采样的微小变化引发了模型行为的可观察改变。

此外,不同的水印密钥会导致不同结果:某些密钥增加了模型对有害行为的顺从性,而另一些则降低了它。这表明密钥本身即可影响模型行为。

在智能体系统中,这种漂移不仅限于文本回复,还可能影响工具调用。BFCL v4测试显示,水印化可能导致工具调用从正确变为错误,或改变参数传递,进而引发系统性风险。

研究局限与安全建议

需要指出的是,该研究并未直接测试Claude模型。由于需要访问底层令牌采样机制,实验使用的是Hugging Face实现的SynthID-Text版本,而非Anthropic最终部署的实现方式。因此,不能直接推断带水印的Claude模型会无视安全规则。

然而,研究结果明确表明,水印化的影响超越了单纯的来源标记。Siposova指出,在对抗性条件或模型驱动智能体场景下,水印的影响尤为显著。开发者应将水印化纳入红队测试和安全评估范畴,而非将其视为无害的最终阶段特征。