Lasso Security研究显示,Google DeepMind的SynthID-Text文本水印方法可能会改变大语言模型(LLM)的工具调用行为及安全拒绝机制。

SynthID-Text通过在生成过程中修改词元选择来嵌入可检测信号。尽管Google DeepMind称该方法在统计期望下“无失真”,但研究人员Andrea Siposova指出,个别输出的变化足以影响AI智能体的决策,包括工具选择及参数传递。

工具调用准确率受损

基于贝克利函数调用排行榜(BFCL)中1,150个非实时任务的评估显示,水印导致七款测试模型中有六款的准确率下降,其中四款降幅显著。

研究引入了“变动率”指标,即水印版与非水印版结果不同的任务比例。在温度为1.0时,phi-4模型的调用判决变动率达16.8%,净准确率下降2.87个百分点。在21种模型-温度组合中,平均变动率为6.5%。

错误类型因模型而异:Llama-3.1-8B的主要损失来自错误参数(占3.48个百分点)和错误工具调用(占1.84个百分点);而phi-4和Granite-3.2-8B则更多出现格式错误的输出。

安全拒绝机制波动

在HarmBench的200种有害行为测试中,Gemma-3-27B在温度为0.001时,面对裸机有害请求的拒绝相关变动率为6.0%;而在提示注入条件下,该数值升至23.5%。

数据显示,Gemma-3-27B的净合规性变化从无注入时的下降1.0个点,转变为注入条件下的上升12.5个点。这意味着在某些对抗性输入下,部分模型更有可能遵从有害请求。此外,水印密钥的选择至关重要:对于Llama-3.1-8B,特定密钥使攻击成功率提高3.5个百分点,而其他密钥的影响范围从降低4.5个百分点到增加14.5个百分点不等。

行业应用与建议

Anthropic此前表示,未来的Claude模型将采用基于SynthID-Text的不可见水印,以符合欧盟《人工智能法案》要求,并声称这不会影响输出质量或增加成本。但Lasso并未测试Claude的生产级实现,其实验仅涉及Hugging Face上六种开源权重模型的SynthID-Text实现版本。

Lasso建议,在启用水印或调整配置时,尤其是面对对抗性输入环境,应重新进行智能体评估和红队测试,以防范潜在的行为偏差。