研究:AI 水印会悄悄改写模型行为,SynthID-Text 让部分模型在提示注入下更愿意照做

Lasso Security 研究员 Andrea Siposova 9 月 17 日发布的报告给出一个反直觉结论:Google DeepMind 的 SynthID-Text 水印不只是让生成内容可溯源,它替换了模型挑选下一个 token 的采样过程,因此会连带改变模型在有害请求上的拒答行为,以及 agent 选择调用哪个工具、往工具里传什么参数。作者把这种现象命名为「采样漂移」(sampling drift)。
实验用 Hugging Face 未修改的 SynthIDTextWatermarkLogitsProcessor、取官方「非失真」配置,对 phi-4、Llama-3.1-8B、Qwen3-32B、Qwen3-4B、gemma-3-12b、gemma-3-27b、Granite-3.2-8B 这批开源权重模型做水印开启/关闭的对照(报告不同段落表述为六个与七个)。工具调用用 BFCL v4 单轮 AST 评测,拒答用 HarmBench 200 条有害行为加 JailbreakBench 100 条对照,分别在裸请求与一种固定提示注入下测。结果是:工具调用准确率在 6/7 个模型上下降;拒答在裸请求上变化很小,但在提示注入下明显——gemma-3-27b 在 temperature 0.001 时逐条翻转率(churn)从 6.0% 升到 23.5%,净合规变化由 −1.0 变为 +12.5 个百分点;gemma-3-12b 从 7.5%/11.0% 与 −0.5 变为 +9.0。研究还发现效果依赖所用的水印密钥,换密钥结论会变。
它之所以值得记:欧盟 AI 法案要求生成式系统给输出做机器可读标记,Anthropic 已公布未来 Claude 模型将采用 SynthID-Text,OpenAI 亦被列为采用方——一条为合规而加的溯源层,同时是安全相关的行为干预。报告自身的边界很清楚:测的是 Hugging Face 的实现而不是 Anthropic 的生产实现,也没有测端到端的 agent 行为。结论不是「别用水印」,而是「安全评测和红队必须在开启水印的条件下重跑一遍,并换多把密钥」。
原文链接:Lasso Security 研究报告