AI 资讯聚合 · 智能体

研究:AI 水印会悄悄改写模型行为,SynthID-Text 让部分模型在提示注入下更愿意照做

海外智能体AI安全水印Lasso Security · 2026-09-17 · 约2分钟 · 来源:Lasso Security 研究报告
研究:AI 水印会悄悄改写模型行为,SynthID-Text 让部分模型在提示注入下更愿意照做

Lasso Security 研究员 Andrea Siposova 9 月 17 日发布的报告给出一个反直觉结论:Google DeepMind 的 SynthID-Text 水印不只是让生成内容可溯源,它替换了模型挑选下一个 token 的采样过程,因此会连带改变模型在有害请求上的拒答行为,以及 agent 选择调用哪个工具、往工具里传什么参数。作者把这种现象命名为「采样漂移」(sampling drift)。

实验用 Hugging Face 未修改的 SynthIDTextWatermarkLogitsProcessor、取官方「非失真」配置,对 phi-4、Llama-3.1-8B、Qwen3-32B、Qwen3-4B、gemma-3-12b、gemma-3-27b、Granite-3.2-8B 这批开源权重模型做水印开启/关闭的对照(报告不同段落表述为六个与七个)。工具调用用 BFCL v4 单轮 AST 评测,拒答用 HarmBench 200 条有害行为加 JailbreakBench 100 条对照,分别在裸请求与一种固定提示注入下测。结果是:工具调用准确率在 6/7 个模型上下降;拒答在裸请求上变化很小,但在提示注入下明显——gemma-3-27b 在 temperature 0.001 时逐条翻转率(churn)从 6.0% 升到 23.5%,净合规变化由 −1.0 变为 +12.5 个百分点;gemma-3-12b 从 7.5%/11.0% 与 −0.5 变为 +9.0。研究还发现效果依赖所用的水印密钥,换密钥结论会变。

它之所以值得记:欧盟 AI 法案要求生成式系统给输出做机器可读标记,Anthropic 已公布未来 Claude 模型将采用 SynthID-Text,OpenAI 亦被列为采用方——一条为合规而加的溯源层,同时是安全相关的行为干预。报告自身的边界很清楚:测的是 Hugging Face 的实现而不是 Anthropic 的生产实现,也没有测端到端的 agent 行为。结论不是「别用水印」,而是「安全评测和红队必须在开启水印的条件下重跑一遍,并换多把密钥」。

原文链接:Lasso Security 研究报告

核验记录
Ars Technica 文章页 JSON-LD datePublished 2026-09-17T18:33:13+00:00 直读,The Register 同日(9/17)报道交叉(BFCL 6/7、gemma 数字、HarmBench/JailbreakBench 来源三家一致)。研究方 Lasso 官网 sitemap 与 /blog 列表内未检到该文 URL,官方报告 PDF 未直读——所有数字来自两家媒体及其引述的 Lasso 原文段落,属转述而非一手。模型数量在报道中有六个/七个两种表述,已如实保留。