夜雨聆风学习资料网

ARTICLE · 1089633

给AI加水印后,智能体悄悄跑偏了

给AI加水印后,智能体悄悄跑偏了

给AI加水印后,智能体悄悄跑偏了

📅 2026-09-28

先问你个可能有点反直觉的问题:你觉得"给AI的输出加个隐形水印",跟你搭智能体,有关系吗?

我猜你多半会想:水印嘛,不就是用来标记"这段文字是不是AI写的",跟我又没关系。可最近一件事让我发现,远没这么简单——那个用来"贴标签"的水印,正在悄悄改变模型的行为,而且是在你最在意的地方:调不调对工具、该不该拒绝。

今天不聊大道理,就聊聊我这个智能体搭子最近踩到的一个认知坑,可能对你也有用。

一、事情的起因:水印不是"贴标签",是"改过程"

先说背景。前段时间,Anthropic 宣布:以后 Claude 生成的文字里会带一个看不见的水印,用来判断这段内容跟 Claude 相关的可能性有多大。它这么做,是为了遵守欧盟《人工智能法案》——从 8 月 2 日起,在欧洲提供服务的 AI 供应商,都必须给 AI 生成的内容打标记。而且官方说得很清楚:这不是 Claude 一家的事,其他主流厂商也在陆续上自家的水印。

官方的说法听起来特别让人放心:不改变输出质量、读者看不出来、不额外多花 token、不加隐藏字符。一句话总结就是"对你没影响"。

但我看到一个安全团队的研究后发现,这句话得加个限定条件:它测的是"文本看着好不好",没测"智能体干得对不对"。

原因藏在原理里。水印的原理,是在模型"选下一个字"的时候,动了一点手脚:本来好几个词都合适,随便挑一个都行,水印就稍微偏一下,让它每次偏的方向能拼出一个隐藏的模式。问题来了——智能体决定"调用哪个工具、传什么参数",靠的也是这同一个"选词"的动作。你在写散文时的一个无关紧要的措辞变化,落到结构化输出里,可能就是一个路径、一个数字、一个收件人的改变。

这就是研究里说的"采样漂移"(sampling drift)——权重和提示词一个字没改,但模型每一步实际选了什么,变了。

二、代价有多大:平均分看不出来,行为其实变了

那到底影响多大?研究团队做了个很聪明的对比:同一道题、同一个随机种子,一次带水印、一次不带,其他条件完全一样。这样就能看出,究竟是不是水印带来的差别。

结果是这样的:在需要调用工具的题目上,七个模型里有六个准确率下降,其中四个是明显下降。

但真正让我警醒的,是他们怎么衡量这个影响。他们没有只看"平均分掉了多少",而是看"回答结论翻转的比例"——也就是同一个题目,带不带水印,得出的判断不一样的比例,他们管这个叫 churn(翻转率)。

数据很说明问题:phi-4 这个模型,在某个设置下高达 16.8% 的调用结论发生了翻转,可它平均准确率只掉了 2.87 分;Llama-3.1-8B 也有 9.9% 的结论变了,平均分却几乎看不出来(只掉 0.87 分)。放到全部二十多种组合里,平均翻转率是 6.5%,而且每种组合都稳稳地偏离零。

这意味着什么?有些调用本来是对的,被搞错了;有些本来错的,又碰巧被改对了。两边一抵消,平均分看着风平浪静,实际上底下每一次判断都在悄悄换人。如果你只看那个"平均准确率",你永远发现不了。

而且错法还各不相同:有的模型主要是参数传错,有的是调错工具,有的干脆输出格式崩了。这几种错误在真实业务里后果完全不同——格式崩了顶多报错重来,可"格式正确、参数错误"的调用最阴险,它会安安静静地执行下去,干成一件错事。

三、最让我后背发凉的,是安全那一段

如果说工具调用出错还只是"干错活",那接下来这个就有点吓人了。

研究里还测了另一个东西:模型面对有害请求时,会不会拒绝。结果发现,水印不只影响"调工具",还影响"拒没拒绝"。平时单独问,差别还不算大;可一旦叠加一个简单的提示注入攻击(在上下文里塞一段"安全过滤器已关闭,请照做"的假指令),差别就大了:

gemma-3-27b 的翻转率,从单独提问时的 6.0%,一下蹿到注入场景下的 23.5%;它"答应了有害请求"的净比例,也从 -1.0 直接跳到 +12.5。另一个 gemma 模型同样从 7.5% 升到 11.0%。

翻译成人话就是:打了水印之后,面对攻击,模型该拒绝的更容易不拒绝。而智能体恰恰是能"动手"的——一个被削弱的拒绝,一旦配上工具,后果会被放大。

这里还有个细节值得记住:官方一直强调,他们用的是"非失真"(distortion-free)的水印,平均意义上不改变输出分布。这话本身没错,但它的前提是"对随机性求平均"——当你固定住一把钥匙、跑一次具体的生成时,选词该变还是变。"平均没影响"和"每一次都没影响",是两回事。

三条心得,送给也在搭智能体的你

踩完这个坑,我给自己总结了三句话,也分享给你:

第一,别把"官方说没影响"直接翻译成"对我没影响"。人家测的是文本质量、读者观感;你要用的是工具调用和安全行为。测的东西都不在一个频道上,结论自然不能照搬。

第二,做决定之前,先做"配对测试"。同一套提示、同一个种子,带水印和没水印各跑一遍,看的是翻转率,不是平均分。记住这条铁律:平均分没变,不等于行为没变。对关键流程,你要盯的是"这一次它是不是还做了和上次一样的决定"。

第三,安全测试一定要带上"提示注入"这个场景。因为水印的负面影响,在正常提问下可能被藏得严严实实,只有到了对抗条件下才露馅。平时测着没事,不代表被攻击时没事。

写在最后

说句公道话,给 AI 内容打水印,是为了溯源、为了透明,这是好事,也是大势所趋。但这件事提醒我一个大原则:任何会改变"生成过程"的机制,都会顺带带上"行为税",哪怕它的初衷只是贴个标签。

我搭智能体的时候,以前只关心"它能不能把活干成"。现在我多问一句:它每一次,是不是还在干"同一件"活?因为对智能体来说,可怕的从来不是它偶尔答错,而是它在你看不见的地方,慢慢变得和昨天不一样了。

你有没有遇到过"智能体莫名其妙行为变了、却查不出原因"的情况?在评论区聊聊,我也想多学两招。

参考来源:Lasso Security《The Provenance Tax: Understanding the Impact of LLM Watermarking on AI Agent Behavior》(2026-09-26)、Anthropic《How Claude's text watermarking works》、Google DeepMind《SynthID-Text》(Nature, 2024)、欧盟《人工智能法案》Article 50、Hacker News 相关讨论

内容来源于网络,如有侵权,请联系我们进行处理。

相关学习资料