乐于分享
好东西不私藏

你用 AI 写的东西会被查出来吗?Claude 每段话都盖了隐形章

你用 AI 写的东西会被查出来吗?Claude 每段话都盖了隐形章

导读 · INTRO

8 月 2 日之后发布的 Claude 模型,写出来的每一段文字都藏着一个看不见的记号,全球生效,没有关闭开关。这件事听上去像是「AI 写的一查就穿帮」,可它能证明的东西比你想的少得多。而它真正逼你改变的那一件事,跟水印本身关系不大。

你这两天可能刚用 AI 写过点什么:一份周报、一封邮件、一段发言稿,或者一篇作业。 从这个月起,那些文字里多了一样东西。你看不见它,读者也看不见,但它一直在。

Anthropic 在 8 月初宣布:2026 年 8 月 2 日及之后发布的 Claude 模型, 输出的每一段文字里都嵌了一个人眼看不见的记号。这不是某个地区的试点, 而是全球所有用户、所有产品线一起开,网页版 Claude、开发者调用的接口、Claude Code 都在内。 在这个日期之前发布的老模型,也会在接下来的过渡期里陆续补上。用户没有开关可以关掉它。

上周六,Sebastian Raschka 在 X 上发了一张图解,讲这个记号到底是怎么盖上去的。 他写过一本叫《从零构建大模型》的书,讲的是从空白代码开始一步步把一个语言模型搭出来, 面向的正是没有相关背景、想弄明白模型内部在干什么的人。 这条帖子有 16.6 万人看过,1268 人收藏,而转发只有 204 次。 收藏是转发的六倍,这个比例通常意味着读的人打算以后再回来看一遍。

我把他那张图和 Anthropic 自己公布的材料都读了一遍。真正有意思的地方其实不在技术, 而在于这套东西能证明什么、不能证明什么。这一点跟大多数人的第一反应差得很远。

01水印不是加在文字上,是加在「挑词」这一步

PART 01 · HOW IT WORKS

要讲清楚它怎么藏进去的,得先说模型是怎么写字的。

模型写一句话,是一个词接一个词往外吐的,并不先想好整句再落笔。 每吐一个词之前,它会把自己认识的所有词都过一遍,给每个词打一个分, 然后从得分高的那几个里挑一个出来。

这里的动作是「挑」,不是「取最高分的那个」。因为如果永远取最高分, 同一个问题问十次就会得到一模一样的十个答案,那样的模型没人愿意用。 所以模型故意保留了一点随机性:得分接近的几个词,都有机会被挑中。

水印能藏进去,靠的正是这点随机性。既然本来就是随机挑, 那么把「随机」换成「按一套外人不知道的规则挑」,从外面看没有任何区别。

举个例子。模型写到「今天天气很冷,天空」,下一个词可以是「阴沉」,也可以是「灰蒙蒙」。 这两个词得分几乎一样,读者读到哪个都不会觉得别扭。 平时模型是随机挑一个,现在改成按一串密钥来挑。 所谓密钥,就是只有 Anthropic 手里有的一串数。这串数和前面已经写出来的词合在一起, 决定这一次到底挑哪个。

单看这一个位置,你什么也看不出来,「阴沉」是个完全正常的词。 可是一篇文章里有几百上千个这样的位置,每个位置都按同一把密钥来挑, 整篇的用词组合就形成了一个特定的模式。 一个人自己写作时正好撞上这个模式的概率,低到可以认为不可能是巧合。

Sebastian Raschka 画的两段式图解。上半部分是单个位置上的对比:没有水印时,得分最高的词最常被选中,但别的词也有机会;有水印时,密钥和前文一起决定在几个「都说得通」的词里挑哪个。下半部分是把这个操作重复到整篇之后的效果:同样一句话本来有几十种写法,水印让它必然落在其中一种上。图片来源:@rasbt

这条路线不是 Anthropic 自己想出来的,用的是 Google DeepMind 在 2024 年发表的 SynthID-Text 方案。按 Anthropic 自己的说法,读者读起来分辨不出一段回答有没有带水印, 文字质量不受影响。

Claude 生成的文件走的是另一套办法。图片这类文件会被签上一段来源信息, 用的是一个叫 C2PA 的行业标准,相当于给文件盖了个戳: 既能看出它被 Claude 处理过,也能看出后来有没有被人动过手脚。

02它能证明什么,不能证明什么

PART 02 · WHAT IT PROVES

讲到这里,很多人的第一反应是:完了,以后用 AI 写东西要被抓。

这个反应两头都错。它证明的比你以为的少,同时漏掉的也比你以为的多。

先说它证明得少。 Anthropic 在帮助文档里写得很直白: 检测到水印,说明这段文字可能经过 Claude 处理,并不构成一份完整的来源证明。 「经过 Claude 处理」的范围其实很宽:你自己写完一整段,只让 Claude 帮你润色两句, 这段话同样算被它处理过。也就是说,查出水印,不等于查出这篇是 AI 代笔的。

再说它漏得多。 官方列了一串查不到水印的情况:模型太老、文字被大幅改写、 片段太短、发布平台把随文件走的信息剥掉了。反过来说, 查不到水印完全不代表这段文字不是 AI 写的:换一家模型写、用老版本写、 写完自己重写一遍,都查不到。

还有一条容易被忽略:代码基本不带水印。写代码的时候, 变量名、语法结构的选择余地本来就很小,不像写文章那样同一个意思有几十种说法可以挑。 没有可挑的空间,也就藏不进记号,只有注释这种可以随便写的地方才带上一点。 所以靠水印判断一段代码是不是 AI 写的,行不通。

读到这里,写代码的人可能已经在想:那我用 AI 写代码岂不是完全查不出来? 就水印而言确实如此。但公司里判断这件事从来不靠检测,靠的是提交记录、 代码评审时你能不能讲清每一行为什么这么写。这两样比任何检测器都严。

最后一条更现实:现在还没有人能真正做检测。 Anthropic 说会开放检测能力、会发布技术文档,但检测接口到现在还没上线。 第三方既拿不到具体算法参数,也拿不到密钥,自己造不出检测器。

顺带说一句,市面上那些「AI 检测器」跟这件事完全是两回事。 那些工具是靠文风猜的:句子长度是不是太整齐、用词是不是太规矩。 本质上是统计学上的猜测,冤枉人的比例一直很高。 水印则是发牌的人自己在牌背上做了记号,可靠程度不是一个量级。 但前提是你手里得有那张对照表,而现在这张表只有 Anthropic 自己有。

03那为什么全球都开

PART 03 · WHY EVERYONE

Raschka 在帖子最后提了个问题,到现在也没有官方答案。

Anthropic 给的理由是欧盟《人工智能法案》第 50 条的透明度要求, 说他们「不得不」这么做。可 Raschka 指出:这一步是模型生成文字的时候顺手做的, 既不需要重新训练模型,也不需要另外养一个模型。既然如此, 为什么不能只对欧盟用户开?

Anthropic 没有解释。下面四条是我的推测,不是官方说法,按可能性从高到低排。

判断谁是欧盟用户这件事本身就不靠谱。 一个开发者人在德国, 他的产品用户遍布全球,生成的文字最后发到哪个国家去,Anthropic 无从知道。 按 IP 分流是个筛子,真要合规反而更危险。

其次,同一个模型维护两种输出模式,长期成本比想象中高。 评测、日志、事故排查全都要分两路走。为了省一点计算量而背上一套长期维护负担,不划算。

再者,签下这份行为准则的不止 Anthropic 一家。 其他几家大模型厂商也在做各自的水印。 既然行业要一起做,率先做全的那家在监管面前是有位置的。

最后还有一层对 Anthropic 自己的好处。 有了水印, 「这段文字是不是我们模型写的」这个问题,以后他们能自己回答。 无论是应对造谣、应对滥用指控,还是判断训练数据里混进了多少 AI 生成的内容, 手里有一把能验的尺子总比没有强。

这几条都是推测,但有一件事是确定的:这不是 Anthropic 一家的动作, 而是整个行业朝「AI 生成的东西要能被认出来」这个方向迈出的第一步。 下一步大概率是各家的水印互相能验,那才是真正麻烦的时候。

04所以你该怎么做

PART 04 · NEXT ACTIONS

原理讲到这里就够了,下面是具体做法,按身份分开说。

CASE 01学生和写论文的人

先记住一个反直觉的结论:水印既保护不了你,也定不了你的罪, 真正能救你的是写作过程。

理由前面已经讲清楚了:查出水印,只说明文字经过 Claude,不说明是 Claude 代写的; 查不出水印,也不说明你没用过 AI。两边都不是铁证。 所以任何一场关于「这到底是不是你写的」的争论,最后都会落到同一个地方: 你能不能拿出你写的过程。

从今天起做一件事:给你正在写的每一篇东西建一个文件夹,把过程留下来。

  • 用带版本历史的工具写(腾讯文档、石墨、Google Docs 都行),别在本地写完直接交
  • 大纲、初稿、改了三遍的中间版本,全部留着,不要覆盖同一个文件
  • 查资料时截的图、记的笔记,扔进同一个文件夹
  • 如果确实用了 AI,把对话记录一并存进去

这么做不为防谁,只为给自己留一条退路。 这类争议接下来只会越来越多,到时候手里有过程记录的人和没有的人,处境完全不同。

CASE 02靠写东西交付工作的人

三条,从最要紧的往下排。

第一,别指望改几个字就洗掉。 官方的说法是大幅改写会让水印失效, 而轻度编辑不会把它完全去掉。更要紧的是, 把精力花在猜检测的门槛在哪,本身就是在往错的方向使劲。

第二,主动说清 AI 参与到什么程度,比被人问出来强得多。 交稿时加一句「初稿是用 Claude 起的,数据我逐条核过,观点是我自己的」, 成本几乎为零,换来的是对方对你其余部分的信任。 现在还没有统一的行业规矩,主动说明的人反而占先手。

第三,把力气放在 AI 做不了的部分。 水印这件事真正的信号是: 纯文字产出的可验证性正在下降,一段话到底谁写的,越来越难说清。 既然如此,值钱的东西就会往另外两头走。 一头是带着你个人经历的内容:你去年做砸的那个项目,AI 编不出来。 另一头是你能为结果负责:这个数我核过,出问题算我的,AI 不会替你担这句话。

CASE 03做内容平台和做编辑的人

短期内不要指望靠水印做审核。检测接口没上线,第三方拿不到密钥; 就算上线了,能查的也只有 Claude 一家的输出,用户换一家模型你就查不到了。

现在能做的是另一件事:把要求前置。与其事后检测, 不如在投稿规则里写清楚「用了 AI 要声明」「数据类内容要附来源」, 再对声明过的内容降低核查成本,对没声明却被发现的加重处理。 规则比技术手段有效,因为规则不依赖任何一家厂商的接口。

05最后一句

PART 05 · ///

水印这件事本身,可能没有它听上去那么重要。 它证明不了作者是谁,覆盖不了所有模型,检测器到现在还没交到人手里。

但它标记了一个变化的开始:判断一段文字出自谁手, 以前靠的是文风、习惯、笔迹,现在这套办法在 AI 面前已经失效, 新的办法还没有建立起来。

在新旧交替的这几年里,能保护你的不是技术,而是习惯。 今晚就开始留过程记录,是成本最低、见效最快的那一件事。