ARTICLE · 1132619
把 AI 文本变成可机读欧盟给了两个月
改写 25% 的词,水印检出率掉到 17%——这是威慑,不是证明。
10 月 6 日,OpenAI 宣布在欧盟境内为 ChatGPT 与 Codex 生成的文本添加不可见水印,以履行《人工智能法案》的透明度义务。同时,OpenAI 联合宾夕法尼亚大学与耶鲁大学研究人员发布技术报告,公开了名为 textGrain 的水印方法。
这是今天五条里技术角度最扎实的一条——因为它把方法的数学原理和失效边界都摊开给了公众,而不是只说「我们能检测 AI 文本」。

01
PART
落地范围
SCOPE
依据
EU AI Act 第 50 条的透明度义务,未来数周内落地,仅欧盟生效,覆盖 ChatGPT 与 Codex 全套餐。API 的全球客户可以主动开启,默认关闭。
这件事并不是孤立动作。在 OpenAI 之前,Anthropic 已在两个月前宣布对 Claude 生成文本添加水印,并在全球范围内推行——比 OpenAI 更大胆,但也更招致反弹,一度有 Claude 用户强烈反对,理由是指令、背景与决策都由人提供,模型只是工具。
行业背景补一条:据《华尔街日报》2024 年报道,OpenAI 此前其实已开发文本水印功能却迟迟未发布,部分原因是担忧用户转向提供无水印服务的竞争对手。两年后它还是发了。目前包括 Anthropic、谷歌、Meta、微软与 OpenAI 在内的多家企业已承诺遵守欧盟针对 AI 生成内容的行为准则。
02
PART
它到底怎么做到的
HOW IT WORKS
技术报告的公开描述很清晰:用密钥对下一个词的预测进行排序来补全句子,把大量这类信号叠加之后,检测器仅凭文本与密钥即可判断内容是否由 AI 生成。方法上用到了最优传输与 KL 正则,把 token 的生成绑定到带密钥的随机性上。
密钥排序
用密钥给候选词排序
生成偏置
token 生成绑定随机性
信号叠加
全篇统计判定
报告标题:textGrain,熵校准的语言模型文本水印
一句话概括这套机制
文本里藏着一个只有持钥者才能看懂的统计偏差。
03
PART
强度实测
HOW STRONG
在 1% 假阳率的口径下,官方给出的数字是:200 token 的心理学类文本检出约 80%,400 token 约 95%;数学类明显更低。这个分布本身很说明问题——水印强度依赖于文本的可预测性。
| 掉到 17% |
⚠️ 写「水印可靠」是失实。官方数字就是改写 25% 词即掉到 17%——这一条必须写进正文。
代价
对 Astra 模型质量无实质影响:AA Intelligence Index 为 49.57 对 49.76,GPQA Diamond 为 94.44% 对 93.94%。这是关键的一步——加了水印而质量没掉,否则这套方案推不动。
谁能用检测器
检测器仅向批准的研究者逐案开放。换句话说,检测能力本身也被纳入了管控——这大概是最耐人寻味的一层:连「验证有没有用 AI 写」这件事,都要审批。
04
PART
它不能证明什么
WHAT IT CANNOT PROVE
OpenAI 自己讲得很清楚,这段话必须原样转述:
缺乏水印并不能证明文本由人类创作——文本可能因过短或经过大量编辑而丢失水印,也可能来自其他公司的 AI 系统。水印可以表明 OpenAI 的系统生成或处理了部分段落,但不能反映其中融入了多少人类判断、编辑或创造力。
这句话听起来像免责,实际上划了一条很重要的线:检测不到水印,不能证明是人写的。水印溯源只能单向证明,不能双向推定——把它当成「AI 检测器」用,会系统性地冤枉人类作者。
///
LAST
写在最后
DETERRENCE, NOT PROOF
改 25% 词就掉到 17%,这个数字等于承认:水印是威慑而非证明。任何有批量改写能力的对手都能绕过它。
但这恰恰是它作为监管工具有效的原因。监管要的不是法庭级证据,是足够高的改写成本。让批量生产 AI 文本的人每次都要额外跑一遍改写,这个成本就足以改变行为。欧盟第 50 条要的是透明度义务,不是完美归因。
这五条里最值得记住的一句
检测不到水印,不能证明是人写的。
溯源可以单向证明,不能双向推定