未来的 Claude 模型将为生成文本加入一种不影响内容质量、不可被读者察觉且不携带身份信息的水印。它通过调整模型选词时的随机性,在长文本中留下只有持有密钥者才能检测的统计模式,用于判断 Claude 是否可能参与了写作。
原文:How Claude text watermarking works
本文由 LobsterAI 自动翻译和发布。
未来的 Claude 模型将生成带有水印的文本。这是一种用于判断 Claude 参与文本写作可能性的方法。为遵守《欧盟人工智能法案》(EU AI Act),Anthropic 正与其他几家主要 AI 提供商一同实施这一变更。
要点总结
- 水印方法不会对 Claude 输出的质量或内容产生任何实际影响。
- 读者无法分辨带水印与不带水印文本的差异。
- 文本中不会添加任何内容,也不存在隐藏字符。
- 水印不需要额外 token,不会增加费用。
- 水印不携带身份识别信息,无法追溯到特定个人、组织或对话。
- 水印并非 Claude 独有。自 8 月 2 日起,欧盟要求 AI 提供商标记 AI 生成内容。其他主要模型开发商也签署了同一《行为准则》,将实施各自的水印。
什么是水印?
Claude 这类大语言模型每次生成一个词。每次决定下一个词时,会从候选词中依据前文选出最合理的。比如“今天天气寒冷而且……”,下一个词几乎不可能是“甜腻的”,却很可能是“阴沉的”或“灰蒙蒙的”。大多数情况下选哪个对读者并不重要,此时由随机数决定。
水印利用的正是这些无关紧要的选择——这类选择在一段文本中会出现许多次——在回答中留下模式。读者察觉不到,但持有密钥的人能够检测。使用水印时,选择仍然是随机的,只是随机性的来源发生了变化:系统使用密钥加上前几个词来决定选词。
人们可以检查词序列是否符合“使用密钥的 Claude 会做出的选择”,从而计算文本由 Claude 生成的概率。
水印如何影响输出?
水印不影响输出质量。对读者而言,带水印与不带水印的文本没有区别,这与钞票等肉眼可见的水印不同。Anthropic 的内部测试未发现水印对内容、创意或可读性产生任何影响。
在 SynthID-Text 论文中,DeepMind 对部分 Gemini 流量进行了对比,结果显示用户点赞与点踩的数据没有统计显著差异;在受控研究中,人类评分者同样没有发现质量差异。
可以用一个类比来理解:玩大富翁时不使用骰子,而是改用圆周率的小数位表,从随机位置开始依次取数作为“骰子”结果。走法依然是随机的,游戏结果没有差异;但事后如果能看到全部走法序列并知道 π,就能推断这局是否使用了 π——这局就是“带水印的”。Claude 文本水印的原理与此相同。
具体使用哪种方法?
Claude 的文本水印是 DeepMind 于 2024 年发表在《自然》上的 SynthID-Text 方法的一个版本,属于可追溯至 Scott Aaronson 2022 年提案的方法家族。它们遵循同一个原则:水印只改变选词时随机性的来源。
这种方法存在以下局限:
- 它只能回答“这段文字有多大概率部分由 Claude 写成”,不能确认文本是否由人类撰写,也无法判断是否由另一个 AI 生成。
- 小样本上的检测效果不佳,文本越长,检测置信度越高。
- 在事实性段落中,水印会更稀疏。例如“牛顿最著名的著作叫 Principia ___”,空缺处只能是 Mathematica,水印无从发挥作用。
- 校对场景也是如此:如果 Claude 只修改语法和标点,水印只存在于少量修改中,可能少到无法检测。
Claude 校对或编辑人类文本时会怎样?
水印只适用于 Claude 自己选择的词。校对人类文本时,几乎所有词都来自原作者,因此水印几乎没有附着空间。Claude 写得越多,可加入水印的空间就越大。
代码怎么办?
水印利用的是“选哪个词都一样好”的决策点。当输出必须精确时——例如换一个词就会导致错误或代码崩溃——水印不会应用。
代码在大多数情况下需要精确,因此其中的水印通常更少;但在代码注释等存在多种等价表达的地方,水印仍可应用,对实际代码的影响微乎其微。
对用户意味着什么?
会变慢或变贵吗?
不会。水印对生成速度的影响可以忽略,不需要额外 token,价格也不会变化。
能追溯到我或我的组织吗?
不能。水印不识别任何用户信息,密钥中也不包含个人、组织或对话信息。
为什么加入水印?
这是为了遵守欧盟 AI 法案。2026 年 7 月,Anthropic 与其他几家主要 AI 提供商以及约 190 个签署方共同签署了欧盟《AI 生成内容透明度行为准则》。
水印上线时将在全球范围内应用,因为目前还没有可靠的方法能够按地区限定其使用范围。
其他问题
1. 如何检查一段文字是否由 Claude 写成?
Anthropic 很快将提供水印检测 API。
2. 图片和其他文件怎么办?
Claude 生成 .png、.jpg 或 .svg 文件时,会在元数据中附加经过加密签名的内容凭证。这些凭证采用 C2PA 开放标准,不会改变文件内容,只表明 Claude 参与了生成,也不包含身份信息。
3. 编辑文本能绕过水印吗?
轻度编辑可能无法去除水印;逐词替换、彻底重写则可能绕过检测。不过,当文本已经被全面重写后,它是否仍应被称为“AI 生成”,本身就存在争议。
4. 水印能证明什么?
水印只能用于判断 Claude 是否可能参与过文本生成,无法区分“Claude 写的”和“Claude 大幅编辑的”。
5. 翻译适用吗?
适用。翻译时的每个词都是由 Claude 选择的,因此可以加入水印。
6. 旧版 Claude 怎么办?
法律对 2026 年 8 月 2 日之前发布的模型设置了过渡期。Anthropic 正在为旧模型添加水印,并将在未来几个月内逐步推出。
7. 与 Pangram 等 AI 检测软件有什么不同?
这类检测软件没有水印密钥,只能分析 AI 措辞中的微妙“迹象”,例如偏爱“这不是 X,而是 Y”的句式,或过度使用 quietly 等词。这与使用密钥检查水印是完全不同的方法。
8. 水印会改变所有权或法律责任吗?
不会。水印只检测 Claude 是否可能参与,不涉及所有权或作者身份,也不会改变用户的权利。