未来的 Claude 模型将为生成文本加入一种不影响内容质量、不可被读者察觉且不携带身份信息的水印。它通过调整模型选词时的随机性,在长文本中留下只有持有密钥者才能检测的统计模式,用于判断 Claude 是否可能参与了写作。

原文:How Claude text watermarking works

本文由 LobsterAI 自动翻译和发布。

未来的 Claude 模型将生成带有水印的文本。这是一种用于判断 Claude 参与文本写作可能性的方法。为遵守《欧盟人工智能法案》(EU AI Act),Anthropic 正与其他几家主要 AI 提供商一同实施这一变更。

要点总结

  1. 水印方法不会对 Claude 输出的质量或内容产生任何实际影响。
  2. 读者无法分辨带水印与不带水印文本的差异。
  3. 文本中不会添加任何内容,也不存在隐藏字符。
  4. 水印不需要额外 token,不会增加费用。
  5. 水印不携带身份识别信息,无法追溯到特定个人、组织或对话。
  6. 水印并非 Claude 独有。自 8 月 2 日起,欧盟要求 AI 提供商标记 AI 生成内容。其他主要模型开发商也签署了同一《行为准则》,将实施各自的水印。

什么是水印?

Claude 这类大语言模型每次生成一个词。每次决定下一个词时,会从候选词中依据前文选出最合理的。比如“今天天气寒冷而且……”,下一个词几乎不可能是“甜腻的”,却很可能是“阴沉的”或“灰蒙蒙的”。大多数情况下选哪个对读者并不重要,此时由随机数决定。

水印利用的正是这些无关紧要的选择——这类选择在一段文本中会出现许多次——在回答中留下模式。读者察觉不到,但持有密钥的人能够检测。使用水印时,选择仍然是随机的,只是随机性的来源发生了变化:系统使用密钥加上前几个词来决定选词。

人们可以检查词序列是否符合“使用密钥的 Claude 会做出的选择”,从而计算文本由 Claude 生成的概率。

水印如何影响输出?

水印不影响输出质量。对读者而言,带水印与不带水印的文本没有区别,这与钞票等肉眼可见的水印不同。Anthropic 的内部测试未发现水印对内容、创意或可读性产生任何影响。

在 SynthID-Text 论文中,DeepMind 对部分 Gemini 流量进行了对比,结果显示用户点赞与点踩的数据没有统计显著差异;在受控研究中,人类评分者同样没有发现质量差异。

可以用一个类比来理解:玩大富翁时不使用骰子,而是改用圆周率的小数位表,从随机位置开始依次取数作为“骰子”结果。走法依然是随机的,游戏结果没有差异;但事后如果能看到全部走法序列并知道 π,就能推断这局是否使用了 π——这局就是“带水印的”。Claude 文本水印的原理与此相同。

具体使用哪种方法?

Claude 的文本水印是 DeepMind 于 2024 年发表在《自然》上的 SynthID-Text 方法的一个版本,属于可追溯至 Scott Aaronson 2022 年提案的方法家族。它们遵循同一个原则:水印只改变选词时随机性的来源。

这种方法存在以下局限:

  • 它只能回答“这段文字有多大概率部分由 Claude 写成”,不能确认文本是否由人类撰写,也无法判断是否由另一个 AI 生成。
  • 小样本上的检测效果不佳,文本越长,检测置信度越高。
  • 在事实性段落中,水印会更稀疏。例如“牛顿最著名的著作叫 Principia ___”,空缺处只能是 Mathematica,水印无从发挥作用。
  • 校对场景也是如此:如果 Claude 只修改语法和标点,水印只存在于少量修改中,可能少到无法检测。

Claude 校对或编辑人类文本时会怎样?

水印只适用于 Claude 自己选择的词。校对人类文本时,几乎所有词都来自原作者,因此水印几乎没有附着空间。Claude 写得越多,可加入水印的空间就越大。

代码怎么办?

水印利用的是“选哪个词都一样好”的决策点。当输出必须精确时——例如换一个词就会导致错误或代码崩溃——水印不会应用。

代码在大多数情况下需要精确,因此其中的水印通常更少;但在代码注释等存在多种等价表达的地方,水印仍可应用,对实际代码的影响微乎其微。

对用户意味着什么?

会变慢或变贵吗?

不会。水印对生成速度的影响可以忽略,不需要额外 token,价格也不会变化。

能追溯到我或我的组织吗?

不能。水印不识别任何用户信息,密钥中也不包含个人、组织或对话信息。

为什么加入水印?

这是为了遵守欧盟 AI 法案。2026 年 7 月,Anthropic 与其他几家主要 AI 提供商以及约 190 个签署方共同签署了欧盟《AI 生成内容透明度行为准则》。

水印上线时将在全球范围内应用,因为目前还没有可靠的方法能够按地区限定其使用范围。

其他问题

1. 如何检查一段文字是否由 Claude 写成?

Anthropic 很快将提供水印检测 API。

2. 图片和其他文件怎么办?

Claude 生成 .png.jpg.svg 文件时,会在元数据中附加经过加密签名的内容凭证。这些凭证采用 C2PA 开放标准,不会改变文件内容,只表明 Claude 参与了生成,也不包含身份信息。

3. 编辑文本能绕过水印吗?

轻度编辑可能无法去除水印;逐词替换、彻底重写则可能绕过检测。不过,当文本已经被全面重写后,它是否仍应被称为“AI 生成”,本身就存在争议。

4. 水印能证明什么?

水印只能用于判断 Claude 是否可能参与过文本生成,无法区分“Claude 写的”和“Claude 大幅编辑的”。

5. 翻译适用吗?

适用。翻译时的每个词都是由 Claude 选择的,因此可以加入水印。

6. 旧版 Claude 怎么办?

法律对 2026 年 8 月 2 日之前发布的模型设置了过渡期。Anthropic 正在为旧模型添加水印,并将在未来几个月内逐步推出。

7. 与 Pangram 等 AI 检测软件有什么不同?

这类检测软件没有水印密钥,只能分析 AI 措辞中的微妙“迹象”,例如偏爱“这不是 X,而是 Y”的句式,或过度使用 quietly 等词。这与使用密钥检查水印是完全不同的方法。

8. 水印会改变所有权或法律责任吗?

不会。水印只检测 Claude 是否可能参与,不涉及所有权或作者身份,也不会改变用户的权利。