近期AI热点008|Claude 文本水印与AI内容溯源

主要信息源:Anthropic 官方文章、Nature SynthID-Text 论文、C2PA 规范和欧盟 AI Act 资料
关键词:Claude、文本水印、SynthID-Text、内容溯源、C2PA、EU AI Act、AI 检测

官方资料(建议先打开)

Anthropic 在 2026 年 8 月 14 日发布了一篇技术说明,介绍 Claude 未来模型中的文本水印方案。这个消息容易被简化成“Claude 写的文章会出现隐藏标记”,但官方描述的机制并不是在文本里插入特殊字符,也不是把用户身份写进内容。

它更接近一种统计信号:模型每次选择下一个 Token 时,利用密钥控制随机性的分布;检测器再检查整段文本是否符合该分布。最终结果是“Claude 可能参与生成”的概率判断,而不是作者身份证明。

一、文本水印不是隐藏字符

大模型生成文本时,会先计算下一个 Token 的概率。例如在“今天的天气”后面,候选可能包括“很好”“不错”“比较凉爽”等。采样参数决定了模型是否总是选择最高概率项,还是在多个合理候选之间随机选择。

Anthropic 说明,Claude 的水印方案不改变候选 Token 集合,也不额外添加文字、空格或不可见字符。它改变的是随机性的来源:普通随机数被替换为由密钥和前文 Token 共同决定的伪随机过程。

可以把过程抽象成:

前文 Token + 模型概率分布
              ↓
      密钥控制的伪随机采样
              ↓
       下一个可见 Token

读者看到的句子仍然是正常文本,阅读体验不会显示“这段话有水印”。检测方在拿到文本后,使用相应密钥计算这串 Token 是否呈现出预期的统计模式,并据此给出置信度。

二、为什么控制 Token 选择可以留下信号

水印依赖的是“有多个近似等价的表达方式”。如果一句话只能用一个词表达,模型几乎没有可调整的空间;如果有多个意思相近的候选词,就可以在不明显改变语义的情况下,让其中一部分候选更容易被选中。

下面是一个概念示例,不代表真实的候选集合:

# 自由文本:多个表达都可能合理
text_candidates = ["overcast", "grey", "cloudy"]

# 精确代码:通常只有一个正确结果
code_candidates = ["4"]

单个 Token 的偏向非常微弱,读者无法凭肉眼判断。只有在足够长的文本中,许多次选择累积起来,检测器才有可能观察到统计差异。这也是为什么水印检测需要概率模型,而不是简单搜索某个固定字符串。

Anthropic 称该方法基于 Google DeepMind 的 SynthID-Text 方法的一个版本。SynthID-Text 论文讨论了如何在保持文本质量的同时,把检测信号分散到生成过程的多次采样中。Anthropic 没有公开 Claude 使用的密钥、具体阈值和完整检测实现,因此不能把论文中的示例参数直接当作 Claude 的配置。

三、一个简化的检测伪代码

下面代码只用于解释“密钥、前文和候选集合如何参与评分”,不是 Anthropic 或 SynthID-Text 的官方源码,也不能直接检测 Claude 文本:

def watermark_score(tokens, key):
    score = 0.0

    for index in range(1, len(tokens)):
        previous = tokens[:index]
        candidates = get_valid_candidates(previous)

        # 机制示意:真实算法会按密钥和前文生成统计分区
        preferred = keyed_candidate_set(key, previous, candidates)

        if tokens[index] in preferred:
            score += 1

    return score / max(len(tokens) - 1, 1)

真实检测至少还要处理以下问题:

  • 使用什么 Token 化方式;
  • 哪些候选词属于“可安全调整”的集合;
  • 采样温度和 Top-p 如何影响信号;
  • 如何计算统计显著性和置信区间;
  • 如何在不同语言、文本长度和编辑强度下控制误报率;
  • 密钥如何保管、轮换和授权给检测服务。

因此,不能用“命中比例超过 50%”之类的规则自行判断一篇文章是否由 Claude 生成。没有官方检测器和阈值时,任何第三方脚本都只能算实验性分析。

四、检测结果能证明什么,不能证明什么

水印检测的结论边界很重要。即使检测器给出很高的置信度,它最多说明:这段文本的统计特征与 Claude 的生成过程相符,Claude 可能参与过生成。对程序员来说,真正的问题是:代码复制进项目后还算不算原始生成内容,改几个变量名会不会改变结果?

它不能证明:

  • 文本完全由 Claude 独立写成;
  • 文本没有经过人工修改;
  • 文本不是其他模型生成的;
  • 文本一定不是人类写的;
  • 可以追溯到某个具体用户、组织或会话。

Anthropic 明确表示,水印不包含用户、组织、会话或身份信息,也不能追溯到具体个人或机构。对于内容审核、学术诚信和版权争议,这个限制意味着水印应当是辅助证据,而不是单独作出处罚决定的依据。

五、程序员最关心的问题:复制代码后还能检测吗

1. 直接复制粘贴 AI 生成的代码

复制粘贴不会自动消除水印,也不会把 Claude 会话 ID、用户身份或“AI 生成”标签写进普通源代码文件。它只是把相同字符放进编辑器,因此从文本内容看,原来的 Token 序列基本没有变化。

但代码的水印信号通常比自然语言弱。自然语言有很多近义表达,模型可以在不改变意思的情况下调整候选词;代码则必须满足语法、类型和运行结果要求,可供调整的 Token 少。结果可能是:复制后信号仍然存在,但从一开始就不足以稳定检测。

2. 全局替换变量名

例如把下面代码中的 order_itemstotal_price 全局替换成别的名字:

def calculate_total(order_items):
    total_price = sum(item.price for item in order_items)
    return total_price

变量名对应的 Token 会改变,但函数结构、关键字、运算符和大部分语句仍然保留。如果只改几个变量,变化只占文件的一小部分;如果同时重构函数、调整控制流程并重写注释,变化会更大。

因此,“改变量名就一定检测不到”是不可靠的结论。检测结果还取决于代码长度、修改比例、注释是否保留,以及 Anthropic 最终检测器使用的阈值。官方目前没有公布代码检测所需的 Token 数量和准确率。

3. 使用 Black、Prettier 或 gofmt

自动格式化会改变空格、换行、引号和括号布局:

result = calculate(a,b,c)
# 格式化后
result = calculate(a, b, c)

这些变化可能影响 Token 化,但不一定改变代码的核心 Token。官方没有说明检测器是否会先做格式归一化,所以不能确定一次格式化会让信号保留还是减弱。

4. 删除注释和文档字符串

注释比代码语句更接近自然语言,通常有更多可替代表达:

# Retry the request when the upstream service is temporarily unavailable.

因此,注释、README 和文档字符串比精确的代码语句更可能留下统计信号。只修改变量名,却保留大段 AI 生成的注释,仍可能留下可检测内容;删除或重写注释可能减少信号,但也不能保证检测结果变成否定。

5. 只复制一小段代码

把十几行 AI 代码放进一个几千行的人类项目,不代表整个项目都会被识别为 AI 生成。短片段缺少足够统计样本,和大量已有代码混合后,信号还可能被稀释。

6. 交给另一个 AI 重写

如果把 Claude 代码交给另一个模型完整重构,原有 Token 序列可能大幅变化,Claude 的原始统计信号会被削弱。但这不等于“清除水印”:第二个模型可能使用自己的生成标记,最终文本可能包含另一种统计信号。

7. 实际操作对照表

操作 是否改变 Token 对检测的可能影响
原样复制粘贴 基本不改变 原信号保留,但代码可能本来就难检测
修改少量变量名 改变一部分 可能略微削弱,无法确定是否低于阈值
全局重命名多个标识符 改变较多 影响可能更明显,但没有固定结论
自动格式化 改变格式相关 Token 可能影响,官方处理方式未知
删除或重写注释 改变自然语言 Token 可能比修改代码格式影响更大
只采用几行代码 样本很短 通常缺少稳定检测所需的信息
大规模人工重构 大量改变 原水印可能明显减弱

这里的关键词是“可能”。Anthropic 目前只公布了机制方向,没有公布 Claude 代码场景的检测 API、阈值、误报率和独立测试结果。因此,不能把任何一种编辑操作当成确定的通过检测方法。

六、哪些文本更容易或更难检测

水印效果与文本类型密切相关。

1. 文本太短

短句包含的采样次数太少,统计信号不足。标题、短信、单句回答很难达到稳定的检测置信度。即使长文章被截取成几段,也可能失去足够上下文。

2. 事实性文本

天气数据、法律条文、产品型号和 API 参数等内容通常没有多少自由表达空间。候选 Token 少,模型不应为了水印而选择错误或不准确的词,因此信号会更稀疏。

3. 只做语法校对

如果模型只改动几个标点或错别字,新增的模型 Token 很少,原文的统计特征仍然占主导地位,检测可能不稳定。

4. 翻译

翻译时,目标语言中的大多数词都由模型重新选择,因而通常比轻度润色留下更多可检测信号。但经过人工重写、再次翻译或多次改写后,信号仍可能被削弱。

5. 代码

代码语法和标识符往往要求精确匹配,等价候选比自然语言少。Claude 不会为了水印而选择会导致编译错误的 Token,所以源代码中的水印通常很少。注释、文档字符串和变量命名等有自由措辞的部分,可能留下少量信号。

这意味着“检测不到水印”不能反推出“没有使用 Claude”,只能说明当前文本没有提供足够可靠的统计证据。

七、文本水印与 C2PA 不是一回事

Anthropic 还说明,Claude 生成或处理部分 PNG、JPG、SVG 等图像文件时,会附加 C2PA 内容凭证。

C2PA 是写入文件元数据中的加密签名记录,通常用于描述文件的来源和处理过程。它与文本水印的区别如下:

机制 作用位置 检查方式 主要限制
Claude 文本水印 Token 选择过程 统计检测 受文本长度和编辑影响
C2PA 内容凭证 文件元数据 验证数字签名 元数据可能在转码或截图时丢失

C2PA 不是隐藏在像素里的不可见水印,也不等于区块链存证。它可以说明某个工具参与过文件生成或处理,但不会自动提供操作者的真实身份。文件被重新导出、截图或经过不支持 C2PA 的软件处理后,凭证可能无法保留。

八、为什么现在推出:法规与平台治理

Anthropic 将这项工作与欧盟 AI Act 的透明度要求联系起来。公司还表示,已与约 190 个签署方参与 2026 年 7 月发布的 AI 生成内容透明度 Code of Practice,并计划让未来 Claude 模型默认带有文本水印。

目前官方表述是“未来模型”会采用该机制,旧模型则会根据法律过渡期在未来几个月逐步加入。检测 API 仍标注为 coming soon,具体调用方式、价格、配额、阈值和误报率尚未公开。

这说明水印首先是平台治理和内容透明度能力,而不是面向普通用户的“查 AI 工具”。真正落地后,学校、媒体和内容平台仍需要把检测结果与人工复核、作者声明、编辑记录和来源凭证结合起来。

九、开发者可以怎样提前设计

如果你的系统要接入 AI 内容检测,建议把检测结果设计成概率和证据字段,而不是布尔值:

{
  "provider": "anthropic",
  "model_participation": "possible",
  "confidence": null,
  "text_length": 1832,
  "edited_after_generation": "unknown",
  "decision": "manual_review"
}

在官方 API 尚未公开前,confidence 不应填入自行猜测的分数。系统还应保存文本版本、生成时间、编辑操作和检测器版本,便于以后复核。对于高风险场景,应采用“检测信号 + 人工复核 + 申诉流程”,避免把统计结果直接转换成封号、扣分或侵权结论。

如果你在开发自己的 Agent,也应注意提示词和工具日志中可能包含敏感内容。水印不记录身份,并不意味着调用日志可以随意公开;真正的隐私保护仍取决于日志权限、保存周期和数据脱敏策略。

十、当前仍需观察的技术问题

截至本文成稿,官方尚未披露以下关键数据:

  1. 不同语言和文本长度下的误报率、召回率;
  2. 改写、翻译、摘要和拼写校对对水印信号的影响;
  3. 检测 API 的访问资格、计费方式和速率限制;
  4. 密钥轮换、第三方审计和检测结果复现机制;
  5. 旧模型迁移到水印方案时的具体时间表。

这些信息决定了水印能否从“研究机制”变成可靠的生产治理工具。在 API 和独立评测发布之前,最稳妥的判断是:Claude 文本水印提供了一种新的来源线索,但还不是通用、绝对的 AI 文本鉴定器。

总结

Claude 文本水印的核心思路,是把密钥控制的统计模式分散到 Token 采样中,让文本保持正常外观,再由检测器判断其生成轨迹是否符合预期。它不添加隐藏字符、不增加 Token,也不包含用户身份信息。

这项技术的价值在于提高 AI 内容透明度,尤其适合与文件级 C2PA 凭证、平台来源记录和人工审核配合使用。它的边界同样清楚:短文本、事实文本、代码和重写内容可能缺少足够信号;检测结果只能说明“模型可能参与”,不能单独证明作者身份或责任归属。

对开发者来说,真正值得提前准备的是证据链设计:记录内容版本和生成来源,区分概率检测与确定事实,并为误判保留人工复核和申诉通道。

参考资料

  • Anthropic:How Claude’s text watermark works,2026-08-14
    https://www.anthropic.com/news/claude-text-watermark
  • Google DeepMind:SynthID-Text,Nature 论文
    https://www.nature.com/articles/s41586-024-08025-4
  • European Commission:Regulatory framework for AI
    https://digital-strategy.ec.europa.eu/en/policies/regulatory-framework-ai
  • C2PA:Technical Specification 2.2
    https://c2pa.org/specifications/specifications/2.2/index.html
Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐