Claude又出新花样?文本隐形水印落地:欧盟法案如何逼出透明度
Claude文本隐形水印落地:欧盟法案如何逼出透明度
关键词:Claude、文本水印、SynthID-Text、欧盟AI法案、C2PA
目录
- 导语
- 一、事件本身:从"偷偷藏标记"到"官方正式功能"
- 二、技术拆解:水印是怎么"织"进文字的
- 三、覆盖范围与时间表:全球生效,旧模型限期补课
- 四、水印能证明什么、不能证明什么
- 五、水印能被擦掉吗?98.3%的移除率研究
- 六、行业格局:谁签了、谁没签
- 七、对 AI 应用开发者的实际影响
- 冷静视角:三个待解的问题
- 总结
导语
8 月 14 日,Anthropic 发布官方博客,首次公开 Claude 文本水印的技术细节:新模型生成的文字将在选词环节嵌入肉眼不可见、可随复制粘贴传播的机器可读水印,且全球生效。这不是 Anthropic 的主动创新,而是欧盟 AI 法案第 50 条 8 月 2 日生效后的首个头部厂商落地动作。水印怎么藏、能不能擦、查出来又说明什么——这篇一次讲清。
一、事件本身:从"偷偷藏标记"到"官方正式功能"
先理清时间线:
| 时间 | 事件 |
|---|---|
| 2026-06-30 | 有开发者逆向 Claude Code 打包文件,发现系统提示词里藏着针对特定时区的隐形 Unicode 标记,引发争议 |
| 2026-07-20 | 欧盟委员会发布 AI 法案第 50 条透明度义务最终指南;同日一篇 arXiv 论文测出主流文本水印的释义移除率高达 98% 以上 |
| 2026-07-31 | 欧盟委员会通报约 190 家机构签署《AI 生成内容透明度行为准则》 |
| 2026-08-02 | AI 法案第 50 条透明度义务正式生效 |
| 2026-08-11 | Anthropic 帮助中心上线《Claude 如何标记 AI 生成内容》 |
| 2026-08-14 | Anthropic 发布官方博客《How Claude’s text watermark works》,公开技术原理 |
两件事要分开看:文本加水印和文件加签名元数据。
- 文本水印:直接织入文字本身,不是元数据。复制粘贴会带走它,轻度编辑后可能仍然留存;
- 文件溯源:Claude 生成 .png、.jpg、.svg 等受支持文件时,附加遵循 C2PA 开放标准的数字签名元数据——这是"来源档案",不是水印,文件内容本身不变。
触发因素很明确:欧盟 AI 法案第 50 条第 2 款要求生成式 AI 系统对输出做机器可读标记,Anthropic 签署了配套的《AI 生成内容透明度行为准则》。违规代价不低——最高 1500 万欧元或全球年营业额 3% 的罚款。
二、技术拆解:水印是怎么"织"进文字的
1 不是藏字符,而是换随机数
很多人第一反应是"往文字里塞不可见 Unicode 字符"——正是 6 月底 Claude Code 事件里被扒出的手法。但这次官方方案完全不同,Anthropic 明确写了:不添加任何内容,没有隐藏字符。
原理要从大语言模型的生成方式说起。模型逐词生成,每步在候选词里做选择。以"今天天气又冷又……“为例,下一个词几乎不可能是"甜”,但"阴沉"和"灰蒙"都合理——两者对读者没区别,选谁由随机数决定。
水印动的就是这个随机数:
普通生成:随机数生成器 → 决定选哪个候选词
水印生成:密钥 + 前文几个词 → 推导出"有规律的随机数" → 决定选哪个候选词
选出的词依然是"正常候选",不会蹦出生僻词,句子读起来毫无区别。但持有密钥的检测方可以检查整段文字的用词序列,判断它是否符合"用该密钥生成"的统计规律,从而给出"Claude 参与生成"的概率。
这套方法叫 SynthID-Text,由 Google DeepMind 在 2024 年发表于 Nature,思想源头是 Scott Aaronson 2022 年在 OpenAI 期间提出的方案。
2 大富翁与圆周率的类比
Anthropic 官博给了一个精准类比:玩大富翁时掷骰子决定走几步,完全随机。现在改成翻一本圆周率小数位的书,从随机一页开始,依次用后面的数字当"骰子"。对玩家来说走法照样随机、游戏体验毫无变化;但事后只要拿到走法记录和圆周率,就能推断这局是不是用圆周率"掷"的。
水印同理:不改变阅读体验,只改变随机性的来源。
3 官方承诺的五个"不"
官博开篇列了六条保证,对使用者最关键的五个:
- 不影响质量:内部测试未见对内容、创造力、可读性的影响;SynthID-Text 论文中 Google 对部分 Gemini 真实流量做过 A/B 测试,点赞点踩无统计显著差异;
- 不加隐藏字符:文本中没有任何额外内容;
- 不加价:水印不产生额外 token,推理成本不变;
- 不可追溯:水印和密钥里不含任何用户、组织或会话信息,查出水印也无法定位到具体的人;
- 不是 Claude 独有:欧盟要求覆盖所有服务其市场的 AI 厂商,其他签署方也会实现各自的水印。
三、覆盖范围与时间表:全球生效,旧模型限期补课
产品线全覆盖:Claude 应用、API(Claude Platform)、Claude Code、Claude Cowork、Claude Tag,以及通过 AWS、Google Cloud、Microsoft Foundry 接入的云客户,全部适用。
地域无差别:虽然由欧盟法案驱动,但 Anthropic 明确表示全球统一施行——官方解释是"目前还没有按地区区分的持久方案"。
时间线:
| 模型类型 | 要求 |
|---|---|
| 2026-08-02 之后发布的新模型 | 发布即带水印 |
| 之前已上市的旧模型 | 过渡期内完成适配,欧盟 Digital Omnibus 给出的期限是 2026-12-02 |
一个容易被忽略的细节:目前在售的 Sonnet 5(6 月 30 日发布)和 Opus 5(7 月 24 日发布)都早于 8 月 2 日节点,也就是说当前正在使用的 Claude 模型暂未确认带水印,适配工作将在未来几个月陆续推出。
四、水印能证明什么、不能证明什么
1 四个"失灵"场景
Anthropic 在官博里罕见地详细披露了技术局限,值得逐条看:
场景一:校对几乎不留痕。 你写了一篇三千字的文章让 Claude 只改错别字,它改了二十处——水印只能附着在那二十处改动上,大概率不够形成可检测信号。但反过来,一旦检出水印,你也很难证明其余 99% 是自己写的。
场景二:纯事实文本没空间。 “牛顿最著名的著作叫《自然哲学的数学原理》……”——下一个词只有一个正确答案,没有"选谁都行"的自由度,水印无处下手。表达越精确,水印越稀疏。
场景三:短文本信号不足。 一两百字的邮件回复,可选词有限,统计信号撑不起可靠判断。文本越长,置信度越高。
场景四:代码大部分免疫。 代码要求精确输出,2 + 2 = 后面只能是 4,水印不会介入。只有注释、变量命名这类有自由度的位置可能带水印。Anthropic 称对实际代码的影响"可忽略不计"——但对工程师来说,“可忽略"从来不等于"零”。
2 翻译场景的反转
最微妙的是翻译:你写的中文文章让 Claude 翻成英文,每个英文词都是 Claude 选的,水印信号拉满——但思想和内容全是你的。检出水印只能说明"Claude 可能参与过",无法区分"Claude 原创"还是"Claude 翻译/润色了你的作品"。
这正是官博的原话:水印无法区分"Claude 写了这个"和"Claude 重度编辑了这个"。
同样要记住反面:查不到水印也不能证明是人写的——旧模型输出、大幅改写、格式转换剥离元数据,都会让标记消失。
五、水印能被擦掉吗?98.3%的移除率研究
这是整个事件里最扎眼的数据。2026 年 7 月 20 日的论文《AI Watermark Evidence Fails Forensic Readiness》(arXiv:2607.16010)对 KGW、Unigram、SynthID 三种主流文本水印做了实证测试,846 轮有效释义实验的结果:
| 水印方案 | 单轮释义后的条件移除率 | 未篡改时的漏检率 |
|---|---|---|
| KGW | 100% | 约 70% |
| Unigram | 100% | 约 83% |
| SynthID | 98.3% | 约 80% |
也就是说:把带水印的文字丢给 AI 释义工具改写一遍,绝大多数水印就没了,不需要任何漏洞利用代码,改写是人人都会的正常编辑操作。更麻烦的是可靠性——SynthID 配置还把 5.4% 的纯人类文本误判为 AI 生成。
论文作者按美国法庭采信科学证据的 Daubert 五要素逐一对照,三种方案没有一种满足三项以上。结论很直接:文本水印是概率信号,不是法庭证据;负结果不能洗白文档,正结果也不能给人定罪。
Anthropic 官博对此的回应是:"轻度编辑可能去不掉水印,彻底重写每个词才行——但那种情况下,这段文字还能算 AI 生成的吗?"这个反问有道理,但也承认了水印与"深度改写"之间的军备竞赛没有终点。
六、行业格局:谁签了、谁没签
截至 7 月底,约 190 家机构签署了《AI 生成内容透明度行为准则》——83 家签提供方章节(含 Anthropic、Google、Meta、Microsoft、OpenAI、Mistral、Cohere),152 家签部署方章节(含 Getty Images、联想、汉莎航空)。三大玩家的水印进度差异明显:
| 厂商 | 文本水印现状 | 备注 |
|---|---|---|
| 已在用:SynthID-Text 随 Gemini 上线,并已开源 | 7 月 24 日签署准则,同时与 Apple、OpenAI、NVIDIA、ElevenLabs、Kakao 共建跨平台水印互操作 | |
| Anthropic | 已宣布,新模型发布即带,旧模型 12 月前适配 | 首个公开完整技术细节的头部厂商 |
| OpenAI | 已签署准则,计划将溯源信号扩展到文本 | 图像/音频已用 C2PA + SynthID,文本方案细节未定 |
| xAI(Grok) | 未签署准则 | 唯一拒签的主要大模型厂商,但仍受 AI 法案约束 |
值得注意的是 Google 的角色:SynthID 既是 Anthropic 采用的技术源头,又是 Google 正在推的行业互操作标准——水印这件事上,Google 同时是技术供应方和规则签署方。
七、对 AI 应用开发者的实际影响
第一,合规责任不会随水印自动转移。 Anthropic 在说明中特别提示:在自有产品中部署 Claude 的开发者,应独立评估 AI 法案第 50 条对自身产品的要求。也就是说,你用 Claude API 做了一个面向欧盟用户的文案生成产品,标记义务在你这层仍然成立,不因上游加了水印而豁免。
第二,检测 API 是"期货"。 Anthropic 确认将推出水印检测 API,但"正在敲定实现细节"——没有时间表、没有精度承诺。短期内想做"AI 内容审核"的产品,拿不到官方检测能力。
第三,水印与 Pangram 类检测工具是两回事。 第三方检测工具没有密钥,只能靠文风统计特征猜(比如 AI 偏爱"这不是 X,而是 Y"句式、滥用"quietly"这类词),误判是常态;水印检测是拿密钥验签名,原理上可靠得多——但前提是文本没被改写。
第四,C2PA 元数据比文本水印更脆弱也更有用。 文件重新保存、转格式、截图都会剥离元数据,但它在未被剥离时的证据力远强于统计水印—— cryptographically signed(密码学签名)而非概率推断。对需要强溯源的场景(新闻图片、设计交付物),应优先依赖 C2PA 这类签名凭证,而不是指望文本水印。
冷静视角:三个待解的问题
1. 信号与铁证之间的鸿沟。 法律要求"可靠、稳健"的标记,技术给出的却是"一次释义移除 98.3%"的概率信号。欧盟把水印写进法规时,它还不是一个成熟的溯源机制——规则先行、技术追赶的错位,会在未来两年的合规审计中持续暴露。
2. 举证责任的倒置风险。 水印只能证明"Claude 可能参与过",不能区分原创与润色。当检测工具上线,用过 Claude 的人都可能面临自证清白的处境:你的文章被检出水印,你怎么证明核心内容是自己写的?目前没有任何技术能回答这个问题。
3. 全球生效的隐私边界。 好消息是水印不含用户身份信息、不可追溯到个人或会话;争议点在于,一个由欧盟法规驱动、却对全球所有用户无差别生效的标记机制,其治理边界到底应该由谁划定。Anthropic 的解释是"技术上无法按地区区分"——这个理由能成立多久,取决于按地区路由的方案何时成熟。
总结
把这次事件放回它本来的位置:
- 性质:这是欧盟 AI 法案第 50 条生效后的首个头部厂商落地动作,不是 Anthropic 的自愿创新,全球生效是技术限制下的被动选择;
- 技术:SynthID-Text 通过替换选词随机数的来源织入水印,不加字符、不降质量、不加价、不可追溯,但在校对、翻译、短文本、代码、纯事实五类场景存在明显盲区;
- 对抗:现有研究显示单轮释义即可移除 98% 以上的 SynthID 水印,水印是概率信号而非铁证,攻防是长期军备竞赛;
- 格局:Google 已在用并开源,OpenAI 跟进中,xAI 拒签准则;检测 API 尚未上线;
- 对开发者:合规责任不因上游水印而转移,强溯源场景应押注 C2PA 签名凭证而非统计水印。
AI 生成内容的"隐形墨水时代"确实开始了,但第一滴墨水的防水性能,远没有宣传的那么可靠。
#Claude #文本水印 #SynthID #欧盟AI法案 #C2PA
更多推荐



所有评论(0)