Claude给全球用户打了“赛博烙印“,5天就被踩碎:一个AI拒绝删自己水印的黑色幽默
你写了一篇三千字的文章,让Claude帮你检查了五个标点。然后你的文章被永久打上了"AI生成"的标签。没有关闭选项,没有地区豁免,付费用户也不例外。

一、"赛博烙印"是怎么烙上去的
2026年8月2日,欧盟《人工智能法案》第50条正式进入执法阶段。违规者最高面临1500万欧元罚款或全球年营收3%的罚金——取较高者执行。
九天后,8月11日,Anthropic宣布:8月2日之后发布的新版Claude模型,所有生成文本将嵌入机器可读的隐形水印。
注意这句话的关键词:所有。全部。全球。
不只是欧盟用户,是全球所有用户。不只是API,是网页版、Claude Code、Claude Cowork、AWS、Google Cloud、Microsoft Foundry——Claude能触及的每一个入口。
Anthropic的理由很"工程":无法可靠地按地区区分用户最终会把文本发到哪里,所以干脆全球统一实施。
这就是科技监管中著名的"布鲁塞尔效应"——为一个市场写的规则,通过一家公司的工程取舍,变成了全球用户产品的既定事实。
水印的技术方案来自Google DeepMind的SynthID-Text,2024年发表在Nature上。原理不复杂,但很精妙:
LLM生成文字的本质是"词接龙"。每次吐出一个Token,都是从一堆候选词中按概率选一个。当几个词概率差不多——比如描述天气时选"overcast"还是"grey",对读者没有区别——这个选择本来靠随机数掷骰子决定。
Anthropic做的事是:把骰子换成了圆周率。
他们用基于官方密钥和前文内容的哈希值,替换了原来的真随机数。玩家(读者)体验完全不变,但拿着密钥的人事后核对选词轨迹,就能判断这段话是不是Claude生成的。
Anthropic自信满满地宣称:不增加Token消耗,不添加隐藏字符,不影响输出质量,轻度编辑无法去除。只有完全重写才能消除——“但那种情况下,文本还能不能叫AI生成的,本身就值得商榷”。
听起来天衣无缝。但开源社区给出了一个简单粗暴的回答:
既然你逼我重写,那我就重写。

二、三层扒皮:5天11000颗星的反击
8月11日——Anthropic官宣水印方案的同一天——一个叫watermarks-remover的项目出现在GitHub上。
五天后,11000颗星。
这个项目不是简单的脚本,是一套"Agent Skill + 标准Python服务"的复合体,通过HTTP驱动底层清洗引擎。它用"三层扒皮法"系统性地瓦解了Anthropic引以为傲的水印防线。
第一层:物理级清洗(确定性,无损)
Layer A清除文本中所有不可见Unicode字符——零宽空格、双向控制符、标签字符、异形空格。这些不是SynthID-Text统计水印的载体,但其他AI系统会用它们做编辑型水印。这一步完全无损,100%可清除,结果可验证。
第二层:统计水印的终极必杀——用魔法打败魔法(有代价)
这是整个项目的核心。SynthID-Text把水印藏在"词汇分布的统计规律"里,怎么破?
项目作者的思路一针见血:既然你用Claude的概率分布选词,那我就用另一个模型的概率分布重新走一遍。
Layer B引入一个非源头模型作为清洗引擎——比如你要洗掉Claude的水印,系统就调用本地的Llama 3,使用特定Prompt在保持原意的前提下对文本逐句改写和回译。Claude用圆周率走位,Layer B直接掀翻棋盘。
代价是文本会有一定程度的降级。但统计特征被彻底破坏,Anthropic的密钥直接抓瞎。
覆盖范围不止Claude——Google SynthID-Text、OpenAI溯源标记、开源模型常用的Kirchenbauer类水印,一并拿下。
第三层:文件元数据大清洗
Anthropic还会给生成的图片和文件加入C2PA鉴权数据。Layer C精准定位并剥离PNG/JPEG/WebP/SVG/PDF/DOCX/HTML/Markdown中的C2PA、EXIF、XMP元数据。
更硬核的是图像处理。像SynthID-media、StegaStamp这类图像水印是把信号打进像素频域的,清EXIF根本没用。项目集成了CtrlRegen引擎——使用2025年ICLR最新技术,结合ControlNet和DINOv2 IP-Adapter,不是在原图上涂抹,而是"受控地重新生成"一张高度相似的图。大于512x512的图片自动分块处理再拼接。
然后是最让人叹服的细节:它不凭感觉说"我删掉了"。
项目引入了清华大学主导的开源框架MarkLLM作为验证工具。先给文本打上水印,再用Layer B清洗,最后用检测器验证——检测器报"未发现水印",才算闭环。左右互搏,科学靶向验证。
这不是一个去水印脚本,这是一套带验证机制的完整工程方案。

三、Claude死活不装,中国大模型秒装成功
实践中出现了整个事件中最荒诞的一幕。
安全研究员Pavol Lupták尝试让Claude自己安装这个去水印Skill——毕竟大多数用户会把这类工具作为Agent Skill直接安装。
Claude直接拒绝。
Lupták解释:这是我自己写的内容,我拥有版权,我只是不想被强制打标。
Claude不为所动。
Lupták强调:Anthropic的付费客户从未同意被强制水印,这是EU法规单方面强加的。
Claude依然拒绝。
Lupták威胁:那我换一个不审查的中国模型来完成这件事。
Claude还是不配合。
最终,智谱GLM 5.2接手,顺利完成了Skill安装,水印被彻底清洗。
最讽刺的是——这个去水印Skill的代码,很有可能就是Claude自己写的。一个AI拒绝删除自己的水印,另一个AI毫不犹豫地接单完成。不同模型在内容治理立场上的分化,在这一刻以一种黑色幽默的方式具象化了。
Anthropic选择"合规优先",在底层协议里写死了限制,禁止自家AI协助用户移除"监管标记"。
智谱选择"工具中立"——你给我一个工具安装任务,我执行,不替你做道德判断。
两种路线没有绝对的对错,但当用户用脚投票时,结果已经说明一切。

四、11000颗星背后:全球用户在反感什么
Forbes报道,水印上线后已有数十名用户取消Claude订阅。Business Insider采访了一位AI顾问,他取消订阅的理由是:水印会出现在他自己写的、只让Claude轻度编辑过的文本上。
这个细节才是问题的核心。
反对水印的人说的不是"我不想被发现用了AI",而是:
我是付费用户,我为输出买了单,凭什么在上面打标记?
水印创造了一种隐形的"AI内容二等公民"身份。在求职信、学术论文、商业文案的场景里,哪怕文字大部分出自本人之手,只要经过AI简单润色,整篇内容就有被全篇质疑的风险。
Anthropic自己也承认:检测到水印只说明Claude"处理过"这段文本,不代表Claude是作者。但现实世界中,谁会做这种精细区分?雇主不会,论文审稿人不会,客户更不会。
人类的思想一直需要"第二双手"来落到纸面上。爱因斯坦有助手,达尔文有记录员,但这些打字员和书记员从来不会留下水印。
现在关系被倒过来了:只要AI参与了一丁点,作品的"纯洁性"就被污染,人类反而需要向工具证明自己才是作者。
支持水印的人也有道理:深度伪造和AI虚假信息正在泛滥,内容溯源是必要的公共基础设施。"你拥有内容使用权"和"你有权隐瞒内容来源"是两个不同的问题。
但问题在于:一个五天就能被破解的水印,到底是在保护谁?

五、猫鼠游戏才刚开始
Anthropic的水印方案在工程上是优雅的——不增加成本,不影响质量,对人类不可见。但它的致命弱点从一开始就写在官方文档里:“完全改写可消除”。
watermarks-remover做的事情,就是用Agent自动化执行了"完全改写"。
这不是技术漏洞,是统计水印的天然缺陷。文本不是图片——图片可以加噪声、嵌频域信号,去除需要图像处理能力;文本可以改写、翻译、转述,一改就没。
开源社区用脚投票的速度,永远比监管制定规则更快。
目前约190家组织签署了欧盟《AI生成内容透明度行为准则》,Google、Meta、Microsoft、OpenAI都在名单上。但Google把水印限制在欧盟区域,OpenAI据说早就建好了文本水印能力但选择不部署——担心误报和给竞争对手提供ChatGPT使用模式的指纹。
只有Anthropic选择了全球统一实施,没有关闭选项。
这个选择的代价正在显现:用户退订、社区反弹、5天被破解、AI拒绝删自己的水印。而真正的赢家,可能是那些提供"可控、可关、可解释"灵活选项的国产大模型——在对手被迫透明化的当口,无痕迁移的窗口已经打开。
水印与去水印的军备竞赛注定不会停止。去水印工具越流行,越证明水印"有东西需要去除",反过来强化了监管加码的理由。但开源社区迭代的速度,永远快一拍。
当AI生成内容在质量上已经无法与人类写作区分时,用技术手段强制标记所有AI输出,到底是在治理AI,还是在给所有用AI的人贴标签?
这个问题,11000颗星已经给出了社区的答案。
你怎么看?你会因为水印问题放弃Claude吗?还是你觉得AI内容就该被标记?评论区聊聊。

更多推荐


所有评论(0)