开发者找到绕过Claude水印的方法
WIRED AI··作者 Isabella Ward
关键信息
Anthropic 的方案采用了类似 SynthID 的方法,通过微妙影响用词和措辞来埋入标记,而不是插入可见文本。文中还提到,检测端的软件尚未公开,因此该绕过方法可能依赖于使用其他没有同样加水印的模型。
资讯摘要
据 WIRED 报道,在 Anthropic 宣布为 Claude 引入隐形文本水印、以配合欧盟《AI 法案》之后,开发者很快就开始分享去除这种水印的方法。某位开发者的去水印代码在 GitHub 上迅速走红,在 X 上被收藏超过 2 万次,并吸引了 100 多名贡献者参与。争议的核心是,Anthropic 计划在 Claude 的词语选择和措辞中嵌入机器可检测的模式,从而无需可见标签也能识别 AI 生成文本。支持者认为这有助于提升透明度,但批评者担心水印会造成误报,并且难以区分重度使用 AI、轻度编辑和普通写作辅助。
文中引用该开发者的话说,他并不反对内容归因,但认为水印本身是个糟糕方案,因为如果被当作证据,可能会不公平地影响求职者或研究人员。文章还提到,Anthropic 表示这种水印不应降低输出质量,不过一些用户仍然担心会影响 Claude 的回答。Meyer 的绕过方法是调用另一个大语言模型生成多个改写版本,通过替换同义词和调整结构来破坏水印模式。报道最后指出,在 Anthropic 公开其检测器之前,这种方法的实际有效性仍未完全确定,而随着欧盟规则推进,更多 AI 提供商未来也可能需要实施类似标记。

资讯正文
他用来移除 Claude 生成文本水印的代码,此后已在 GitHub 上病毒式传播,在 X 上被收藏超过 20,000 次,并吸引了 100 多名贡献者,还有更多人正将这项技术整合进自己的项目中。某位 AI 专家写道:“Anthropic 正在其 Claude 文本中嵌入水印……这个问题几乎在一天后就成了历史”,并配上一张 Meyer 挣脱锁链、站在被踩皱的欧盟和 Anthropic 旗帜上的图片。
在 Anthropic 上周宣布 Claude 将采用水印技术以遵守欧盟《AI 法案》之后,Meyer 和其他人开始研究水印机制是如何运作的。
Meyer 告诉 WIRED,有些人试图规避水印,是因为他们不同意所有 AI 生成内容都应被标注的想法;而包括他自己在内的另一些人则表示,他们只是乐于接受这种技术挑战。他说,自由撰稿人和社交媒体创作者也曾联系他,请他帮助使用这段代码。
本月早些时候生效的新规规定,像 Anthropic 和 OpenAI 这样的模型提供商必须为合成音频、图像、视频或文本添加标签,使机器能够将这些材料识别为 AI 生成内容——否则将面临最高相当于年营业额 3% 的罚款。尽管规则表示,提供商不得营销规避工具,但对独立工具并没有法律限制。
Meyer 说:“我并不反对透明度,我也完全支持内容署名。我只是认为,水印本身就是一个非常糟糕的解决方案,因为它有重大缺陷和风险。”他担心误报风险,以及水印可能无法区分轻度还是重度使用 AI;尤其是因为他母语是法语,经常使用 Claude 和 Grammarly 等其他 AI 工具来编辑自己的写作。他说,把水印当作证据——即便 Anthropic 也承认,它最多只能生成一个概率,表明文本是否被 Claude ‘触碰’过——可能会导致雇主不公正地拒绝求职者,或者因为检测器报错就夸大研究人员使用人工智能的指控。
Anthropic 通过在 Claude 对词语和短语的选择中留下模式来对文本进行不可见水印处理,这种模式人类读者无法察觉,但知道如何寻找的机器可以检测到。由于这会影响 Claude 的输出,一些用户担心这会降低 Claude 回复的质量,尽管 Anthropic 坚称不会如此。这种名为 SynthID 的技术由 Google 开发,自 2023 年以来一直用于为其 AI 生成内容添加水印。计算机科学家 Scott Aaronson 在 OpenAI 工作时也提出过类似方法,但他说公司从未部署,因为公司担心水印会让客户对其产品望而却步。
梅耶的移除方法使用一个不带水印的大语言模型生成多个改写版本,通过替换同义词并稍微重组内容来实现。当然,这依赖于使用其他不会插入水印的大语言模型——这或许并不是一个稳妥的赌注,因为包括 OpenAI、Microsoft 和 Meta 在内的 190 个组织和提供商已经签署了欧盟的透明度行为准则。至于这些实验室中有多少会真正实施自己的水印,目前仍有待观察;这些水印必须包含在所有 8 月起发布的新模型中,并且必须在 12 月前整合到现有模型中。
虽然在 Anthropic 发布其用于检测水印的软件之前,无法确定这个工具是否有效,但在 Silicon Valley 的主权 AI 初创公司 Haimaker 担任首席技术官兼联合创始人的 Wayne Pan 说,理解支撑 Claude 水印机制的基本 SynthID-text 方法,让他相当确信这一方法是有效的。他把梅耶的开源工具整合进了自己的平台,因为他同样不喜欢 Claude 即使只是经过轻微编辑也要给内容加水印的做法,而且不同意水印对用户来说是不可见的。
其他程序员也开发了自己的移除工具:软件工程师 Erik Hughes 花了 15 分钟,借助 Claude 搞出了一个工具,可以去除不可见字符和近似字符,重新排列段落内的句子,并把一些词替换为同义词。牛津大学访问学者 Leon Chlon 说,可以通过压缩 Claude 的回答,把它翻译成一种方言,比如阿拉伯语——与英语相比,这种语言的语义差异很大——然后再翻译回来,从而去除水印。Anthropic 自己也承认,经过大量编辑、改写或翻译的内容可能不会带有水印。
Anthropic 发言人在给 WIRED 的声明中说:“我们正在为 Claude 的输出添加标记,以遵守欧盟 AI 法案,其他实验室也在采取类似措施。识别 AI 生成文本很难,而这为人们提供了更好的识别工具。来自受支持的 Claude 模型的文本,包括 Claude Code 的输出,都将带有不可见水印,而且这不会改变 Claude 回复的含义、质量或可读性。我们还计划推出一个文本检测 API,这样用户就可以自行完成更多工作。”
Anthropic 表示,公司正在研究如何为文本实现水印检测,并计划很快发布相应工具——届时开发者最终就能看到他们的方法是否万无一失。公司也在继续努力改进水印系统。Pan 说:“我认为他们是想表明,他们确实是本着善意在做这件事,但我不认为你能拥有一种能经受住一切考验的水印。”
来源与参考
收录于 2026-08-20