Anthropic 近期宣布,自 2026 年 8 月 2 日起推出的新款 Claude 模型,将在生成文本中加入不可见、机器可识别的水印,同时为部分生成文件加入来源信息。这项安排与欧盟《人工智能法案》关于标识人工智能生成内容的透明度要求有关。

随着 Claude 文本水印功能受到关注,相关去水印工具也开始在网络上出现。IT之家报道称,已有工具或代码项目声称可以通过改写文本等方式削弱 Claude 输出中的统计特征;公开社区中也出现了针对 Claude 水印清理工具的讨论。不过,Anthropic 目前尚未公开面向公众的文本水印检测器,因此外部工具是否真正识别并移除了水印,仍缺乏可独立验证的结果。
从技术路径看,文本水印通常通过调整模型生成词语或 token 的统计分布来嵌入信号,而不是在复制后的文本中添加肉眼可见的字符。已有研究显示,针对生成文本进行改写、释义或其他有针对性的修改,可能在保留大致语义的同时削弱水印信号,但效果会受到文本长度、语言、修改幅度和具体水印方案影响。
这意味着,当前所谓“去水印”工具更可能是在重写文本,而不是像处理图片元数据那样直接删除一个可定位的文件字段。对用户而言,重写可能改变原文措辞、细节和表达风格;对平台和检测机构而言,水印能否稳定识别,也仍取决于 Anthropic 是否公开检测机制,以及后续工具能否应对翻译、改写和人工编辑等操作。