×
加载中...
Claude偷偷上线隐形水印,每个字都可全球追踪
新智元 2026-08-11 14:20

8 月 2 日起,Claude 生成的每一段文字都将携带隐形水印。


图片


水印嵌在文本的统计分布里,复制粘贴也会被带走,部分编辑也抹不掉。


Anthropic 周一在帮助文档中公布了这项计划。


触发它的是欧盟 AI 法案 Article 50 的透明度要求——生成式 AI 提供商必须标记输出内容。


图片

https://ec.europa.eu/newsroom/dae/redirection/document/129555


Anthropic 签署了相关实践准则,但标记范围远超法规管辖:全球所有 Claude 产品的输出一律适用,不限欧盟用户。



图片
两层标记:文本隐写加文件签章


Anthropic 为 AI 生成内容设计了两层标记。


第一层是文本水印。


Claude 在生成文本时,会在 Token 选择过程中引入一种不可见的统计偏置。


官方文档中的说法是:「你看不到它,它不会改变 Claude 回复的含义、质量或可读性。」


图片


这种水印内嵌于文本本身,不依赖外部元数据。


帮助文档指出,水印「会随文本的复制粘贴一起传播,经过部分编辑后可能仍然存在」。


水印在模型层面生效,覆盖所有 Claude 产品的文本输出。


技术原理方面,一种通行的大模型水印思路是:模型在生成文本时,按照检测算法预设的模式略微偏向某些 Token,使输出的统计分布偏离自然概率。


这种偏置肉眼看不出来,检测工具可以识别。


Anthropic 没有公开自身方案的技术细节。


Anthropic 声称水印「不改变含义」,这在逻辑上排除了以词汇选择和位置作为溯源标识的路径——据报道,苹果曾用类似的词汇替换技术追踪内部泄密者。


水印很可能作用于比词汇层更底层的统计特征,但具体方案外界无从验证。


第二层是文件溯源元数据。


Claude 生成 .svg、.png、.jpg 等格式的文件时,会附上数字签名的溯源信息,遵循内容来源与真实性联盟(C2PA)的开放标准。


C2PA 签名能标记文件经过 Claude 处理,并检测文件是否遭篡改。


图片


两层标记的覆盖范围不同。


文本水印在模型层面生效,所有文本输出都带;


C2PA 元数据只附加在 Claude 支持处理的文件类型上,部分云平台可能不支持签名元数据。


Anthropic 表示将向用户和第三方提供水印检测工具,但技术文档尚未发布。



图片
覆盖五条产品线,全球生效


欧盟 AI 法案约束的是在欧盟市场上线的 AI 系统,Anthropic 选择把标记推向全球。


官方文档写明:标记适用于所有受支持模型的输出,在 Claude 提供服务的所有地区生效,覆盖 Claude Platform(API)、Claude、Claude Code、Claude Cowork、Claude Tag 五条产品线。


通过 AWS、Google Cloud、Microsoft Foundry 接入的云客户,文本水印同样适用;


C2PA 签名元数据视各平台功能而定。


图片


时间线分成两段。


8 月 2 日是新模型的生效日期,当天及之后在欧盟上线的 Claude 新模型必须在发布时就支持标记。


8 月 2 日之前发布的旧模型,欧盟 AI 法案留了过渡期,合规截止日延至 12 月 2 日。


Anthropic 正在为旧模型适配标记功能,未给出具体时间表。


违规代价也写在了法案里:最高 1500 万欧元罚款,或全球年营收的 3%,取较高者。



图片
四重局限:Anthropic 自己在打预防针


Anthropic 在文档中用了大量篇幅描述水印的局限。


公告的措辞谨慎,几乎把每一种可能的误读都提前堵住了。


有水印不等于 Claude 原创。


用户经常用 Claude 校对、翻译、摘要或做格式转换,输出带有水印,但内容来自用户自己。


Anthropic 的原文说得清楚:「Claude 可能不是原始作者。」


检测到水印只说明内容「可能经过 Claude 处理」。


反过来,没有水印也不能证明内容是人写的。


官方文档列出了水印缺失的几种场景:


旧模型生成的内容本就不带水印;


文本被大幅编辑、改写、翻译或混入其他文字后,水印可能衰减到不可检测;


过短的段落没有足够的文本量供检测算法识别;


文件经过格式转换、重新保存或截图后,C2PA 元数据可能被剥离。


图片


另一方面,质量折损是更致命的争议。


学术研究记录了水印强度与文本质量之间的权衡——水印越强、越抗编辑,越容易影响输出质量。


有研究发现,当模型对输出不够自信时,水印对文本质量的负面影响更为明显。


IBM 研究人员也指出,特定水印方案会拉低生成文本的质量,需要额外处理才能保持自然度。


Anthropic 声称水印「不影响质量和可读性」,但没有公开技术方案,用户无法独立验证这一说法。


C2PA 元数据的耐久性同样存疑——C2PA 标准已有开源移除工具可用。


元数据可以在格式转换或重新保存时被剥离,相比内嵌于文本统计分布中的水印,附加于文件外部的元数据更容易被清除。



图片
第一个大规模部署文本水印的
主流 AI 公司


Anthropic 是第一家在文本输出上大规模部署水印的主流 AI 公司。


谷歌 DeepMind 开发的 SynthID 覆盖了文本、图像和音频的水印标记。


OpenAI 讨论过水印方案,部署节奏更慢。


Anthropic 的做法中引人注目的一点是明确承诺向第三方开放检测——拿到检测权限的人可以验证一段文本是否经过 Claude 处理。


这一承诺在用户层面引发了争议。


付费用户无法关闭水印。


对于用 Claude 代写邮件、起草内部文档或生成任何需要溯源中性内容的用户来说,文本从此携带可被识别的来源标记。


Claude 用户过去已就定价调整、可靠性和过度安全限制表达过不满,水印可能进一步加剧这种摩擦。


这一变化可能提升开源模型的吸引力。


不带水印是开源模型天然的一项特征,对于不希望输出被追溯的用户,这构成了一个切换的实际动机。


对 API 开发者,Anthropic 在文档中提醒:在自己的产品中部署 Claude 的开发者,需要自行评估 Article 50 对自身产品和服务的合规要求。


水印从 Anthropic 的模型层生效,下游开发者的法律义务需要另行判断。


检测工具是整套方案的关键一环。


水印的价值取决于检测的可靠性和可得性——嵌入容易,识别难。


Anthropic 承诺的技术文档和检测 API 何时落地、检测精度如何、能否经受对抗性攻击,将决定这套标记机制是真正可用的透明度基础设施,还是仅限于一份交给欧盟的合规文书。

(转载自:新智元)

扫码下载app 最新资讯实时掌握