Anthropic 在 Claude 中引入隐形水印:从被动检测迈向主动内容溯源

编辑者: Svitlana Velhush

Every Claude text now has a watermark. It survives copy-paste. Anthropic rolled out invisible marks for the EU AI Act: - Statistical signal baked into the text - Holds up through light editing - Applied worldwide, not just EU users Your AI-written docs just got traceable.

Reply

2 月 2026 日,Anthropic 开始在 Claude 的新版本中嵌入隐形水印——这是一种机器可读的标签,保留在文本的统计分布中,并在复制和部分编辑后依然存在。这不仅仅是一次技术更新,更是从试图事后检测 AI 内容向在生成阶段主动嵌入来源证明的战略转变。

该机制在标记(token)层面运作:模型会调整词汇选择的概率,从而在序列中产生一种统计上可检测的模式,且不会影响语义、质量和可读性。该公司承诺提供验证工具,但算法的细节以及对攻击(翻译、改写、与人类文本混合)的抵抗力尚未完全披露。与以往基于风格和频率分析的方法不同,Anthropic 的水印是由制造商嵌入的主动信号。

Anthropic 的方法论基于《欧盟人工智能法案》(EU AI Act)第 50 条的要求,该条款恰好于 2 月生效。监管机构要求生成式 AI 系统添加机器可读标签以识别 AI 内容。这解释了其与其他参与者的同步性:Google 正在将 SynthID 扩展到文本领域,OpenAI 正在推广 C2PA 和数字水印,Meta 也在测试类似的解决方案。然而,Anthropic 的独特之处在于,它将水印直接与合规性挂钩,而不仅仅是作为内部安全倡议的一部分。

与传统的 AI 检测器(分析困惑度和突发性)相比,水印能提供关于特定模型的更可靠信号,但无法解决混合创作的问题。 8 月发表在 arXiv 上的一项研究强调:在人机协作时代,“人类还是 AI”的二元划分已经过时。水印记录了使用 Claude 的事实,但无法显示文本中有多少比例属于人类、进行了哪些修改以及谁承担最终责任。

局限性显而易见。大规模编辑、翻译或与其他内容混合可能会破坏信号。没有水印并不能证明是人类创作——它只意味着标签要么未被嵌入,要么已被删除。因此,该工具对于平台和出版商来说是一个有用的附加信号,但不能作为“确凿证据”。

对于整个行业而言,这意味着向溯源生态系统的过渡:未来,模型不仅会生成文本,还会留下可加密验证的痕迹。这将简化审核流程,但会使作者身份、引用和法律责任等问题变得更加复杂。研究人员需要回答不同提供商的水印将如何交互,以及是否可以建立通用的检测标准。

归根结底,Anthropic 的水印表明,监管已经在定义技术议程:内容溯源正在成为模型的必备属性,而非可选功能。

26 查看

来源

  • 隐形水印上线,AI写作开始留痕

阅读更多关于此主题的文章:

This feels like another “DeepSeek” moment coming out of China. ByteDance just released Seed 2.0, also called Doubao 2.0, and it’s apparently outperforming top tier models across multimodal tasks, advanced math, STEM benchmarks, and even agent style reasoning. On top of that,

Image
Reply
你发现了错误或不准确的地方吗?我们会尽快考虑您的意见。