2 月 2026 日,Anthropic 开始在 Claude 的新版本中嵌入隐形水印——这是一种机器可读的标签,保留在文本的统计分布中,并在复制和部分编辑后依然存在。这不仅仅是一次技术更新,更是从试图事后检测 AI 内容向在生成阶段主动嵌入来源证明的战略转变。
该机制在标记(token)层面运作:模型会调整词汇选择的概率,从而在序列中产生一种统计上可检测的模式,且不会影响语义、质量和可读性。该公司承诺提供验证工具,但算法的细节以及对攻击(翻译、改写、与人类文本混合)的抵抗力尚未完全披露。与以往基于风格和频率分析的方法不同,Anthropic 的水印是由制造商嵌入的主动信号。
Anthropic 的方法论基于《欧盟人工智能法案》(EU AI Act)第 50 条的要求,该条款恰好于 2 月生效。监管机构要求生成式 AI 系统添加机器可读标签以识别 AI 内容。这解释了其与其他参与者的同步性:Google 正在将 SynthID 扩展到文本领域,OpenAI 正在推广 C2PA 和数字水印,Meta 也在测试类似的解决方案。然而,Anthropic 的独特之处在于,它将水印直接与合规性挂钩,而不仅仅是作为内部安全倡议的一部分。
与传统的 AI 检测器(分析困惑度和突发性)相比,水印能提供关于特定模型的更可靠信号,但无法解决混合创作的问题。 8 月发表在 arXiv 上的一项研究强调:在人机协作时代,“人类还是 AI”的二元划分已经过时。水印记录了使用 Claude 的事实,但无法显示文本中有多少比例属于人类、进行了哪些修改以及谁承担最终责任。
局限性显而易见。大规模编辑、翻译或与其他内容混合可能会破坏信号。没有水印并不能证明是人类创作——它只意味着标签要么未被嵌入,要么已被删除。因此,该工具对于平台和出版商来说是一个有用的附加信号,但不能作为“确凿证据”。
对于整个行业而言,这意味着向溯源生态系统的过渡:未来,模型不仅会生成文本,还会留下可加密验证的痕迹。这将简化审核流程,但会使作者身份、引用和法律责任等问题变得更加复杂。研究人员需要回答不同提供商的水印将如何交互,以及是否可以建立通用的检测标准。
归根结底,Anthropic 的水印表明,监管已经在定义技术议程:内容溯源正在成为模型的必备属性,而非可选功能。

