Anthropic 在 Claude 中引入隱形浮水印:從被動檢測邁向主動內容追溯

编辑者: Svitlana Velhush

Every Claude text now has a watermark. It survives copy-paste. Anthropic rolled out invisible marks for the EU AI Act: - Statistical signal baked into the text - Holds up through light editing - Applied worldwide, not just EU users Your AI-written docs just got traceable.

Reply

2 月 2026 日,Anthropic 開始將隱形浮水印植入新版 Claude 中——這是一種機器可讀的標記,保留在文字的統計分佈中,並在複製和部分編輯後依然存在。這不僅僅是一次技術更新,更是一項戰略轉變,從事後檢測 AI 內容轉向在生成階段就主動嵌入來源證明。

該機制在 Token 層級運作:模型會調整選詞機率,使序列中出現一種統計上可檢測的模式,且不會影響語意、品質與可讀性。公司承諾提供驗證工具,但演算法細節與對抗攻擊(翻譯、改寫、與人類文本混合)的穩健性尚未完全公開。與先前基於風格與頻率分析的方法不同,Anthropic 的浮水印是由製造商嵌入的主動訊號。

Anthropic 的方法論依據《歐盟人工智慧法案》(EU AI Act)第 50 條的要求,該法案恰好於 2 月生效。監管機構要求生成式 AI 系統添加機器可讀標記以識別 AI 內容。這解釋了為何與其他參與者步調一致:Google 正在將 SynthID 擴展至文字領域,OpenAI 正在推廣 C2PA 與數位浮水印,Meta 也在測試類似解決方案。然而,Anthropic 的獨特之處在於將浮水印直接與合規性掛鉤,而非僅僅作為內部的安全倡議。

與傳統的 AI 檢測器(分析困惑度與突發性)相比,浮水印能提供關於特定模型的更可靠訊號,但無法解決混合創作的問題。 8 月發表於 arXiv 的研究強調:在人機協作的時代,將內容二分為「人類或 AI」已顯過時。浮水印記錄了使用 Claude 的事實,但無法顯示有多少比例的文字屬於人類、進行了哪些修改,以及誰應承擔最終責任。

其限制顯而易見。大規模編輯、翻譯或與其他內容混合可能會破壞訊號。缺乏浮水印並不證明是人類創作——它僅代表該標記未被嵌入或已被移除。因此,該工具對平台與發布者而言是一個有用的額外訊號,但並非「無可辯駁的證據」。

對產業而言,這意味著向來源證明(provenance)生態系統的轉型:未來模型不僅會生成文字,還會留下可加密驗證(cryptographically verifiable)的足跡。這將簡化審核流程,但會使著作權、引用與法律責任等問題變得更加複雜。研究人員仍需回答不同供應商的浮水印將如何互動,以及是否能建立通用的檢測標準。

歸根結底,Anthropic 的浮水印顯示監管已在定義技術議程:內容追溯性正成為模型的必要屬性,而非選配功能。

26 浏览量

來源

  • 隐形水印上线,AI写作开始留痕

阅读更多关于此主题的文章:

This feels like another “DeepSeek” moment coming out of China. ByteDance just released Seed 2.0, also called Doubao 2.0, and it’s apparently outperforming top tier models across multimodal tasks, advanced math, STEM benchmarks, and even agent style reasoning. On top of that,

Image
Reply
发现错误或不准确的地方吗?我们会尽快处理您的评论。