2 月 2026 日,Anthropic 開始將隱形浮水印植入新版 Claude 中——這是一種機器可讀的標記,保留在文字的統計分佈中,並在複製和部分編輯後依然存在。這不僅僅是一次技術更新,更是一項戰略轉變,從事後檢測 AI 內容轉向在生成階段就主動嵌入來源證明。
該機制在 Token 層級運作:模型會調整選詞機率,使序列中出現一種統計上可檢測的模式,且不會影響語意、品質與可讀性。公司承諾提供驗證工具,但演算法細節與對抗攻擊(翻譯、改寫、與人類文本混合)的穩健性尚未完全公開。與先前基於風格與頻率分析的方法不同,Anthropic 的浮水印是由製造商嵌入的主動訊號。
Anthropic 的方法論依據《歐盟人工智慧法案》(EU AI Act)第 50 條的要求,該法案恰好於 2 月生效。監管機構要求生成式 AI 系統添加機器可讀標記以識別 AI 內容。這解釋了為何與其他參與者步調一致:Google 正在將 SynthID 擴展至文字領域,OpenAI 正在推廣 C2PA 與數位浮水印,Meta 也在測試類似解決方案。然而,Anthropic 的獨特之處在於將浮水印直接與合規性掛鉤,而非僅僅作為內部的安全倡議。
與傳統的 AI 檢測器(分析困惑度與突發性)相比,浮水印能提供關於特定模型的更可靠訊號,但無法解決混合創作的問題。 8 月發表於 arXiv 的研究強調:在人機協作的時代,將內容二分為「人類或 AI」已顯過時。浮水印記錄了使用 Claude 的事實,但無法顯示有多少比例的文字屬於人類、進行了哪些修改,以及誰應承擔最終責任。
其限制顯而易見。大規模編輯、翻譯或與其他內容混合可能會破壞訊號。缺乏浮水印並不證明是人類創作——它僅代表該標記未被嵌入或已被移除。因此,該工具對平台與發布者而言是一個有用的額外訊號,但並非「無可辯駁的證據」。
對產業而言,這意味著向來源證明(provenance)生態系統的轉型:未來模型不僅會生成文字,還會留下可加密驗證(cryptographically verifiable)的足跡。這將簡化審核流程,但會使著作權、引用與法律責任等問題變得更加複雜。研究人員仍需回答不同供應商的浮水印將如何互動,以及是否能建立通用的檢測標準。
歸根結底,Anthropic 的浮水印顯示監管已在定義技術議程:內容追溯性正成為模型的必要屬性,而非選配功能。

