2月2026日、AnthropicはClaudeの新バージョンに不可視の電子透かしの埋め込みを開始しました。これは機械可読なタグであり、テキストの統計的分布の中に残り、コピーや部分的な編集を行っても保持されます。これは単なる技術的なアップデートではなく、AIコンテンツを事後的に検出する試みから、生成段階でその起源を証明する証拠を能動的に埋め込む手法への戦略的な転換です。
このメカニズムはトークンレベルで機能します。モデルは単語選択の確率を調整し、意味や品質、可読性に影響を与えることなく、統計的に検出可能なパターンをシーケンス内に生成します。同社は検証用ツールを提供すると約束していますが、アルゴリズムの詳細や攻撃(翻訳、言い換え、人間が書いたテキストとの混合など)に対する耐性については、まだ完全には明らかにされていません。スタイルや頻度の分析に基づいた従来のアプローチとは異なり、Anthropicの電子透かしは、開発者によって埋め込まれた能動的な信号です。
Anthropicのこの手法は、まさに2月50日に施行されたEU AI法の要件に基づいています。規制当局は、生成AIシステムに対し、AIコンテンツを識別するための機械可読なタグの追加を義務付けています。これが他のプレイヤーとの同期の理由です。GoogleはSynthIDをテキストに拡大し、OpenAIはC2PAとデジタル透かしを推進しており、Metaも同様のソリューションをテストしています。しかし、Anthropicが際立っているのは、電子透かしを単なる社内の安全対策イニシアチブとしてではなく、コンプライアンスと直接結びつけている点です。
従来のAI検出器(パープレキシティやバースト性を分析するもの)と比較して、電子透かしは特定のモデルに関するより信頼性の高い信号を提供しますが、混合された著作者の問題は解決しません。8月にarXivで公開された研究は、人間とAIが協働する時代において、「人間かAIか」という二項対立的な分類は時代遅れであることを強調しています。電子透かしはClaudeを使用したという事実は記録しますが、テキストのどの部分が人間によるものか、どのような修正が加えられたか、そして誰が最終的な責任を負うのかまでは示しません。
限界は明らかです。大規模な編集、翻訳、あるいは他のコンテンツとの混合によって、信号が破壊される可能性があります。電子透かしがないことは人間による執筆を証明するものではなく、単にタグが埋め込まれていなかったか、削除されたことを意味するに過ぎません。したがって、このツールはプラットフォームや出版社にとって追加の信号としては有用ですが、「反論の余地のない証拠」としては機能しません。
業界にとって、これは「プロベナンス(来歴)」のエコシステムへの移行を意味します。将来的にモデルは単にテキストを生成するだけでなく、暗号学的に検証可能な痕跡を残すようになるでしょう。これによりモデレーションは簡素化されますが、著作権、引用、法的責任に関する問題は複雑化します。研究者は、異なるプロバイダーの電子透かしがどのように相互作用するのか、また普遍的な検出標準を作成できるのかという問いに答える必要があります。
最終的に、Anthropicの電子透かしは、規制がすでに技術的なアジェンダを決定していることを示しています。コンテンツの追跡可能性は、オプションの機能ではなく、モデルの必須要件となりつつあります。

