2 августа 2026 года Anthropic начала встраивать в новые версии Claude невидимые водяные знаки — машинно-читаемые метки, которые остаются в статистическом распределении текста и сохраняются при копировании и частичном редактировании. Это не просто техническое обновление, а стратегический сдвиг от попыток постфактум обнаружить ИИ-контент к проактивному встраиванию доказательств происхождения уже на этапе генерации.
Механизм работает на уровне токенов: модель изменяет вероятности выбора слов так, чтобы в последовательности появлялся статистически детектируемый паттерн, не влияющий на смысл, качество и читаемость. Компания обещает инструменты для верификации, но детали алгоритма и устойчивость к атакам (перевод, парафраз, смешивание с человеческим текстом) пока не раскрыты полностью. В отличие от предыдущих подходов, основанных на анализе стиля и частотности, водяной знак Anthropic является активным сигналом, встроенным производителем.
Методология Anthropic опирается на требования статьи 50 EU AI Act, вступившие в силу именно 2 августа. Регулятор требует от систем генеративного ИИ добавлять машиночитаемые метки для идентификации ИИ-контента. Это объясняет синхронность с другими игроками: Google расширяет SynthID на текст, OpenAI продвигает C2PA и цифровые водяные знаки, Meta тестирует аналогичные решения. Однако Anthropic выделяется тем, что связывает водяной знак напрямую с compliance, а не только с внутренними инициативами по безопасности.
По сравнению с традиционными детекторами ИИ (которые анализируют перплексию и burstiness), водяной знак даёт более надёжный сигнал о конкретной модели, но не решает проблему смешанного авторства. Исследование, опубликованное 8 августа на arXiv, подчёркивает: в эпоху human-AI collaboration бинарное деление «человек или ИИ» устарело. Водяной знак фиксирует факт использования Claude, но не показывает, какая доля текста принадлежит человеку, какие правки внесены и кто несёт окончательную ответственность.
Ограничения очевидны. Масштабное редактирование, перевод или смешивание с другим контентом могут уничтожить сигнал. Отсутствие водяного знака не доказывает человеческое авторство — оно лишь означает, что метка либо не была встроена, либо была удалена. Таким образом, инструмент полезен для платформ и издателей как дополнительный сигнал, но не как «неопровержимое доказательство».
Для отрасли это означает переход к экосистеме provenance: в будущем модели будут не просто генерировать текст, но и оставлять криптографически verifiable следы. Это упростит модерацию, но усложнит вопросы авторства, цитирования и юридической ответственности. Исследователям предстоит ответить, как водяные знаки разных провайдеров будут взаимодействовать и можно ли создать универсальный стандарт обнаружения.
В конечном счёте водяные знаки Anthropic показывают, что регулирование уже определяет техническую повестку: прослеживаемость контента становится обязательным свойством моделей, а не опциональной функцией.

