Anthropic внедряет невидимые водяные знаки в Claude: от пассивного обнаружения к активной прослеживаемости контента

Отредактировано: Svitlana Velhush

Every Claude text now has a watermark. It survives copy-paste. Anthropic rolled out invisible marks for the EU AI Act: - Statistical signal baked into the text - Holds up through light editing - Applied worldwide, not just EU users Your AI-written docs just got traceable.

Reply

2 августа 2026 года Anthropic начала встраивать в новые версии Claude невидимые водяные знаки — машинно-читаемые метки, которые остаются в статистическом распределении текста и сохраняются при копировании и частичном редактировании. Это не просто техническое обновление, а стратегический сдвиг от попыток постфактум обнаружить ИИ-контент к проактивному встраиванию доказательств происхождения уже на этапе генерации.

Механизм работает на уровне токенов: модель изменяет вероятности выбора слов так, чтобы в последовательности появлялся статистически детектируемый паттерн, не влияющий на смысл, качество и читаемость. Компания обещает инструменты для верификации, но детали алгоритма и устойчивость к атакам (перевод, парафраз, смешивание с человеческим текстом) пока не раскрыты полностью. В отличие от предыдущих подходов, основанных на анализе стиля и частотности, водяной знак Anthropic является активным сигналом, встроенным производителем.

Методология Anthropic опирается на требования статьи 50 EU AI Act, вступившие в силу именно 2 августа. Регулятор требует от систем генеративного ИИ добавлять машиночитаемые метки для идентификации ИИ-контента. Это объясняет синхронность с другими игроками: Google расширяет SynthID на текст, OpenAI продвигает C2PA и цифровые водяные знаки, Meta тестирует аналогичные решения. Однако Anthropic выделяется тем, что связывает водяной знак напрямую с compliance, а не только с внутренними инициативами по безопасности.

По сравнению с традиционными детекторами ИИ (которые анализируют перплексию и burstiness), водяной знак даёт более надёжный сигнал о конкретной модели, но не решает проблему смешанного авторства. Исследование, опубликованное 8 августа на arXiv, подчёркивает: в эпоху human-AI collaboration бинарное деление «человек или ИИ» устарело. Водяной знак фиксирует факт использования Claude, но не показывает, какая доля текста принадлежит человеку, какие правки внесены и кто несёт окончательную ответственность.

Ограничения очевидны. Масштабное редактирование, перевод или смешивание с другим контентом могут уничтожить сигнал. Отсутствие водяного знака не доказывает человеческое авторство — оно лишь означает, что метка либо не была встроена, либо была удалена. Таким образом, инструмент полезен для платформ и издателей как дополнительный сигнал, но не как «неопровержимое доказательство».

Для отрасли это означает переход к экосистеме provenance: в будущем модели будут не просто генерировать текст, но и оставлять криптографически verifiable следы. Это упростит модерацию, но усложнит вопросы авторства, цитирования и юридической ответственности. Исследователям предстоит ответить, как водяные знаки разных провайдеров будут взаимодействовать и можно ли создать универсальный стандарт обнаружения.

В конечном счёте водяные знаки Anthropic показывают, что регулирование уже определяет техническую повестку: прослеживаемость контента становится обязательным свойством моделей, а не опциональной функцией.

60 Просмотров

Источники

  • 隐形水印上线,AI写作开始留痕

Комментарии

Читайте больше статей по этой теме:

Вы нашли ошибку или неточность?Мы учтем ваши комментарии как можно скорее.