Anthropic внедряет невидимые водяные знаки в Claude: от пассивного обнаружения к активной прослеживаемости контента

Отредактировано: Svitlana Velhush

Every Claude text now has a watermark. It survives copy-paste. Anthropic rolled out invisible marks for the EU AI Act: - Statistical signal baked into the text - Holds up through light editing - Applied worldwide, not just EU users Your AI-written docs just got traceable.

Reply

2 августа 2026 года Anthropic начала встраивать в новые версии Claude невидимые водяные знаки — машинно-читаемые метки, которые остаются в статистическом распределении текста и сохраняются при копировании и частичном редактировании. Это не просто техническое обновление, а стратегический сдвиг от попыток постфактум обнаружить ИИ-контент к проактивному встраиванию доказательств происхождения уже на этапе генерации.

Механизм работает на уровне токенов: модель изменяет вероятности выбора слов так, чтобы в последовательности появлялся статистически детектируемый паттерн, не влияющий на смысл, качество и читаемость. Компания обещает инструменты для верификации, но детали алгоритма и устойчивость к атакам (перевод, парафраз, смешивание с человеческим текстом) пока не раскрыты полностью. В отличие от предыдущих подходов, основанных на анализе стиля и частотности, водяной знак Anthropic является активным сигналом, встроенным производителем.

Методология Anthropic опирается на требования статьи 50 EU AI Act, вступившие в силу именно 2 августа. Регулятор требует от систем генеративного ИИ добавлять машиночитаемые метки для идентификации ИИ-контента. Это объясняет синхронность с другими игроками: Google расширяет SynthID на текст, OpenAI продвигает C2PA и цифровые водяные знаки, Meta тестирует аналогичные решения. Однако Anthropic выделяется тем, что связывает водяной знак напрямую с compliance, а не только с внутренними инициативами по безопасности.

По сравнению с традиционными детекторами ИИ (которые анализируют перплексию и burstiness), водяной знак даёт более надёжный сигнал о конкретной модели, но не решает проблему смешанного авторства. Исследование, опубликованное 8 августа на arXiv, подчёркивает: в эпоху human-AI collaboration бинарное деление «человек или ИИ» устарело. Водяной знак фиксирует факт использования Claude, но не показывает, какая доля текста принадлежит человеку, какие правки внесены и кто несёт окончательную ответственность.

Ограничения очевидны. Масштабное редактирование, перевод или смешивание с другим контентом могут уничтожить сигнал. Отсутствие водяного знака не доказывает человеческое авторство — оно лишь означает, что метка либо не была встроена, либо была удалена. Таким образом, инструмент полезен для платформ и издателей как дополнительный сигнал, но не как «неопровержимое доказательство».

Для отрасли это означает переход к экосистеме provenance: в будущем модели будут не просто генерировать текст, но и оставлять криптографически verifiable следы. Это упростит модерацию, но усложнит вопросы авторства, цитирования и юридической ответственности. Исследователям предстоит ответить, как водяные знаки разных провайдеров будут взаимодействовать и можно ли создать универсальный стандарт обнаружения.

В конечном счёте водяные знаки Anthropic показывают, что регулирование уже определяет техническую повестку: прослеживаемость контента становится обязательным свойством моделей, а не опциональной функцией.

26 Просмотров

Источники

  • 隐形水印上线,AI写作开始留痕

Читайте больше статей по этой теме:

This feels like another “DeepSeek” moment coming out of China. ByteDance just released Seed 2.0, also called Doubao 2.0, and it’s apparently outperforming top tier models across multimodal tasks, advanced math, STEM benchmarks, and even agent style reasoning. On top of that,

Image
Reply
Вы нашли ошибку или неточность?Мы учтем ваши комментарии как можно скорее.