2 серпня 2026 року Anthropic почала вбудовувати в нові версії Claude невидимі водяні знаки — машинозчитувані мітки, які залишаються в статистичному розподілі тексту і зберігаються при копіюванні та частковому редагуванні. Це не просто технічне оновлення, а стратегічний зсув від спроб постфактум виявити ШІ-контент до проактивного вбудовування доказів походження вже на етапі генерації.
Механізм працює на рівні токенів: модель змінює ймовірності вибору слів так, щоб у послідовності з'являвся статистично виявлюваний патерн, який не впливає на зміст, якість і читабельність. Компанія обіцяє інструменти для верифікації, але деталі алгоритму та стійкість до атак (переклад, парафраз, змішування з людським текстом) поки що не розкриті повністю. На відміну від попередніх підходів, заснованих на аналізі стилю та частотності, водяний знак Anthropic є активним сигналом, вбудованим виробником.
Методологія Anthropic спирається на вимоги статті 50 EU AI Act, що набули чинності саме 2 серпня. Регулятор вимагає від систем генеративного ШІ додавати машинозчитувані мітки для ідентифікації ШІ-контенту. Це пояснює синхронність з іншими гравцями: Google розширює SynthID на текст, OpenAI просуває C2PA та цифрові водяні знаки, Meta тестує аналогічні рішення. Однак Anthropic виділяється тим, що пов'язує водяний знак безпосередньо з compliance, а не лише з внутрішніми ініціативами з безпеки.
Порівняно з традиційними детекторами ШІ (які аналізують перплексію та burstiness), водяний знак дає надійніший сигнал про конкретну модель, але не вирішує проблему змішаного авторства. Дослідження, опубліковане 8 серпня на arXiv, підкреслює: в епоху співпраці людини та ШІ бінарний поділ «людина чи ШІ» застарів. Водяний знак фіксує факт використання Claude, але не показує, яка частка тексту належить людині, які правки внесені та хто несе остаточну відповідальність.
Обмеження очевидні. Масштабне редагування, переклад або змішування з іншим контентом можуть знищити сигнал. Відсутність водяного знака не доводить людське авторство — вона лише означає, що мітка або не була вбудована, або була видалена. Таким чином, інструмент корисний для платформ і видавців як додатковий сигнал, але не як «неспростовний доказ».
Для галузі це означає перехід до екосистеми простежуваності: у майбутньому моделі будуть не просто генерувати текст, а й залишати криптографічно перевірювані сліди. Це спростить модерацію, але ускладнить питання авторства, цитування та юридичної відповідальності. Дослідникам належить відповісти, як водяні знаки різних провайдерів взаємодіятимуть і чи можна створити універсальний стандарт виявлення.
Зрештою, водяні знаки Anthropic показують, що регулювання вже визначає технічний порядок денний: простежуваність контенту стає обов'язковою властивістю моделей, а не опціональною функцією.

