2 sierpnia 2026 roku firma Anthropic zaczęła wbudowywać w nowe wersje Claude niewidoczne znaki wodne — czytelne dla maszyn oznaczenia, które pozostają w rozkładzie statystycznym tekstu i zachowują się przy kopiowaniu oraz częściowej edycji. To nie tylko aktualizacja techniczna, ale strategiczne przejście od prób wykrywania treści AI post factum do proaktywnego wbudowywania dowodów pochodzenia już na etapie generowania.
Mechanizm działa na poziomie tokenów: model zmienia prawdopodobieństwo wyboru słów tak, aby w sekwencji pojawiał się statystycznie wykrywalny wzorzec, który nie wpływa na sens, jakość ani czytelność. Firma obiecuje narzędzia do weryfikacji, jednak szczegóły algorytmu oraz odporność na ataki (tłumaczenie, parafrazowanie, mieszanie z tekstem ludzkim) nie zostały jeszcze w pełni ujawnione. W przeciwieństwie do wcześniejszych podejść opartych na analizie stylu i częstotliwości, znak wodny Anthropic jest aktywnym sygnałem wbudowanym przez producenta.
Metodologia Anthropic opiera się na wymogach artykułu 50 EU AI Act, które weszły w życie właśnie 2 sierpnia. Regulator wymaga od systemów generatywnej sztucznej inteligencji dodawania czytelnych dla maszyn oznaczeń w celu identyfikacji treści AI. Wyjaśnia to synchronizację z innymi graczami: Google rozszerza SynthID na tekst, OpenAI promuje C2PA i cyfrowe znaki wodne, a Meta testuje podobne rozwiązania. Anthropic wyróżnia się jednak tym, że wiąże znak wodny bezpośrednio z compliance, a nie tylko z wewnętrznymi inicjatywami dotyczącymi bezpieczeństwa.
W porównaniu z tradycyjnymi detektorami AI (które analizują perpleksję i burstiness), znak wodny daje bardziej wiarygodny sygnał o konkretnym modelu, ale nie rozwiązuje problemu mieszanego autorstwa. Badanie opublikowane 8 sierpnia na arXiv podkreśla: w erze human-AI collaboration binarne rozróżnienie „człowiek czy AI” jest przestarzałe. Znak wodny rejestruje fakt użycia Claude, ale nie pokazuje, jaka część tekstu należy do człowieka, jakie poprawki zostały wprowadzone i kto ponosi ostateczną odpowiedzialność.
Ograniczenia są oczywiste. Edycja na dużą skalę, tłumaczenie lub mieszanie z innymi treściami mogą zniszczyć sygnał. Brak znaku wodnego nie dowodzi ludzkiego autorstwa — oznacza jedynie, że oznaczenie nie zostało wbudowane lub zostało usunięte. W związku z tym narzędzie jest przydatne dla platform i wydawców jako dodatkowy sygnał, ale nie jako „niepodważalny dowód”.
Dla branży oznacza to przejście do ekosystemu provenance: w przyszłości modele nie będą tylko generować tekstu, ale także pozostawiać ślady, które można zweryfikować kryptograficznie. Ułatwi to moderację, ale skomplikuje kwestie autorstwa, cytowania i odpowiedzialności prawnej. Naukowcy muszą odpowiedzieć na pytanie, jak znaki wodne różnych dostawców będą ze sobą współdziałać i czy można stworzyć uniwersalny standard wykrywania.
Ostatecznie znaki wodne Anthropic pokazują, że regulacje już teraz kształtują agendę techniczną: identyfikowalność treści staje się obowiązkową cechą modeli, a nie opcjonalną funkcją.

