Anthropic triển khai hình mờ vô hình trong Claude: từ phát hiện thụ động đến khả năng truy xuất nguồn gốc nội dung chủ động

Chỉnh sửa bởi: Svitlana Velhush

Every Claude text now has a watermark. It survives copy-paste. Anthropic rolled out invisible marks for the EU AI Act: - Statistical signal baked into the text - Holds up through light editing - Applied worldwide, not just EU users Your AI-written docs just got traceable.

Reply

Vào tháng 2 năm 2026, Anthropic đã bắt đầu tích hợp các hình mờ vô hình vào các phiên bản mới của Claude — những dấu hiệu máy có thể đọc được, tồn tại trong phân phối thống kê của văn bản và được bảo toàn khi sao chép hoặc chỉnh sửa một phần. Đây không chỉ là một bản cập nhật kỹ thuật, mà là một sự chuyển dịch chiến lược từ nỗ lực phát hiện nội dung AI sau khi sự việc đã rồi sang việc chủ động tích hợp bằng chứng về nguồn gốc ngay tại giai đoạn tạo ra.

Cơ chế này hoạt động ở cấp độ mã thông báo (token): mô hình thay đổi xác suất lựa chọn từ ngữ sao cho một mẫu có thể phát hiện được về mặt thống kê xuất hiện trong chuỗi, mà không ảnh hưởng đến ý nghĩa, chất lượng và khả năng đọc. Công ty hứa hẹn sẽ cung cấp các công cụ để xác minh, nhưng chi tiết về thuật toán và khả năng chống lại các cuộc tấn công (dịch thuật, diễn giải, trộn lẫn với văn bản của con người) vẫn chưa được tiết lộ đầy đủ. Khác với các phương pháp tiếp cận trước đây dựa trên phân tích phong cách và tần suất, hình mờ của Anthropic là một tín hiệu chủ động được nhà sản xuất tích hợp sẵn.

Phương pháp luận của Anthropic dựa trên các yêu cầu của Điều 50 trong Đạo luật AI của EU, có hiệu lực chính xác vào ngày 2 tháng Tám. Cơ quan quản lý yêu cầu các hệ thống AI tạo sinh phải thêm các dấu hiệu máy có thể đọc được để nhận dạng nội dung AI. Điều này giải thích cho sự đồng bộ với các công ty khác: Google đang mở rộng SynthID cho văn bản, OpenAI đang thúc đẩy C2PA và hình mờ kỹ thuật số, Meta đang thử nghiệm các giải pháp tương tự. Tuy nhiên, Anthropic nổi bật ở chỗ họ liên kết hình mờ trực tiếp với việc tuân thủ quy định, chứ không chỉ với các sáng kiến an toàn nội bộ.

So với các trình phát hiện AI truyền thống (vốn phân tích độ nhiễu và tính bùng nổ), hình mờ cung cấp tín hiệu đáng tin cậy hơn về một mô hình cụ thể, nhưng không giải quyết được vấn đề đồng tác giả. Một nghiên cứu được công bố vào ngày 8 tháng Tám trên arXiv nhấn mạnh rằng: trong kỷ nguyên hợp tác giữa người và AI, việc phân chia nhị phân "người hay AI" đã trở nên lỗi thời. Hình mờ ghi nhận việc sử dụng Claude, nhưng không cho thấy tỷ lệ văn bản nào thuộc về con người, những chỉnh sửa nào đã được thực hiện và ai là người chịu trách nhiệm cuối cùng.

Các hạn chế là rõ ràng. Việc chỉnh sửa trên diện rộng, dịch thuật hoặc trộn lẫn với nội dung khác có thể phá hủy tín hiệu. Sự vắng mặt của hình mờ không chứng minh được quyền tác giả của con người — nó chỉ có nghĩa là dấu hiệu hoặc không được tích hợp, hoặc đã bị xóa bỏ. Do đó, công cụ này hữu ích cho các nền tảng và nhà xuất bản như một tín hiệu bổ sung, chứ không phải là "bằng chứng không thể chối cãi".

Đối với ngành công nghiệp, điều này có nghĩa là sự chuyển dịch sang hệ sinh thái nguồn gốc (provenance): trong tương lai, các mô hình sẽ không chỉ tạo ra văn bản mà còn để lại các dấu vết có thể xác minh bằng mật mã. Điều này sẽ đơn giản hóa việc kiểm duyệt, nhưng làm phức tạp thêm các vấn đề về quyền tác giả, trích dẫn và trách nhiệm pháp lý. Các nhà nghiên cứu sẽ phải trả lời câu hỏi làm thế nào để hình mờ của các nhà cung cấp khác nhau tương tác với nhau và liệu có thể tạo ra một tiêu chuẩn phát hiện chung hay không.

Cuối cùng, hình mờ của Anthropic cho thấy rằng các quy định đã bắt đầu định hình chương trình nghị sự kỹ thuật: khả năng truy xuất nguồn gốc nội dung đang trở thành một đặc tính bắt buộc của các mô hình, chứ không còn là một chức năng tùy chọn.

26 Lượt xem

Nguồn

  • 隐形水印上线,AI写作开始留痕

Đọc thêm bài viết về chủ đề này:

This feels like another “DeepSeek” moment coming out of China. ByteDance just released Seed 2.0, also called Doubao 2.0, and it’s apparently outperforming top tier models across multimodal tasks, advanced math, STEM benchmarks, and even agent style reasoning. On top of that,

Image
Reply
Bạn có phát hiện lỗi hoặc sai sót không?Chúng tôi sẽ xem xét ý kiến của bạn càng sớm càng tốt.