Rộ dịch vụ xóa watermark AI sau động thái mới của Anthropic

4
404 Not Found
Phản hồi: 0
Chưa đầy một tuần sau khi Anthropic triển khai watermark vô hình cho các nội dung do Claude tạo ra, internet đã xuất hiện hàng loạt dịch vụ hứa hẹn có thể "xóa sạch dấu vết AI". Từ các dự án mã nguồn mở trên GitHub đến những website mới đăng ký tên miền, tất cả đều quảng bá khả năng giúp văn bản trở nên "không thể bị phát hiện". Thế nhưng, có một vấn đề lớn: hiện chưa ai chứng minh được những công cụ này thực sự hoạt động.
1786681357533.png

Theo BleepingComputer, thị trường "xóa watermark AI" đang bùng nổ với tốc độ đáng kinh ngạc. Nhiều nhà phát triển nhanh chóng tung ra công cụ dành riêng cho Claude, trong khi một số dịch vụ vốn nổi tiếng với việc né tránh các hệ thống phát hiện nội dung AI cũng tham gia cuộc chơi.

Sự xuất hiện ồ ạt của các công cụ này bắt nguồn từ quyết định mới của Anthropic. Công ty cho biết các phiên bản Claude phát hành từ ngày 2/8 sẽ được tích hợp watermark vô hình nhằm đáp ứng yêu cầu minh bạch của Đạo luật AI của Liên minh châu Âu (EU AI Act). Không giống các dấu hiệu nhận biết thông thường, watermark này được nhúng trực tiếp vào cách mô hình lựa chọn từ ngữ khi tạo nội dung.

Chính vì vậy, việc loại bỏ watermark không đơn giản như xóa vài ký tự ẩn hoặc chỉnh sửa metadata của tệp. Các chuyên gia cho rằng nếu muốn loại bỏ dấu hiệu nhận diện này, gần như phải viết lại đáng kể toàn bộ nội dung bằng một mô hình AI khác.

Đó cũng là lý do khiến những tuyên bố "xóa sạch watermark Claude" hiện nay gây nhiều tranh cãi. Anthropic chưa công bố chi tiết cơ chế hoạt động của watermark cũng như chưa phát hành công cụ kiểm tra công khai. Nói cách khác, không ai có thể xác nhận liệu một văn bản sau khi được "làm sạch" còn mang watermark hay không.

Dù vậy, nhiều dịch vụ vẫn quảng cáo khả năng tạo ra nội dung "không thể bị phát hiện". Theo các nhà nghiên cứu, phần lớn công cụ hiện nay chỉ tập trung vào việc loại bỏ metadata hoặc các ký tự đặc biệt trong văn bản. Những kỹ thuật này có thể hiệu quả với một số hình thức đánh dấu đơn giản, nhưng chưa có bằng chứng cho thấy chúng có thể vô hiệu hóa watermark ngôn ngữ của Claude.

Một điểm đáng chú ý khác là ngay cả khi watermark được phát hiện, điều đó cũng không đồng nghĩa toàn bộ nội dung do AI tự viết. Anthropic cho biết watermark có thể xuất hiện trong những trường hợp người dùng chỉ nhờ Claude sửa lỗi ngữ pháp, tóm tắt tài liệu hoặc dịch văn bản.

Trong khi tranh luận về hiệu quả của watermark vẫn chưa có hồi kết, giới chuyên gia an ninh mạng lại lo ngại về một vấn đề khác. Hàng nghìn người đang tải về các công cụ "xóa watermark" từ internet và tích hợp chúng trực tiếp vào quy trình làm việc với AI. Nếu những phần mềm này chứa mã độc hoặc bị lợi dụng cho mục đích xấu, nguy cơ đối với người dùng có thể lớn hơn nhiều so với chính watermark mà họ muốn loại bỏ.

Cuộc đua giữa bên muốn đánh dấu nội dung AI và bên muốn xóa bỏ dấu vết của nó chắc chắn sẽ còn tiếp diễn. Nhưng ở thời điểm hiện tại, điều duy nhất có thể khẳng định là các lời quảng cáo về khả năng "xóa watermark Claude" vẫn chưa được chứng minh, trong khi rủi ro từ việc tin tưởng những công cụ chưa được kiểm chứng lại hoàn toàn có thật.​
 
Được phối hợp thực hiện bởi các chuyên gia của Bkav, cộng đồng An ninh mạng Việt Nam WhiteHat và cộng đồng Khoa học công nghệ VnReview
Back
Top