Anthropic giải thích chi tiết cách thức gắn watermark ẩn trên văn bản của Claude
Anthropic vừa công bố chi tiết về cơ chế gắn watermark vào văn bản do chatbot Claude tạo ra nhằm tuân thủ Đạo luật AI của Liên minh Châu Âu (EU). Hãng khẳng định kỹ thuật dựa trên SynthID-Text này hoàn toàn không làm giảm chất lượng nội dung, khó bị xóa bằng các chỉnh sửa thông thường và rất ít ảnh hưởng đến mã nguồn.
Anthropic vừa đăng tải một bài viết trên blog vào hôm thứ Sáu nhằm giải đáp các thắc mắc cơ bản về cách thức gắn watermark (dấu chìm ẩn) vào văn bản do chatbot Claude tạo ra. Các câu hỏi xoay quanh việc: Kỹ thuật này hoạt động chính xác ra sao? Liệu việc chỉnh sửa nội dung có thể làm mất dấu ẩn hay không? Và điều này sẽ ảnh hưởng như thế nào đến việc viết mã nguồn (code)?
Cộng đồng người dùng Claude đã tranh luận sôi nổi về động thái này kể từ khi công ty tiết lộ vào đầu tuần rằng họ sẽ áp dụng watermark để tuân thủ Bộ quy tắc minh bạch của Đạo luật AI thuộc Liên minh Châu Âu (EU AI Act), quy định buộc các công ty AI phải triển khai hệ thống cho phép nhận diện nội dung do AI tạo ra.
Trên Reddit, một số người dùng xem đây như một hành động chống lại người dùng Claude thông thường, trong khi ý kiến khác lại cho rằng: "Lý do duy nhất khiến bạn không muốn điều này là vì bạn muốn lừa dối người khác." Bên cạnh đó, Business Insider đưa tin rằng "hàng chục" người dùng trên X đã tuyên bố hủy gói đăng ký trả phí Claude vì thay đổi này.
Trong bài đăng mới, Anthropic bắt đầu bằng cái nhìn tổng quan về khái niệm watermark, giải thích rằng khi đưa ra các "lựa chọn có mức độ rủi ro thấp" — chẳng hạn như việc chọn giữa các từ đồng nghĩa như "overcast" hay "grey" để mô tả thời tiết — Claude có thể tạo ra một chuỗi quy luật trong câu trả lời. Chuỗi này "hoàn toàn vô hình với người đọc, nhưng có thể bị phát hiện bởi bất kỳ ai nắm giữ khóa giải mã nó".
"Việc gắn watermark không hề làm ảnh hưởng đến chất lượng nội dung đầu ra của Claude," Anthropic cho biết. "Đối với người đọc, một câu trả lời có gắn watermark không có bất kỳ điểm khác biệt nào so với câu trả lời không gắn watermark."
Cụ thể hơn, Anthropic cho biết họ sẽ ứng dụng phương pháp SynthID-Text từng được nhóm Google DeepMind công bố vào năm 2024, đồng thời lên kế hoạch phát hành một API nhận diện watermark. Hãng cũng lưu ý rằng phương pháp watermark này hoàn toàn khác biệt với các công cụ phát hiện AI của các công ty như Pangram — vốn chỉ tìm kiếm các "dấu hiệu hành văn" đặc trưng để phán đoán nội dung AI: "Việc dựa vào các mẫu hành văn này về bản chất khác hoàn toàn so với việc kiểm tra watermark được nhúng trực tiếp."
Liệu người dùng có thể viết lại văn bản để làm biến mất watermark? Anthropic cho biết điều này có thể xảy ra, nhưng "việc chỉnh sửa nhẹ có thể sẽ không xóa bỏ hoàn toàn watermark", trong khi "việc viết lại toàn bộ nội dung và thay thế từng từ thì có thể".
"Tuy nhiên trong trường hợp viết lại hoàn toàn, hiển nhiên văn bản đó khó có thể tiếp tục bị coi là nội dung do AI tạo ra nữa," công ty nhận định.
Đối với câu hỏi liệu watermark có bị phát hiện trên các văn bản chỉ được Claude hiệu đính hoặc biên tập hay không, Anthropic cho biết điều đó phụ thuộc vào "độ dài của văn bản và mức độ can thiệp chỉnh sửa của Claude". Nếu văn bản chỉ được biên tập nhẹ, "hầu như toàn bộ câu chữ" vẫn do con người viết ra và "sẽ có rất ít (hoặc gần như không có) chỗ để watermark bám vào".
Trong khi đó, mã nguồn (code) sẽ chứa ít watermark hơn so với các loại văn bản thông thường, bởi mô hình bắt buộc phải tạo ra đoạn code có thể chạy được và không có quá nhiều sự tự do để chọn lựa giữa các phương án thay thế tương đương.
"Dù vậy, ở những vị trí có thể thoải mái chọn lựa câu chữ trong mã nguồn, chẳng hạn như phần chú thích (comment), watermark vẫn có thể được áp dụng," Anthropic cho biết. "Tuy nhiên, điều này về bản chất sẽ chỉ có tác động không đáng kể đến phần mã nguồn thực tế được tạo ra."
Anthropic cũng chia sẻ thêm rằng Claude sẽ không phải là chatbot AI duy nhất áp dụng việc gắn watermark vào văn bản, bởi "các nhà phát triển mô hình lớn khác cũng đã ký kết cùng một Bộ quy tắc thực hành và sẽ sớm triển khai các giải pháp watermark của riêng họ".
🚀 ANTHROPIC GIẢI THÍCH CHI TIẾT CÁCH THỨC GẮN WATERMARK ẨN TRÊN VĂN BẢN CỦA CLAUDE Anthropic vừa đăng tải một bài viết trên blog vào hôm thứ Sáu nhằm giải đáp các thắc mắc cơ bản về cách thức gắn watermark (dấu chìm ẩn) vào văn bản do chatbot Claude tạo ra. Các câu hỏi xoay quanh việc: Kỹ thuật này hoạt động chính xác ra sao? Liệu việc chỉnh sửa nội dung có thể làm mất dấu ẩn hay không? Và điều này sẽ ảnh hưởng như thế nào đến việc viết mã nguồn (code)? Cộng đồng người dùng Claude đã tranh luận sôi nổi về động thái này kể từ khi công ty tiết lộ vào đầu tuần rằng họ sẽ áp dụng watermark để tuân thủ Bộ quy tắc minh bạch của Đạo luật AI thuộc Liên minh Châu Âu (EU AI Act), quy định buộc các công ty AI phải triển khai hệ thống cho phép nhận diện nội dung do AI tạo ra. Trên Reddit, một số người dùng xem đây như một hành động chống lại người dùng Claude thông thường, trong khi ý kiến khác lại cho rằng: "Lý do duy nhất khiến bạn không muốn điều này là vì bạn muốn lừa dối người khác." Bên cạnh đó, Business Insider đưa tin rằng "hàng chục" người dùng trên X đã tuyên bố hủy gói đăng ký trả phí Claude vì thay đổi này. Trong bài đăng mới, Anthropic bắt đầu bằng cái nhìn tổng quan về khái niệm watermark, giải thích rằng khi đưa ra các "lựa chọn có mức độ rủi ro thấp" — chẳng hạn như việc chọn giữa các từ đồng nghĩa như "overcast" hay "grey" để mô tả thời tiết — Claude có thể tạo ra một chuỗi quy luật trong câu trả lời. Chuỗi này "hoàn toàn vô hình với người đọc, nhưng có thể bị phát hiện bởi bất kỳ ai nắm giữ khóa giải mã nó". "Việc gắn watermark không hề làm ảnh hưởng đến chất lượng nội dung đầu ra của Claude," Anthropic cho biết. "Đối với người đọc, một câu trả lời có gắn watermark không có bất kỳ điểm khác biệt nào so với câu trả lời không gắn watermark." Cụ thể hơn, Anthropic cho biết họ sẽ ứng dụng phương pháp SynthID-Text từng được nhóm Google DeepMind công bố vào năm 2024, đồng thời lên kế hoạch phát hành một API nhận diện watermark. Hãng cũng lưu ý rằng phương pháp watermark này hoàn toàn khác biệt với các công cụ phát hiện AI của các công ty như Pangram — vốn chỉ tìm kiếm các "dấu hiệu hành văn" đặc trưng để phán đoán nội dung AI: "Việc dựa vào các mẫu hành văn này về bản chất khác hoàn toàn so với việc kiểm tra watermark được nhúng trực tiếp." Liệu người dùng có thể viết lại văn bản để làm biến mất watermark? Anthropic cho biết điều này có thể xảy ra, nhưng "việc chỉnh sửa nhẹ có thể sẽ không xóa bỏ hoàn toàn watermark", trong khi "việc viết lại toàn bộ nội dung và thay thế từng từ thì có thể". "Tuy nhiên trong trường hợp viết lại hoàn toàn, hiển nhiên văn bản đó khó có thể tiếp tục bị coi là nội dung do AI tạo ra nữa," công ty nhận định. Đối với câu hỏi liệu watermark có bị phát hiện trên các văn bản chỉ được Claude hiệu đính hoặc biên tập hay không, Anthropic cho biết điều đó phụ thuộc vào "độ dài của văn bản và mức độ can thiệp chỉnh sửa của Claude". Nếu văn bản chỉ được biên tập nhẹ, "hầu như toàn bộ câu chữ" vẫn do con người viết ra và "sẽ có rất ít (hoặc gần như không có) chỗ để watermark bám vào". Trong khi đó, mã nguồn (code) sẽ chứa ít watermark hơn so với các loại văn bản thông thường, bởi mô hình bắt buộc phải tạo ra đoạn code có thể chạy được và không có quá nhiều sự tự do để chọn lựa giữa các phương án thay thế tương đương. "Dù vậy, ở những vị trí có thể thoải mái chọn lựa câu chữ trong mã nguồn, chẳng hạn như phần chú thích (comment), watermark vẫn có thể được áp dụng," Anthropic cho biết. "Tuy nhiên, điều này về bản chất sẽ chỉ có tác động không đáng kể đến phần mã nguồn thực tế được tạo ra." Anthropic cũng chia sẻ thêm rằng Claude sẽ không phải là chatbot AI duy nhất áp dụng việc gắn watermark vào văn bản, bởi "các nhà phát triển mô hình lớn khác cũng đã ký kết cùng một Bộ quy tắc thực hành và sẽ sớm triển khai các giải pháp watermark của riêng họ". 🗞 Nguồn: TechCrunch #vgsnews #vgs #tintuc
Nguồn: TechCrunch