Huấn luyện mô hình AI bằng sách có bản quyền: Chuyện hợp pháp hay không?
Việc các công ty công nghệ dùng sách và bài viết có bản quyền để huấn luyện AI đang gây tranh cãi lớn nhưng thực tế pháp lý phức tạp hơn nhiều. Các thẩm phán hiện phải áp dụng luật bản quyền từ năm 1976 để giải quyết những câu hỏi chưa từng có tiền lệ về học máy và tính sử dụng hợp lý (fair use).
Bạn có lẽ đã biết rằng các mô hình AI đằng sau ChatGPT, Gemini, Claude và các chatbot khác được huấn luyện trên các cơ sở dữ liệu dường như vô tận chứa hàng trăm triệu cuốn sách, bài báo trực tuyến, tài liệu học thuật và bất cứ thứ gì bạn có thể tìm thấy trên internet. Hầu hết các tác giả đã xuất bản, mà không hề hay biết hoặc đồng ý, đã đóng góp vào sự phát triển của chính những công cụ AI đang đe dọa sinh kế của họ. Nghe có vẻ bất hợp pháp phải không?
Thực tế không đơn giản như vậy.
Cathy Gellis, một luật sư chuyên về sở hữu trí tuệ, bản quyền và công nghệ, chia sẻ với TechCrunch: "Tôi nghĩ một trong những vấn đề của toàn bộ lĩnh vực luật pháp và công nghệ này là có quá nhiều thứ đang diễn ra. Nó rất phức tạp và có rất nhiều cảm xúc thô mòn về những gì đang xảy ra, cả ủng hộ lẫn phản đối".
Năm ngoái, trong một phán quyết đầu tiên kiểu này, Thẩm phán William Alsup đã ra lệnh cho Anthropic phải trả khoản bồi thường vi phạm bản quyền khổng lồ 1,5 tỷ USD cho một nhóm nhà văn có tác phẩm được dùng để huấn luyện các mô hình AI của công ty. Nhìn bề ngoài, đây có vẻ là một chiến thắng đạo đức nghiêng về các tác giả, nhưng Thẩm phán Alsup thực chất đã phán quyết rằng việc Anthropic huấn luyện AI là hợp pháp. Điều khiến ông phạt Anthropic là do họ đã cướp bản quyền những cuốn sách này từ các thư viện bóng tối bất hợp pháp trên mạng.
Thẩm phán viết: "Giống như bất kỳ độc giả nào khao khát trở thành nhà văn, các mô hình ngôn ngữ lớn (LLM) của Anthropic được huấn luyện dựa trên các tác phẩm không phải để vượt lên và sao chép hay thay thế chúng - mà là để chuyển hướng và tạo ra thứ gì đó khác biệt", khi ông so sánh cách một LLM nạp vào hàng nghìn tỷ từ với việc một nhà văn nghiên cứu văn học.
Gellis cho rằng phán quyết này có lợi hơn cho các công ty AI. Khoản tiền phạt 1,5 tỷ USD thấm tháp vào đâu đối với một công ty dự kiến đạt doanh thu hàng năm khoảng 200 tỷ USD vào năm 2028?
Gellis nói: "Tôi nghĩ nhìn chung đây là tin tốt cho việc huấn luyện AI khi ông ấy xem xét những gì đang diễn ra và thực sự coi nó tương tự như việc đọc một tác phẩm có bản quyền thay vì sao chép một tác phẩm có bản quyền. Luật bản quyền xoay quanh việc sao chép, chứ không xoay quanh việc sử dụng, trải nghiệm, tiêu thụ hay đọc tác phẩm".
Luật bản quyền chưa được cập nhật kể từ năm 1976, điều này có nghĩa là các thẩm phán phải tìm cách diễn giải các hướng dẫn từ 50 năm trước khi đối mặt với các câu hỏi pháp lý có tiềm năng định hình tương lai của ngành công nghiệp AI.
Jason Henderson, Luật sư cao cấp kiêm Người sáng lập Nhóm thực thi Sở hữu trí tuệ & Truyền thông tại JWL International, chia sẻ với TechCrunch: "Mọi người hiện đang rất lo lắng vì luật pháp đang chồng chéo và đó là do câu hỏi này. Họ biết rằng mô hình AI đã được huấn luyện trên rất nhiều thứ, và luật pháp thực sự chưa bắt kịp câu hỏi đó".
Những câu hỏi này thường xoay quanh luật sử dụng hợp lý (fair use) - cụ thể là việc sử dụng một tác phẩm có bản quyền có đủ tính "chuyển đổi" (transformative) để được coi là hợp pháp hay không.
Sử dụng hợp lý là một ngoại lệ của luật bản quyền cho phép sử dụng tài liệu có bản quyền mà không cần sự cho phép rõ ràng, bảo vệ khả năng bình luận và lặp lại các tác phẩm có bản quyền thông qua hình thức phê bình, nhại lại, giáo dục và các phương tiện khác. Các thẩm phán xem xét các yếu tố cụ thể khi quyết định xem một cái gì đó có phải là sử dụng hợp lý hay không, bao gồm mục đích và bản chất của tác phẩm, số lượng được sử dụng và tác động của nó đối với thị trường.
Henderson lưu ý: "Bản quyền luôn xoay quanh việc bảo vệ và phát triển thị trường. Các tòa án đang đưa ra nhiều lý luận khác nhau [trong các vụ kiện về AI]. Điều có xu hướng thắng thế là nếu những gì bạn đang làm là huấn luyện trên tài sản của ai đó vì mục đích cạnh tranh trực tiếp, thì các tòa án sẽ không đồng tình... Nếu những gì bạn đang làm không cạnh tranh, thì các tòa án có xu hướng tìm ra cách để nó được chấp nhận".
Henderson đang nhắc đến một vụ kiện trong đó công ty truyền thông và công nghệ Thomson Reuters kiện công ty nghiên cứu Ross Intelligence vì đã sao chép nội dung của họ để xây dựng một nền tảng pháp lý cạnh tranh dựa trên AI.
Năm ngoái, Thẩm phán Stephanos Bibas đã viết: "Việc sử dụng của Ross không mang tính chuyển đổi vì nó không có 'mục đích xa hơn hoặc tính cách khác biệt' so với Thomson Reuters".
Trong vụ án đó, Thẩm phán Bibas quyết định rằng việc huấn luyện dựa trên nội dung của Reuters để tạo ra một nền tảng mới cạnh tranh trực tiếp với họ không phải là sử dụng hợp lý. Mặc dù các tác giả có thể lập luận rằng chatbot đang cạnh tranh với họ bằng cách sử dụng các tác phẩm của họ để tạo ra những cuốn sách tổng hợp mới, nhưng lập luận đó vẫn chưa chiến thắng tại tòa án.
Khi nói đến mối quan hệ giữa AI và bản quyền, Gellis thấy việc thu hẹp những gì chúng ta đang thực sự bàn luận là hữu ích – cách chúng ta suy nghĩ về bản quyền đối với việc huấn luyện AI hoàn toàn khác với cách chúng ta suy nghĩ về bản quyền đối với nội dung do AI tạo ra.
Trong một vụ án, Thaler v. Perlmutter, tòa án đã phán quyết rằng nếu một tác phẩm được tạo ra hoàn toàn 100% bằng AI thì không thể đăng ký bản quyền, điều này lại mở ra một loạt rắc rối mới – làm thế nào chúng ta có thể chứng minh một cách dứt khoát rằng một tác phẩm có được tạo ra bằng AI hay không, và nếu có, làm thế nào chúng ta biết bao nhiêu phần trăm trong số đó được tạo ra hoặc hỗ trợ bởi AI?
Gellis cho biết: "Nếu bạn viết tiểu thuyết của mình bằng [Microsoft] Word và chạy tính năng kiểm tra chính tả, chúng ta cảm thấy thoải mái với ý tưởng rằng Word không sở hữu tiểu thuyết của bạn. [AI] đang buộc chúng ta phải nhìn nhận một loạt quyết định mà chúng ta đã phớt lờ trong một thời gian".
Hầu hết các công ty AI vẫn đang vướng vào các vụ kiện tụng đang chờ xử lý xung quanh các vấn đề này, điều này có nghĩa là chúng ta sẽ không sớm có được giải pháp dứt khoát cho những vấn đề này.
Gellis chia sẻ: "Những gì bạn đang thấy là các đợt tấn công mở đầu mang tính ảnh hưởng, và bản thân ảnh hưởng đó có thể bị đảo ngược nếu các tòa án khác đưa ra các quyết định khác nhau, và sẽ phải mất các giai đoạn kiện tụng sau đó để tìm ra bên nào sẽ chiếm ưu thế. Nhưng trong thời gian đó, tất cả các quyết định này đang định hình mọi thứ đang diễn ra. Thật ngốc nghếch nếu các công ty AI phớt lờ chúng".
🚀 HUẤN LUYỆN MÔ HÌNH AI BẰNG SÁCH CÓ BẢN QUYỀN: CHUYỆN HỢP PHÁP HAY KHÔNG? Bạn có lẽ đã biết rằng các mô hình AI đằng sau ChatGPT, Gemini, Claude và các chatbot khác được huấn luyện trên các cơ sở dữ liệu dường như vô tận chứa hàng trăm triệu cuốn sách, bài báo trực tuyến, tài liệu học thuật và bất cứ thứ gì bạn có thể tìm thấy trên internet. Hầu hết các tác giả đã xuất bản, mà không hề hay biết hoặc đồng ý, đã đóng góp vào sự phát triển của chính những công cụ AI đang đe dọa sinh kế của họ. Nghe có vẻ bất hợp pháp phải không? Thực tế không đơn giản như vậy. Cathy Gellis, một luật sư chuyên về sở hữu trí tuệ, bản quyền và công nghệ, chia sẻ với TechCrunch: "Tôi nghĩ một trong những vấn đề của toàn bộ lĩnh vực luật pháp và công nghệ này là có quá nhiều thứ đang diễn ra. Nó rất phức tạp và có rất nhiều cảm xúc thô mòn về những gì đang xảy ra, cả ủng hộ lẫn phản đối". Năm ngoái, trong một phán quyết đầu tiên kiểu này, Thẩm phán William Alsup đã ra lệnh cho Anthropic phải trả khoản bồi thường vi phạm bản quyền khổng lồ 1,5 tỷ USD cho một nhóm nhà văn có tác phẩm được dùng để huấn luyện các mô hình AI của công ty. Nhìn bề ngoài, đây có vẻ là một chiến thắng đạo đức nghiêng về các tác giả, nhưng Thẩm phán Alsup thực chất đã phán quyết rằng việc Anthropic huấn luyện AI là hợp pháp. Điều khiến ông phạt Anthropic là do họ đã cướp bản quyền những cuốn sách này từ các thư viện bóng tối bất hợp pháp trên mạng. Thẩm phán viết: "Giống như bất kỳ độc giả nào khao khát trở thành nhà văn, các mô hình ngôn ngữ lớn (LLM) của Anthropic được huấn luyện dựa trên các tác phẩm không phải để vượt lên và sao chép hay thay thế chúng - mà là để chuyển hướng và tạo ra thứ gì đó khác biệt", khi ông so sánh cách một LLM nạp vào hàng nghìn tỷ từ với việc một nhà văn nghiên cứu văn học. Gellis cho rằng phán quyết này có lợi hơn cho các công ty AI. Khoản tiền phạt 1,5 tỷ USD thấm tháp vào đâu đối với một công ty dự kiến đạt doanh thu hàng năm khoảng 200 tỷ USD vào năm 2028? Gellis nói: "Tôi nghĩ nhìn chung đây là tin tốt cho việc huấn luyện AI khi ông ấy xem xét những gì đang diễn ra và thực sự coi nó tương tự như việc đọc một tác phẩm có bản quyền thay vì sao chép một tác phẩm có bản quyền. Luật bản quyền xoay quanh việc sao chép, chứ không xoay quanh việc sử dụng, trải nghiệm, tiêu thụ hay đọc tác phẩm". Luật bản quyền chưa được cập nhật kể từ năm 1976, điều này có nghĩa là các thẩm phán phải tìm cách diễn giải các hướng dẫn từ 50 năm trước khi đối mặt với các câu hỏi pháp lý có tiềm năng định hình tương lai của ngành công nghiệp AI. Jason Henderson, Luật sư cao cấp kiêm Người sáng lập Nhóm thực thi Sở hữu trí tuệ & Truyền thông tại JWL International, chia sẻ với TechCrunch: "Mọi người hiện đang rất lo lắng vì luật pháp đang chồng chéo và đó là do câu hỏi này. Họ biết rằng mô hình AI đã được huấn luyện trên rất nhiều thứ, và luật pháp thực sự chưa bắt kịp câu hỏi đó". Những câu hỏi này thường xoay quanh luật sử dụng hợp lý (fair use) - cụ thể là việc sử dụng một tác phẩm có bản quyền có đủ tính "chuyển đổi" (transformative) để được coi là hợp pháp hay không. Sử dụng hợp lý là một ngoại lệ của luật bản quyền cho phép sử dụng tài liệu có bản quyền mà không cần sự cho phép rõ ràng, bảo vệ khả năng bình luận và lặp lại các tác phẩm có bản quyền thông qua hình thức phê bình, nhại lại, giáo dục và các phương tiện khác. Các thẩm phán xem xét các yếu tố cụ thể khi quyết định xem một cái gì đó có phải là sử dụng hợp lý hay không, bao gồm mục đích và bản chất của tác phẩm, số lượng được sử dụng và tác động của nó đối với thị trường. Henderson lưu ý: "Bản quyền luôn xoay quanh việc bảo vệ và phát triển thị trường. Các tòa án đang đưa ra nhiều lý luận khác nhau [trong các vụ kiện về AI]. Điều có xu hướng thắng thế là nếu những gì bạn đang làm là huấn luyện trên tài sản của ai đó vì mục đích cạnh tranh trực tiếp, thì các tòa án sẽ không đồng tình... Nếu những gì bạn đang làm không cạnh tranh, thì các tòa án có xu hướng tìm ra cách để nó được chấp nhận". Henderson đang nhắc đến một vụ kiện trong đó công ty truyền thông và công nghệ Thomson Reuters kiện công ty nghiên cứu Ross Intelligence vì đã sao chép nội dung của họ để xây dựng một nền tảng pháp lý cạnh tranh dựa trên AI. Năm ngoái, Thẩm phán Stephanos Bibas đã viết: "Việc sử dụng của Ross không mang tính chuyển đổi vì nó không có 'mục đích xa hơn hoặc tính cách khác biệt' so với Thomson Reuters". Trong vụ án đó, Thẩm phán Bibas quyết định rằng việc huấn luyện dựa trên nội dung của Reuters để tạo ra một nền tảng mới cạnh tranh trực tiếp với họ không phải là sử dụng hợp lý. Mặc dù các tác giả có thể lập luận rằng chatbot đang cạnh tranh với họ bằng cách sử dụng các tác phẩm của họ để tạo ra những cuốn sách tổng hợp mới, nhưng lập luận đó vẫn chưa chiến thắng tại tòa án. Khi nói đến mối quan hệ giữa AI và bản quyền, Gellis thấy việc thu hẹp những gì chúng ta đang thực sự bàn luận là hữu ích – cách chúng ta suy nghĩ về bản quyền đối với việc huấn luyện AI hoàn toàn khác với cách chúng ta suy nghĩ về bản quyền đối với nội dung do AI tạo ra. Trong một vụ án, Thaler v. Perlmutter, tòa án đã phán quyết rằng nếu một tác phẩm được tạo ra hoàn toàn 100% bằng AI thì không thể đăng ký bản quyền, điều này lại mở ra một loạt rắc rối mới – làm thế nào chúng ta có thể chứng minh một cách dứt khoát rằng một tác phẩm có được tạo ra bằng AI hay không, và nếu có, làm thế nào chúng ta biết bao nhiêu phần trăm trong số đó được tạo ra hoặc hỗ trợ bởi AI? Gellis cho biết: "Nếu bạn viết tiểu thuyết của mình bằng [Microsoft] Word và chạy tính năng kiểm tra chính tả, chúng ta cảm thấy thoải mái với ý tưởng rằng Word không sở hữu tiểu thuyết của bạn. [AI] đang buộc chúng ta phải nhìn nhận một loạt quyết định mà chúng ta đã phớt lờ trong một thời gian". Hầu hết các công ty AI vẫn đang vướng vào các vụ kiện tụng đang chờ xử lý xung quanh các vấn đề này, điều này có nghĩa là chúng ta sẽ không sớm có được giải pháp dứt khoát cho những vấn đề này. Gellis chia sẻ: "Những gì bạn đang thấy là các đợt tấn công mở đầu mang tính ảnh hưởng, và bản thân ảnh hưởng đó có thể bị đảo ngược nếu các tòa án khác đưa ra các quyết định khác nhau, và sẽ phải mất các giai đoạn kiện tụng sau đó để tìm ra bên nào sẽ chiếm ưu thế. Nhưng trong thời gian đó, tất cả các quyết định này đang định hình mọi thứ đang diễn ra. Thật ngốc nghếch nếu các công ty AI phớt lờ chúng". 🗞 Nguồn: TechCrunch #vgsnews #vgs #tintuc
Nguồn: TechCrunch