OpenAI và Microsoft từng thừa nhận tự tay bóp méo web với 'vòng lặp diệt vong'
Các tài liệu tòa án mới được hé lộ trong vụ kiện của New York Times cho thấy OpenAI và Microsoft từng nội bộ cảnh báo việc cào dữ liệu huấn luyện AI là vụ trộm cắp lao động lớn nhất lịch sử. Cả hai công ty đều nhận thức rõ mô hình của họ sẽ tàn phá ngành xuất bản và tự hủy hoại nguồn cung cấp dữ liệu của chính mình, nhưng vẫn bất chấp theo đuổi lợi nhuận khổng lồ.

Các tài liệu tòa án mới được mở niêm phong trong vụ kiện giữa New York Times chống lại OpenAI và Microsoft đang mang lại những tình tiết vô cùng bất lợi cho hai hãng này. Tài liệu nội bộ của các công ty từng cảnh báo rằng họ đang khởi động một "vòng lặp diệt vong" gây tổn hại cho web, mô tả việc cào dữ liệu để huấn luyện mô hình là "vụ trộm cắp lao động lớn nhất trong lịch sử loài người", và việc này biến "ý tưởng về sử dụng hợp lý (fair use) trở thành một trò hề hoàn toàn".
Nhiều câu nói gây chú ý nhất trong tài liệu xuất phát từ Brent Hecht, Giám đốc Khoa học Ứng dụng của Microsoft. Mặc dù vậy, công ty đã cố gắng giữ khoảng cách với các phát biểu của Hecht. Người phát ngôn của Microsoft, Alex Haurek, chia sẻ với The Verge rằng: "Những bình luận này phản ánh quan điểm cá nhân của một nhân viên, không phải là phân tích pháp lý và không đại diện cho quan điểm của công ty".
Trong một văn bản nộp tòa khác, Jordan Usdan, Tổng giám đốc Chiến lược và Vận hành Dữ liệu tại Microsoft AI, đã mô tả vai trò của Hecht mang tính đối lập. Ông cho biết Hecht "mang các quan điểm khác biệt, mang tính học thuật và hướng tới tương lai về cách các hệ sinh thái dữ liệu cho AI nên hoạt động. Ông được Microsoft tuyển dụng để mang lại các góc độ bất đối xứng, mang tính tương lai và học thuật... ông không phải là người đại diện phát ngôn cho Microsoft về các quan điểm lý thuyết liên quan đến tác động tiềm tàng của AI đối với người sáng tạo nội dung".
Nhưng dù Microsoft có muốn nhận trách nhiệm về những bình luận này hay không, rõ ràng chúng đã trở thành sự thật. Hiện tượng Google Zero là có thật! AI đang nuốt chửng web!
Có rất nhiều phát biểu đáng kinh ngạc khác trong hồ sơ của NYT từ nhiều nhân vật khác nhau, bao gồm Satya Nadella, Sam Altman và các nhân viên khác của OpenAI. Dưới đây là những điểm nổi bật từ tài liệu dài 92 trang.
Một vụ trộm cắp đáng kinh ngạc
Phần mở đầu trích dẫn Hecht và Trưởng bộ phận ChatGPT của OpenAI (có lẽ là Nick Turley) theo cách cho thấy các công ty biết rằng họ đặt ra một "mối đe dọa hiện hữu" đối với các nhà xuất bản như New York Times. Hecht gọi việc thu thập dữ liệu của ChatGPT và Copilot là "vụ trộm cắp lao động lớn nhất trong lịch sử loài người" và nói rằng sự bào chữa của Microsoft biến "ý tưởng về 'sử dụng hợp lý' thành một trò hề hoàn toàn".
Đó là một "vòng lặp diệt vong"
Satya Nadella thừa nhận rằng các chatbot cơ bản đã thay thế tìm kiếm và loại bỏ nhu cầu đi thẳng đến nguồn để lấy thông tin. Nhưng có lẽ đáng lên án hơn là một tài liệu nội bộ của Microsoft cho biết: "Chiến lược nội dung AI của chúng tôi đã bắt đầu một 'vòng lặp diệt vong' vừa làm tổn hại hiệu suất của các mô hình vừa tổn hại toàn bộ web: Thật kỳ lạ khi một sản phẩm cuối cùng lại đe dọa nền tảng kinh tế của các nhà cung cấp thiết yếu của nó, nhưng đó là tình huống mà chúng tôi đã tạo ra cho doanh nghiệp LLM của mình đối với 'chuỗi cung ứng nội dung' của họ".
Con số đó thậm chí không có thật
Đừng để bị đánh lừa bởi các tuyên bố về ý định vị tha từ OpenAI hay Microsoft. Đồng sáng lập OpenAI Greg Brockman quan tâm nhiều hơn đến số tiền "khổng lồ" mà anh ta có thể kiếm được thông qua AI thương mại.
Tường phí là gì chứ
Bất chấp việc Nadella sau đó được trích dẫn nói rằng "bất cứ thứ gì có tường phí đều phải được cấp phép", một đại diện của OpenAI thừa nhận anh ta "không hề biết" về bất kỳ nỗ lực nào nhằm phát hiện hoặc loại bỏ nội dung có tường phí khỏi dữ liệu huấn luyện.
"Cực kỳ giỏi trong việc nhai lại"
Ở nội bộ, có vẻ như OpenAI thừa nhận rõ xu hướng của ChatGPT là tái tạo đơn giản tài liệu có bản quyền "từng câu từng chữ". Mặc dù công nhận việc "ngăn chặn việc ghi nhớ" rất quan trọng để "giảm thiểu vi phạm bản quyền", các nhân viên thừa nhận GPT-4 "đã ghi nhớ rất nhiều dữ liệu và do đó cực kỳ giỏi trong việc nhai lại".
Hồ sơ sau đó tiếp tục trích dẫn một số ví dụ về việc ChatGPT xuất ra các đoạn văn bản dài từ các bài báo trên Times, Mercury News, The Denver Post, LifeHacker và Eurogamer để trả lời các truy vấn.
"Hút sạch" toàn bộ công sức của họ
Microsoft biết rõ việc cào dữ liệu hàng loạt trên internet sẽ bị nhìn nhận ra sao và thừa nhận rằng "hầu như không ai có ý định để nội dung họ tạo ra được sử dụng theo cách này, cũng như họ không được đền bù cho việc sử dụng đó".
Một "sự thay thế cho lao động của con người"
Giám đốc Chính sách của OpenAI, Jack Clark, đã nhìn thấy trước tương lai khi nói rằng họ đang "tạo ra các hệ thống thay thế cho lao động của những người định hình 'văn hóa' của xã hội". Các tài liệu nội bộ mô tả ChatGPT như "sạp báo hiện đại". Nick Turley của OpenAI sau đó được trích dẫn nói rằng một khi bạn nhận được câu trả lời từ chatbot của họ, sẽ "không có lý do gì tốt để nhấp" vào một liên kết dẫn đến nguồn.
Tự phá hủy chuỗi cung ứng của chính mình
Microsoft được trích dẫn thừa nhận rằng "LLMs là một sản phẩm tự phá hủy chuỗi cung ứng của chính nó" bởi vì trong nhiều trường hợp, nó chính là sự thay thế cho dữ liệu huấn luyện của chính nó.
OpenAI biết rằng họ đang tiêu diệt lưu lượng truy cập giới thiệu
Các chuyên gia kinh tế và truyền thông của chính OpenAI quy kết sự sụt giảm lưu lượng truy cập giới thiệu cho các trang web như Times là do trực tiếp từ các bản tóm tắt AI như Google AI Overviews. Họ phỏng đoán rằng lưu lượng giới thiệu tìm kiếm có thể giảm tới 60%.
Người phát ngôn của Microsoft, Haurek, lưu ý rằng "lời khai của Satya và lập trường của Microsoft trong vụ việc này hoàn toàn nhất quán. Ông ấy đã nói về các nguyên tắc rộng lớn và những thay đổi đang diễn ra trong cách mọi người tìm kiếm và tiêu thụ thông tin. Những quan sát đó không nên bị nhầm lẫn với các kết luận về các vấn đề bản quyền trước Tòa án, điều mà Microsoft giải quyết trong các văn bản trình lên tòa".
Nhưng có vẻ khá rõ ràng dựa trên tài liệu mới được mở niêm phong này rằng cả Microsoft và OpenAI đều biết họ sẽ gây tổn hại không thể khắc phục cho ngành xuất bản, "hàng triệu người" mà ngành này thuê mướn, và mở rộng ra là làm tổn hại sản phẩm của chính họ, nhưng vẫn tiến hành bất chấp để theo đuổi số tiền "khổng lồ" - mặc cho vòng lặp diệt vong.
🌐 OPENAI VÀ MICROSOFT TỪNG THỪA NHẬN TỰ TAY BÓP MÉO WEB VỚI 'VÒNG LẶP DIỆT VONG' Các tài liệu tòa án mới được mở niêm phong trong vụ kiện giữa New York Times chống lại OpenAI và Microsoft đang mang lại những tình tiết vô cùng bất lợi cho hai hãng này. Tài liệu nội bộ của các công ty từng cảnh báo rằng họ đang khởi động một "vòng lặp diệt vong" gây tổn hại cho web, mô tả việc cào dữ liệu để huấn luyện mô hình là "vụ trộm cắp lao động lớn nhất trong lịch sử loài người", và việc này biến "ý tưởng về sử dụng hợp lý (fair use) trở thành một trò hề hoàn toàn". Nhiều câu nói gây chú ý nhất trong tài liệu xuất phát từ Brent Hecht, Giám đốc Khoa học Ứng dụng của Microsoft. Mặc dù vậy, công ty đã cố gắng giữ khoảng cách với các phát biểu của Hecht. Người phát ngôn của Microsoft, Alex Haurek, chia sẻ với The Verge rằng: "Những bình luận này phản ánh quan điểm cá nhân của một nhân viên, không phải là phân tích pháp lý và không đại diện cho quan điểm của công ty". Trong một văn bản nộp tòa khác, Jordan Usdan, Tổng giám đốc Chiến lược và Vận hành Dữ liệu tại Microsoft AI, đã mô tả vai trò của Hecht mang tính đối lập. Ông cho biết Hecht "mang các quan điểm khác biệt, mang tính học thuật và hướng tới tương lai về cách các hệ sinh thái dữ liệu cho AI nên hoạt động. Ông được Microsoft tuyển dụng để mang lại các góc độ bất đối xứng, mang tính tương lai và học thuật... ông không phải là người đại diện phát ngôn cho Microsoft về các quan điểm lý thuyết liên quan đến tác động tiềm tàng của AI đối với người sáng tạo nội dung". Nhưng dù Microsoft có muốn nhận trách nhiệm về những bình luận này hay không, rõ ràng chúng đã trở thành sự thật. Hiện tượng Google Zero là có thật! AI đang nuốt chửng web! Có rất nhiều phát biểu đáng kinh ngạc khác trong hồ sơ của NYT từ nhiều nhân vật khác nhau, bao gồm Satya Nadella, Sam Altman và các nhân viên khác của OpenAI. Dưới đây là những điểm nổi bật từ tài liệu dài 92 trang. Một vụ trộm cắp đáng kinh ngạc Phần mở đầu trích dẫn Hecht và Trưởng bộ phận ChatGPT của OpenAI (có lẽ là Nick Turley) theo cách cho thấy các công ty biết rằng họ đặt ra một "mối đe dọa hiện hữu" đối với các nhà xuất bản như New York Times. Hecht gọi việc thu thập dữ liệu của ChatGPT và Copilot là "vụ trộm cắp lao động lớn nhất trong lịch sử loài người" và nói rằng sự bào chữa của Microsoft biến "ý tưởng về 'sử dụng hợp lý' thành một trò hề hoàn toàn". Đó là một "vòng lặp diệt vong" Satya Nadella thừa nhận rằng các chatbot cơ bản đã thay thế tìm kiếm và loại bỏ nhu cầu đi thẳng đến nguồn để lấy thông tin. Nhưng có lẽ đáng lên án hơn là một tài liệu nội bộ của Microsoft cho biết: "Chiến lược nội dung AI của chúng tôi đã bắt đầu một 'vòng lặp diệt vong' vừa làm tổn hại hiệu suất của các mô hình vừa tổn hại toàn bộ web: Thật kỳ lạ khi một sản phẩm cuối cùng lại đe dọa nền tảng kinh tế của các nhà cung cấp thiết yếu của nó, nhưng đó là tình huống mà chúng tôi đã tạo ra cho doanh nghiệp LLM của mình đối với 'chuỗi cung ứng nội dung' của họ". Con số đó thậm chí không có thật Đừng để bị đánh lừa bởi các tuyên bố về ý định vị tha từ OpenAI hay Microsoft. Đồng sáng lập OpenAI Greg Brockman quan tâm nhiều hơn đến số tiền "khổng lồ" mà anh ta có thể kiếm được thông qua AI thương mại. Tường phí là gì chứ Bất chấp việc Nadella sau đó được trích dẫn nói rằng "bất cứ thứ gì có tường phí đều phải được cấp phép", một đại diện của OpenAI thừa nhận anh ta "không hề biết" về bất kỳ nỗ lực nào nhằm phát hiện hoặc loại bỏ nội dung có tường phí khỏi dữ liệu huấn luyện. "Cực kỳ giỏi trong việc nhai lại" Ở nội bộ, có vẻ như OpenAI thừa nhận rõ xu hướng của ChatGPT là tái tạo đơn giản tài liệu có bản quyền "từng câu từng chữ". Mặc dù công nhận việc "ngăn chặn việc ghi nhớ" rất quan trọng để "giảm thiểu vi phạm bản quyền", các nhân viên thừa nhận GPT-4 "đã ghi nhớ rất nhiều dữ liệu và do đó cực kỳ giỏi trong việc nhai lại". Hồ sơ sau đó tiếp tục trích dẫn một số ví dụ về việc ChatGPT xuất ra các đoạn văn bản dài từ các bài báo trên Times, Mercury News, The Denver Post, LifeHacker và Eurogamer để trả lời các truy vấn. "Hút sạch" toàn bộ công sức của họ Microsoft biết rõ việc cào dữ liệu hàng loạt trên internet sẽ bị nhìn nhận ra sao và thừa nhận rằng "hầu như không ai có ý định để nội dung họ tạo ra được sử dụng theo cách này, cũng như họ không được đền bù cho việc sử dụng đó". Một "sự thay thế cho lao động của con người" Giám đốc Chính sách của OpenAI, Jack Clark, đã nhìn thấy trước tương lai khi nói rằng họ đang "tạo ra các hệ thống thay thế cho lao động của những người định hình 'văn hóa' của xã hội". Các tài liệu nội bộ mô tả ChatGPT như "sạp báo hiện đại". Nick Turley của OpenAI sau đó được trích dẫn nói rằng một khi bạn nhận được câu trả lời từ chatbot của họ, sẽ "không có lý do gì tốt để nhấp" vào một liên kết dẫn đến nguồn. Tự phá hủy chuỗi cung ứng của chính mình Microsoft được trích dẫn thừa nhận rằng "LLMs là một sản phẩm tự phá hủy chuỗi cung ứng của chính nó" bởi vì trong nhiều trường hợp, nó chính là sự thay thế cho dữ liệu huấn luyện của chính nó. OpenAI biết rằng họ đang tiêu diệt lưu lượng truy cập giới thiệu Các chuyên gia kinh tế và truyền thông của chính OpenAI quy kết sự sụt giảm lưu lượng truy cập giới thiệu cho các trang web như Times là do trực tiếp từ các bản tóm tắt AI như Google AI Overviews. Họ phỏng đoán rằng lưu lượng giới thiệu tìm kiếm có thể giảm tới 60%. Người phát ngôn của Microsoft, Haurek, lưu ý rằng "lời khai của Satya và lập trường của Microsoft trong vụ việc này hoàn toàn nhất quán. Ông ấy đã nói về các nguyên tắc rộng lớn và những thay đổi đang diễn ra trong cách mọi người tìm kiếm và tiêu thụ thông tin. Những quan sát đó không nên bị nhầm lẫn với các kết luận về các vấn đề bản quyền trước Tòa án, điều mà Microsoft giải quyết trong các văn bản trình lên tòa". Nhưng có vẻ khá rõ ràng dựa trên tài liệu mới được mở niêm phong này rằng cả Microsoft và OpenAI đều biết họ sẽ gây tổn hại không thể khắc phục cho ngành xuất bản, "hàng triệu người" mà ngành này thuê mướn, và mở rộng ra là làm tổn hại sản phẩm của chính họ, nhưng vẫn tiến hành bất chấp để theo đuổi số tiền "khổng lồ" - mặc cho vòng lặp diệt vong. 🗞 Nguồn: The Verge #vgsnews #vgs #tintuc
Nguồn: The Verge