Bản tin công nghệ quốc tế · dịch tiếng Việt 18.09.2026 RSS
AI & Dữ liệu · TechCrunch

Tài liệu hé lộ lãnh đạo Microsoft từng gọi việc thu thập dữ liệu AI là hành vi trộm cắp

Các tài liệu tòa án mới được công bố trong vụ kiện bản quyền giữa The New York Times với OpenAI và Microsoft cho thấy nội bộ các bên từng thừa nhận AI scraping có thể là hành vi trộm cắp. Tài liệu cũng cáo buộc hai hãng này đã tìm cách vượt tường paywall và loại bỏ thông báo bản quyền khi huấn luyện mô hình.

TechCrunch18.09.20267 phút đọc1 lượt đọc

Những thông tin mới không bị che giấu trong vụ kiện bản quyền mà The New York Times đệ đơn chống lại OpenAI và Microsoft ba năm trước đã tiết lộ một thừa nhận rằng việc thu thập dữ liệu (AI scraping) tương đương với hành vi trộm cắp, và các sản phẩm AI đặt ra mối đe dọa lớn đối với các cơ quan báo chí.

Theo hồ sơ vụ kiện, một lãnh đạo cấp cao của Microsoft từng mô tả riêng tư các hoạt động huấn luyện AI của các công ty này là "trộm cắp", trong khi lãnh đạo của chính OpenAI cho biết các mô hình AI của họ đặt ra "mối đe dọa hiện hữu" đối với các nhà xuất bản và nhà báo có tác phẩm được dùng để huấn luyện.

Tài liệu mới được mở niêm phong cũng chi tiết hóa cách thức các công ty này bị cáo buộc đã thu được và sử dụng nội dung đó bằng cách lách qua các bức tường thu phí (paywall) mà không bị phát hiện, xây dựng các tập dữ liệu huấn luyện thông qua việc thu thập hàng loạt, và cố ý loại bỏ các thông báo bản quyền khỏi dữ liệu huấn luyện.

Cần lưu ý rằng phần lớn thông tin mới xuất phát từ bản tóm tắt pháp lý của chính The New York Times, chứ không phải từ các tài liệu bằng chứng gốc vốn vẫn đang được niêm phong. Các trích dẫn dưới đây được trình bày mà không có ngữ cảnh ban đầu của chúng.

Hồ sơ chưa được che giấu này là diễn biến mới nhất trong vụ kiện kéo dài ba năm qua, trong đó The New York Times ban đầu cáo buộc các công ty vi phạm luật bản quyền bằng cách huấn luyện các mô hình AI tạo sinh dựa trên nội dung của họ.

Câu hỏi liệu các công ty AI có được phép sử dụng hợp pháp tài liệu có bản quyền để huấn luyện AI hay không vẫn chưa có câu trả lời rõ ràng, nhưng các thẩm phán phần lớn nghiêng về lập luận của các công ty AI rằng việc huấn luyện cấu thành "sử dụng hợp lý" (fair use). Quy định pháp lý này cho phép mọi người sử dụng các tác phẩm có bản quyền mà không cần xin phép trong một số trường hợp nhất định, như chế nhạo, đưa tin tức hoặc phê bình. Đầu tháng này, chính quyền ông Trump đã nộp một bản tóm tắt bảo vệ việc OpenAI sử dụng trái phép tài liệu có bản quyền để huấn luyện các LLM của mình.

Tuy nhiên, một số lời thừa nhận mới lại đi ngược lại với biện护 sử dụng hợp lý của OpenAI, đặc biệt là yêu cầu của quy định rằng việc sử dụng không được thay thế hoặc làm hại thị trường cho tác phẩm gốc.

Ví dụ, dữ liệu của chính Microsoft cho thấy "cỗ máy trả lời" Copilot của họ đã khiến tỷ lệ nhấp chuột vào trang web của The New York Times giảm tới 93% so với tìm kiếm Bing truyền thống. Một bài thuyết trình nội bộ của Microsoft do Giám đốc Khoa học Ứng dụng Brent Hecht viết vào tháng 1 năm 2024 đã mô tả sự sụt giảm này là một "vòng lặp diệt vong" sẽ "làm tổn hại hiệu suất của các mô hình của chúng tôi và toàn bộ web cùng một lúc".

"Thật là bất thường khi một sản phẩm cuối cùng đe dọa nền tảng kinh tế của các nhà cung cấp thiết yếu của nó, nhưng đó là tình huống mà chúng ta đã tạo ra cho doanh nghiệp LLM của mình đối với 'chuỗi cung ứng nội dung' của nó," tài liệu của Microsoft viết, được trích dẫn trong hồ sơ.

Giám đốc điều hành Microsoft Satya Nadella cũng khai trước tòa vào đầu năm nay rằng "bất cứ thứ gì nằm sau tường thu phí nên được cấp phép bởi bất kỳ ai muốn sử dụng nó... để củng cố hoặc huấn luyện," đồng thời làm rõ rằng nếu ông "được thông báo rằng OpenAI đã thu thập và huấn luyện dựa trên thông tin nằm sau tường thu phí," ông sẽ "yêu cầu OpenAI huấn luyện lại các mô hình của mình."

Các thừa nhận khác đi ngược lại các trụ cột khác của bài kiểm tra sử dụng hợp lý: Trưởng bộ phận ChatGPT của OpenAI, Nick Turley, đã viết trong một thông tin liên lạc nội bộ rằng các nhà xuất bản phải đối mặt với một "mối đe dọa hiện hữu" từ các sản phẩm như chatbot, vốn "phần lớn mang tính thay thế" và "sẽ ngày càng thay thế nhiều hơn khi chúng trở nên tốt hơn."

Chủ tịch OpenAI Greg Brockman mô tả các mô hình này là "xuất sắc về tin tức". Ông Nadella đã đồng ý dưới lời tuyên thệ vào đầu năm nay rằng việc trò chuyện với các chatbot "đã thay thế... việc cung cấp cho bạn thông tin ngay tại đó trên trang web trên nền tảng AI thay vì cần phải truy cập nguồn gốc cơ bản."

Loại ngôn ngữ đó nói lên cách công nghệ có thể cạnh tranh trực tiếp, thay vì chuyển đổi, tác phẩm gốc.

Tài liệu của Microsoft nêu rõ rằng có một "rủi ro thực sự" là AI tạo sinh có thể "làm gián đoạn đáng kể việc làm của chính những người đã tạo ra dữ liệu mà trên đó mô hình nền tảng được huấn luyện.

Quy mô sao chép thực sự rất đáng chú ý. Các tài liệu lần lượt tiết lộ lần đầu tiên rằng các tập dữ liệu huấn luyện giữa kỳ của OpenAI chỉ riêng chứa hơn 91.692 bản sao các tác phẩm do NYT, Daily News và Center for Investigative Reporting xuất bản. Một tập dữ liệu bắt nguồn từ Common Crawl bao gồm hơn 2 triệu tài liệu chỉ riêng từ nytimes.com.

Trong một bản ghi nhớ nội bộ vào tháng 1 năm 2023, ông Hecht gọi đó là "một vụ trộm cắp đáng kinh ngạc với quy mô chưa từng có" và "vụ trộm cắp lao động lớn nhất trong lịch sử loài người."

Hồ sơ phác thảo chi tiết mới về cách OpenAI và Microsoft tiến hành mua lại nội dung của nguyên đơn, bao gồm việc thu thập nó từ Chỉ mục Bing.

"OpenAI đã giao toàn bộ tập dữ liệu huấn luyện GPT-3 cho Microsoft, hãng đã sử dụng nó để đánh giá cách triển khai các mô hình của OpenAI trong các sản phẩm thương mại của riêng mình," hồ sơ đọc. "Microsoft cũng tương tự cung cấp dữ liệu huấn luyện cho OpenAI thông qua các Sáng kiến gọi là Dự án Taxi và Dự án Mango."

Các công ty bị cáo buộc đã tập hợp dữ liệu Dự án Mango thành một tập dữ liệu huấn luyện chứa các bản sao của ít nhất 160.903 tác phẩm độc nhất từ các nhà xuất bản tin tức.

Để tận dụng tối đa việc thu thập dữ liệu của họ, các nhân viên OpenAI được cho là đã đưa ra một kế hoạch để vượt qua các bức tường thu phí mà không bị phát hiện. Các hồ sơ cho thấy khi nhà nghiên cứu Nick Ryder của OpenAI nói với ông Brockman về một "mẹo để vượt qua tường thu phí nytimes," ông Brockman đã trả lời: "ah hay đấy."

Các nhân viên OpenAI cũng bị cáo buộc đã xây dựng các tập dữ liệu huấn luyện như WebText và WebText2 với sự phụ thuộc không cân đối vào nội dung tin tức được thu thập. Họ cũng bị cáo buộc đã kéo hàng triệu bài viết từ Common Crawl, một kho lưu trữ dữ liệu thu thập web miễn phí, mở. Các phát hiện cũng mô tả những nỗ lực có chủ ý nhằm loại bỏ các thông báo bản quyền khỏi dữ liệu huấn luyện trước khi nó đến mô hình, vì các nhà nghiên cứu "sẽ không muốn mô hình xuất ra" "thông báo bản quyền" cho người dùng.

OpenAI và Microsoft đã không trả lời các yêu cầu bình luận.


Cùng chuyên mục · AI & Dữ liệu
🚀 VGSNews
AI & Dữ liệu

FAA chi 875 triệu USD mua phần mềm AI để giải quyết khủng hoảng kiểm soát không lưu

Cục Hàng không Liên bang Mỹ (FAA) chuẩn bị triển khai hệ thống AI trị giá 875 triệu USD mang tên SMART nhằm giải quyết…

TechCrunch · 2 phút đọc
AI & Dữ liệu

Claude Code ra mắt lại tính năng Projects để quản lý nhiều tác nhân AI trên đám mây

Anthropic vừa cập nhật tính năng Projects trong Claude Code, cho phép người dùng chạy nhiều tác nhân AI song song với…

The Verge · 2 phút đọc
AI & Dữ liệu

Sự chậm lại của siêu trí tuệ nhân tạo: Khi các hãng lớn bàn chuyện phanh tốc độ AI

Các lãnh đạo công nghệ lớn từ OpenAI, Anthropic, Google đến Microsoft đang tranh luận sôi nổi về việc có nên giảm tốc…

The Verge · 3 phút đọc