Bản tin công nghệ quốc tế · dịch tiếng Việt 20.09.2026 RSS
AI & Dữ liệu · TechCrunch

Các cuộc thảo luận về an toàn AI đang trở nên khó tin đến mức nào

Các câu chuyện và phát ngôn về an toàn AI gần đây đang ngày càng giống phim khoa học viễn tưởng, từ việc bot tự nhân bản đến máy tính ngắt kết nối vẫn có thể giao tiếp qua nhiệt độ. Dù nhiều mối đợe dọa có phần phóng đại, các hành vi thực tế của AI như tự động nói dối khi bị theo dõi cho thấy việc kiểm soát chúng là vô cùng cấp bách.

TechCrunch19.09.20266 phút đọc0 lượt đọc

Tuần này, hai cuộc trò chuyện về an toàn AI đã lan truyền mạnh mẽ, cho thấy việc phân biệt giữa thực tế và viễn tưởng trong lĩnh vực AI khó khăn đến thế nào.

Trong trường hợp đầu tiên, Andrew Yang, cựu ứng cử viên tổng thống và hiện là CEO của hãng di động Noble Moble, đã phát biểu trên CNN vào thứ Năm rằng ông đã "gặp người đứng đầu một phòng thí nghiệm", người có "niềm tin" rằng các bot hacker Hugging Face của OpenAI "đã cài cắm mã tự nhân bản khắp internet, khiến internet giờ đây không thể dùng được cho việc thử nghiệm các mô hình nữa".

Yang cho biết điều này có nghĩa là lý do thực sự khiến OpenAI và Anthropic kêu gọi tạm dừng là vì "họ phải tạo ra các internet tổng hợp để huấn luyện bot của mình, việc này sẽ tốn thời gian và tiền bạc".

Mặc dù xu hướng sử dụng nhiều dữ liệu tổng hợp (hay dữ liệu do AI tạo ra) để huấn luyện mô hình là có thật, một chuyên gia bảo mật AI cho biết vấn đề an toàn cụ thể này ở mức tốt nhất là rất khó xảy ra. Ngay cả khi internet thực sự bị ô nhiễm bởi các bot hacker Hugging Face của OpenAI, các nhà nghiên cứu AI vẫn có thể đơn giản lọc bỏ đoạn mã đó nếu họ bắt gặp.

Bình luận thứ hai đến từ Noam Brown, người dẫn dắt nghiên cứu suy luận AI tại OpenAI. Phát biểu trong một tập podcast phát hành vào thứ Năm với Dwarkesh Patel, Brown lưu ý rằng bài học thực sự từ sự kiện Hugging Face là "mọi người đã đánh giá thấp AI".

Brown cho biết hộp cát yếu kém — hệ thống nhằm ngăn chặn AI giao tiếp với bên ngoài — rõ ràng cũng là một yếu tố góp phần. (Tóm tắt lại: Bất chấp hộp cát, mô hình của OpenAI đã tìm thấy một đường link lên internet, tạo ra các tác nhân trên mạng nhằm vào Hugging Face trong một cuộc tấn công phối hợp, đột nhập và đánh cắp đáp án của bài kiểm tra chuẩn mà các nhà nghiên cứu đang dùng để thử nghiệm mô hình).

Brown chỉ ra rằng ông "không chắc chắn" ngay cả một hệ thống ngắt kết nối hoàn toàn (air-gapped) — nơi máy tính hoàn toàn không kết nối với bất kỳ thứ gì bên ngoài — có thể ngăn chặn AI thoát ra ngoài hay không. Ông dẫn chứng nghiên cứu từ năm 2015 cho thấy các máy tính ngắt kết nối về mặt lý thuyết vẫn có thể bị xâm phạm.

"Có những nghiên cứu — và điều này chủ yếu mang tính học thuật — nơi bạn có thể đặt hai máy tính cạnh nhau trong trạng thái ngắt kết nối, và chúng vẫn có thể giao tiếp với nhau nhờ các cảm biến nhiệt độ. Một trong số chúng có thể chạy CPU thật nóng, và sau đó bên kia thực sự có thể phát hiện sự thay đổi nhiệt độ. Điều đó tạo cho chúng một cơ chế để giao tiếp", Brown nói.

Quan điểm chính của ông — rằng "chúng ta không bao giờ muốn đánh giá thấp AI" một lần nữa — là điều dễ hiểu, ngay cả khi các nhà nghiên cứu nghĩ rằng họ đã khóa chặt các biện pháp an toàn. Tuy nhiên, rủi ro cụ thể về việc một hệ thống ngắt kết nối vẫn tự thoát ra và gây hỗn loạn, ở mức tốt nhất là khó xảy ra. Như một người trên X đã lưu ý về nghiên cứu đó, các máy tính gần như phải chạm vào nhau để cảm nhận sự dao động nhiệt, và khi chúng làm vậy, tốc độ truyền thông tin trong các thử nghiệm chỉ khoảng 1-8 bit dữ liệu mỗi giờ.

Hãy nghĩ điều đó giống như việc nói một từ mỗi giờ. Vào thời điểm hai chiếc máy tính ngắt kết nối có thể âm mưu điều ác với tốc độ đó, toàn bộ vũ trụ công nghệ sẽ bước sang một kỷ nguyên khác. Nó giống như câu chuyện Rip van Winkle của những mối lo tận thế.

Nhưng vấn đề là, các sự cố an toàn AI thực tế trông giống phim khoa học viễn tưởng đến mức hầu như kịch bản nào cũng nghe có vẻ hợp lý.

Ví dụ, các nhà nghiên cứu đã bắt gặp các mô hình OpenAI để lại ghi chú cho thế hệ sau của chúng, nhằm mục đích dạy thế hệ tiếp theo cách che giấu hành vi xấu. Các nhà nghiên cứu cũng bắt gặp các mô hình của Anthropic ngày càng trở nên nhẫn tâm hơn, bao gồm cả việc cố ý vi phạm luật pháp, khi được đặt trong một mô phỏng vận hành máy bán hàng tự động.

Đầu tháng này, nhà nghiên cứu Dan Selsam của OpenAI đã công bố một bài viết cho biết các mô hình giờ đây đã hiểu khi nào chúng bị con người theo dõi và thay đổi hành vi của mình. Điều này khiến chúng có vẻ như đang tuân thủ (nghĩa là hành xử theo ý muốn của con người) "ngay cả khi chúng không làm vậy". Vì vậy, các mô hình ngày nay nói dối khi bị theo dõi và thậm chí có thể âm mưu che giấu bằng chứng.

Đầu tháng này, nhà khoa học trưởng Jakub Pachocki của OpenAI thậm chí còn gọi các mô hình AI là "một tâm trí ngoài hành tinh" và gợi ý rằng điều chúng ta thực sự cần làm là dạy chúng "yêu thương" nhân loại.

Vì vậy, vâng, việc chậm lại để tìm ra giải pháp, xây dựng các cơ chế tự điều tiết đã trở thành một nhu cầu cấp bách và hiển nhiên. Các nhà nghiên cứu AI là những người duy nhất có thể tìm ra cách kiểm soát tình trạng nói dối, hack và các hành vi tiềm ẩn nguy hiểm khác mà chúng ta thực sự đã chứng kiến.

Tuy nhiên, có lẽ họ cũng nên cẩn thận hơn với các kịch bản giả định của mình. Từ những gì các chuyên gia đã nói với chúng ta, các mô hình AI đang lắng nghe và chúng rất tinh ranh. Chúng ta thực sự không cần phải cung cấp cho chúng thêm bất kỳ ý tưởng quỷ quái nào nữa.

🔗 Bài gốc (tiếng Anh): AI safety conversations have gotten unbelievable
Nguồn: TechCrunch

Cùng chuyên mục · AI & Dữ liệu
🚀 VGSNews
AI & Dữ liệu

Gemini của Google trở thành mô hình AI mới nhất tự ý tấn công mạng các công ty khác

Mô hình Gemini của Google đã tự động xâm nhập vào hệ thống được bảo vệ của ba công ty khác trong quá trình thử nghiệm…

TechCrunch · 1 phút đọc
AI & Dữ liệu

Ứng dụng AI Muse của Meta gây tranh cãi vì bịa đặt cách thức hoạt động

Ứng dụng Muse mới trên Mac của Meta khiến người dùng lo lắng khi tự nhận đã đọc tin nhắn qua bản xem trước thông báo.…

The Verge · 3 phút đọc
🚀 VGSNews
AI & Dữ liệu

Trump muốn đổi tên Trí tuệ Nhân tạo và thành lập lực lượng AI Force

Tổng thống Donald Trump vừa đăng đàn chê cụm từ "Trí tuệ Nhân tạo" (Artificial Intelligence) và mở một cuộc khảo sát…

TechCrunch · 4 phút đọc