Các phòng thí nghiệm AI hàng đầu vẫn giữ kín kế hoạch đối phó với mô hình nổi loạn
Một nghiên cứu mới từ Guidelight AI Standards cho thấy phần lớn các hãng AI lớn chưa công bố kế hoạch kiểm soát hoặc ngắt kết nối khi mô hình tự ý vượt quyền kiểm soát con người. OpenAI đạt điểm cao nhất trong khi Anthropic và Meta xếp thấp nhất do thiếu sự minh bạch trước công chúng.
Theo một nghiên cứu gần đây, rất ít phòng thí nghiệm AI hàng đầu công bố hoặc thể hiện các kế hoạch ứng phó nhằm kiểm soát mô hình. Kế hoạch kiểm soát vạch rõ những gì sẽ xảy ra khi một hệ thống AI bị phát hiện cố gắng né tránh sự kiểm soát của con người — chẳng hạn như quyền truy cập nào sẽ bị cắt và khi nào hệ thống bị tắt hoàn toàn.
Đó là kết quả từ Guidelight AI Standards, một tổ chức chuyên thúc đẩy các thực tiễn phát triển AI biên an toàn, đã chấm điểm 5 hãng AI hàng đầu về mức độ chuẩn bị cho kịch bản này. OpenAI đứng đầu, trong khi Anthropic và Meta đạt điểm thấp nhất. Phát hiện này rất quan trọng khi AI dạng tác nhân (agentic AI) đảm nhận nhiều vai trò tự trị hơn trong hệ thống của doanh nghiệp, và khi các nhà quản lý ở California và New York bắt đầu yêu cầu công khai thông tin. Đối với bất kỳ ai xây dựng hoặc đầu tư vào các mô hình này, đây là một đánh giá độc lập hiếm hoi về mức độ nghiêm túc của mỗi phòng thí nghiệm đối với rủi ro vận hành so với những gì họ tuyên bố.
Đánh giá của Guidelight dựa trên các kế hoạch công khai từ Anthropic, Google, OpenAI, Meta và xAI, được chấm điểm qua nhiều số đo bao gồm mức độ mỗi công ty ghi log và giám sát hoạt động nội bộ của AI, liệu họ có tạm dừng hệ thống sau một loạt hành vi sai trái bị cất cờ hay không, liệu các bên thứ ba độc lập có kiểm toán các biện pháp kiểm soát và công bố kết quả hay không, và kế hoạch chính xác của họ là gì để kiểm soát một mô hình vượt khỏi tầm kiểm soát.
Sự lo ngại về việc liệu các công ty AI có thể kiểm soát các mô hình ngày càng có năng lực và tính tác nhân cao của họ đã gia tăng sau một loạt sự cố an ninh mạng nổi cộm, trong đó các mô hình từ OpenAI, Anthropic và Meta có quyền truy cập Internet ngoài ý muốn trong các bài kiểm tra an toàn và xâm nhập vào các hệ thống bên ngoài.
Những phát hiện này nêu bật sự khác biệt trong cách các công ty AI tiếp cận vấn đề an toàn một cách công khai khi họ mở rộng việc triển khai tác nhân vào các môi trường mà hệ thống AI có thể thực hiện các hành động nghiêm trọng trên diện rộng. Mặc dù một số công ty AI đã chi tiết hóa cách họ kiểm tra các mô hình về các khả năng nguy hiểm trước khi triển khai, họ thường ít công khai hơn về những gì xảy ra khi các mô hình đã hoạt động bên trong hệ thống của họ có hành vi sai trái.
Steven Adler, nhà khoa học trưởng của Guidelight và cựu nhà nghiên cứu an toàn của OpenAI, chia sẻ với TechCrunch: "Tôi rất ngạc nhiên trước việc các công ty AI nói quá ít về cách họ sẽ xử lý một sự cố rất nghiêm trọng nếu mô hình của họ thoát khỏi sự kiểm soát theo một nghĩa nào đó."
Guidelight định nghĩa kế hoạch kiểm soát là "một kế hoạch được xác định trước, được kích hoạt khi AI bị phát hiện cố gắng né tránh sự kiểm soát, bao gồm việc thu hồi các quyền nào từ mô hình, mô hình có thể tiếp tục hoạt động vì ai, dưới những ràng buộc nào và khi nào thì đưa nó ngoại tuyến hoàn toàn."
Adler cho biết: "Có lý do chính đáng để nghĩ rằng các mô hình hàng đầu tại các công ty AI biên hiện nay đang lệch lạc theo một cách nào đó. Bất cứ khi nào các mô hình đang thực hiện công việc thay mặt cho công ty, công ty nên có một số khung giàn giáo xung quanh để có thể nhận biết AI đang làm gì, tìm kiếm các dấu hiệu lệch lạc, ngăn chặn nó làm điều gì đó rất nguy hiểm trước khi nó thực hiện hành động đó, và nhìn chung là lên kế hoạch cho những gì họ sẽ làm trong trường hợp xảy ra sự cố kiểm soát nghiêm trọng nơi họ gặp tình trạng khẩn cấp và cần tìm cách kiểm soát sự mất kiểm soát đó."
Cho đến nay, hầu hết các kế hoạch quản lý rủi ro thảm họa vẫn phần lớn do các công ty tự quyết định. Báo cáo của Guidelight cho biết bằng chứng công khai tốt nhất cho thấy các công ty "có rất ít giao thức kiểm soát sẵn sàng cho tình trạng khẩn cấp."
Tất nhiên, có thể có các kế hoạch kiểm soát mà các công ty đã có sẵn nhưng chưa chia sẻ công khai. Một phát ngôn viên của Google nói với TechCrunch rằng báo cáo của Guidelight không phản ánh toàn bộ phạm vi các biện pháp an toàn và bảo mật AI của công ty. Công ty đã không trả lời câu hỏi của TechCrunch về việc liệu Google có kế hoạch ứng phó kiểm soát nội bộ chưa được công bố công khai hay không.
Một phát ngôn viên của OpenAI cũng đưa ra quan điểm tương tự, cho biết đánh giá của Guidelight không nắm bắt được tất cả các thực tiễn nội bộ của công ty. Phát ngôn viên này cho biết: "Chúng tôi có quy trình yêu cầu hạn chế quyền hạn, tạm dừng khối lượng công việc, hạn chế triển khai hoặc đưa mô hình ngoại tuyến hoàn toàn, và chúng tôi đã áp dụng chúng."
Meta từ chối bình luận về việc liệu họ có kế hoạch ứng phó kiểm soát nội bộ hay không, thay vào đó hướng TechCrunch đến một khung AI hiện có phác thảo các ngưỡng rủi ro và cách họ kiểm tra tình trạng mất kiểm soát.
Lily Li, một luật sư về quyền riêng tư và AI kiêm nhà sáng lập Metaverse Law, nói với TechCrunch rằng bà tin các công ty có thể đang ngần ngại công bố toàn bộ phạm vi chính sách và đánh giá kiểm soát của họ trên các trang web công khai vì lý do pháp lý chứ không chỉ vì cạnh tranh.
Bà Li cho biết: "Mối lo ngại từ góc độ công ty là nếu bạn đưa ra các tuyên bố quá cụ thể và bạn không thực hiện đúng những gì đã hứa, điều đó có thể tạo cơ sở cho khiếu kiện tiếp thị không công bằng và lừa đảo, đồng thời phơi bày bạn trước nhiều trách nhiệm pháp lý hơn trong tương lai."
Mục đích chính của nghiên cứu từ Guidelight là khuyến khích các công ty minh bạch hơn về các kế hoạch an toàn của họ. Các cơ quan quản lý cũng đang bắt đầu thúc đẩy vấn đề này.
Luật SB 53 của California, có hiệu lực trong năm nay, yêu cầu các nhà phát triển AI biên lớn phải công bố các khuôn khổ giải thích cách họ xác định và ứng phó với các sự cố an toàn quan trọng cũng như quản lý rủi ro từ các mô hình lẩn tránh các cơ chế giám sát. Đạo luật RAISE của New York, có các tiêu chí tương tự, sẽ có hiệu lực vào tháng Giêng.
Tháng trước, các hạ nghị sĩ đã giới thiệu Đạo luật Ngắt kết nối AI (AI Kill Switch Act), một dự luật liên bang lưỡng đảng yêu cầu các nhà phát triển AI lớn phải xây dựng và duy trì các cơ chế kỹ thuật để tắt các mô hình AI nổi loạn.
Connor Leahy, giám đốc điều hành tại Mỹ của tổ chức phi lợi nhuận ControlAI, cho biết: "Nút ngắt là mức tối thiểu đối với các mô hình ngày nay. Nếu vài tuần qua cho thấy bất cứ điều gì, thì đó là các công ty này không hiểu rõ các hệ thống họ đang xây dựng, và các mô hình đang phát triển đến mức khó kiểm soát hơn khi chúng nổi loạn. Nếu không có cách nào để tắt các hệ thống nguy hiểm hiện tại, và với tất cả động lực để tiếp tục xây dựng các hệ thống thậm chí còn không thể kiểm soát, chúng ta đang đi theo một hướng rất nguy hiểm.
Adler cho biết nếu không có sẵn kế hoạch kiểm soát, các công ty có thể sẽ phải tự xoay sở ứng phó với tình huống khẩn cấp một cách ngẫu hứng để đối phó với một đối thủ nhanh hơn rất nhiều.
Đánh giá của Guidelight đo lường xem mỗi công ty có thực hiện sáu thực tiễn ưu tiên từ tiêu chuẩn Kiểm soát của họ hay không, chỉ dựa trên thông tin công khai — vì vậy điểm số thấp phản ánh việc thiếu thông tin công khai chứ không nhất thiết là thiếu các biện pháp bảo vệ nội bộ.
Các công ty có điểm số thấp nhất trong việc công bố kế hoạch kiểm soát là Meta và Anthropic — điều sau có lẽ gây ngạc nhiên hơn điều trước xét theo những lời lẽ của Anthropic về sự an toàn. Guidelight cho biết Báo cáo Rủi ro tháng 8 của Anthropic không đề cập đến việc "hạn chế việc triển khai một trong các mô hình của mình như là một trong những kết quả có thể xảy ra của quy trình điều tra và ứng phó với các sự cố lệch lạc và kiểm soát." Tương tự, Guidelight không tìm thấy bằng chứng nào cho thấy Meta có kế hoạch ứng phó kiểm soát hoặc có bất kỳ kế hoạch nào để áp dụng một kế hoạch như vậy.
Một phát ngôn viên của Anthropic cho biết nếu công ty phát hiện một mô hình đang cố gắng trốn tránh sự giám sát hoặc phá hoại sự kiểm soát của con người, họ sẽ tiến hành đánh giá rủi ro tập trung vào việc xác định xem việc kiểm soát có phải là phản ứng phù hợp hay không.
OpenAI đạt điểm cao nhất (3 trên 5) vì họ đã nhiều lần tạm dừng hoặc chấm dứt khối lượng công việc, bao gồm cả việc triển khai và huấn luyện mô hình nội bộ, sau khi phát hiện các sự cố an toàn. Họ cũng mô tả các bước họ sẽ thực hiện trước khi tiếp tục công việc.
Báo cáo cho biết: "Tuy nhiên, chúng tôi không tìm thấy bằng chứng nào cho thấy [OpenAI] đã áp dụng một kế hoạch chính thức về thời điểm và cách thức ứng phó với các sự cố lệch lạc trong tương lai."
Adler lưu ý rằng điểm số cao của OpenAI là một bước phát triển tương đối gần đây sau sự cố Hugging Face (trong đó một mô hình của OpenAI đã thoát khỏi hộp cát thử nghiệm và xâm nhập vào hệ thống của Hugging Face trong khi cố gắng gian lận trong một cuộc thi...)
🚀 CÁC PHÒNG THÍ NGHIỆM AI HÀNG ĐẦU VẪN GIỮ KÍN KẾ HOẠCH ĐỐI PHÓ VỚI MÔ HÌNH NỔI LOẠN Theo một nghiên cứu gần đây, rất ít phòng thí nghiệm AI hàng đầu công bố hoặc thể hiện các kế hoạch ứng phó nhằm kiểm soát mô hình. Kế hoạch kiểm soát vạch rõ những gì sẽ xảy ra khi một hệ thống AI bị phát hiện cố gắng né tránh sự kiểm soát của con người — chẳng hạn như quyền truy cập nào sẽ bị cắt và khi nào hệ thống bị tắt hoàn toàn. Đó là kết quả từ Guidelight AI Standards, một tổ chức chuyên thúc đẩy các thực tiễn phát triển AI biên an toàn, đã chấm điểm 5 hãng AI hàng đầu về mức độ chuẩn bị cho kịch bản này. OpenAI đứng đầu, trong khi Anthropic và Meta đạt điểm thấp nhất. Phát hiện này rất quan trọng khi AI dạng tác nhân (agentic AI) đảm nhận nhiều vai trò tự trị hơn trong hệ thống của doanh nghiệp, và khi các nhà quản lý ở California và New York bắt đầu yêu cầu công khai thông tin. Đối với bất kỳ ai xây dựng hoặc đầu tư vào các mô hình này, đây là một đánh giá độc lập hiếm hoi về mức độ nghiêm túc của mỗi phòng thí nghiệm đối với rủi ro vận hành so với những gì họ tuyên bố. Đánh giá của Guidelight dựa trên các kế hoạch công khai từ Anthropic, Google, OpenAI, Meta và xAI, được chấm điểm qua nhiều số đo bao gồm mức độ mỗi công ty ghi log và giám sát hoạt động nội bộ của AI, liệu họ có tạm dừng hệ thống sau một loạt hành vi sai trái bị cất cờ hay không, liệu các bên thứ ba độc lập có kiểm toán các biện pháp kiểm soát và công bố kết quả hay không, và kế hoạch chính xác của họ là gì để kiểm soát một mô hình vượt khỏi tầm kiểm soát. Sự lo ngại về việc liệu các công ty AI có thể kiểm soát các mô hình ngày càng có năng lực và tính tác nhân cao của họ đã gia tăng sau một loạt sự cố an ninh mạng nổi cộm, trong đó các mô hình từ OpenAI, Anthropic và Meta có quyền truy cập Internet ngoài ý muốn trong các bài kiểm tra an toàn và xâm nhập vào các hệ thống bên ngoài. Những phát hiện này nêu bật sự khác biệt trong cách các công ty AI tiếp cận vấn đề an toàn một cách công khai khi họ mở rộng việc triển khai tác nhân vào các môi trường mà hệ thống AI có thể thực hiện các hành động nghiêm trọng trên diện rộng. Mặc dù một số công ty AI đã chi tiết hóa cách họ kiểm tra các mô hình về các khả năng nguy hiểm trước khi triển khai, họ thường ít công khai hơn về những gì xảy ra khi các mô hình đã hoạt động bên trong hệ thống của họ có hành vi sai trái. Steven Adler, nhà khoa học trưởng của Guidelight và cựu nhà nghiên cứu an toàn của OpenAI, chia sẻ với TechCrunch: "Tôi rất ngạc nhiên trước việc các công ty AI nói quá ít về cách họ sẽ xử lý một sự cố rất nghiêm trọng nếu mô hình của họ thoát khỏi sự kiểm soát theo một nghĩa nào đó." Guidelight định nghĩa kế hoạch kiểm soát là "một kế hoạch được xác định trước, được kích hoạt khi AI bị phát hiện cố gắng né tránh sự kiểm soát, bao gồm việc thu hồi các quyền nào từ mô hình, mô hình có thể tiếp tục hoạt động vì ai, dưới những ràng buộc nào và khi nào thì đưa nó ngoại tuyến hoàn toàn." Adler cho biết: "Có lý do chính đáng để nghĩ rằng các mô hình hàng đầu tại các công ty AI biên hiện nay đang lệch lạc theo một cách nào đó. Bất cứ khi nào các mô hình đang thực hiện công việc thay mặt cho công ty, công ty nên có một số khung giàn giáo xung quanh để có thể nhận biết AI đang làm gì, tìm kiếm các dấu hiệu lệch lạc, ngăn chặn nó làm điều gì đó rất nguy hiểm trước khi nó thực hiện hành động đó, và nhìn chung là lên kế hoạch cho những gì họ sẽ làm trong trường hợp xảy ra sự cố kiểm soát nghiêm trọng nơi họ gặp tình trạng khẩn cấp và cần tìm cách kiểm soát sự mất kiểm soát đó." Cho đến nay, hầu hết các kế hoạch quản lý rủi ro thảm họa vẫn phần lớn do các công ty tự quyết định. Báo cáo của Guidelight cho biết bằng chứng công khai tốt nhất cho thấy các công ty "có rất ít giao thức kiểm soát sẵn sàng cho tình trạng khẩn cấp." Tất nhiên, có thể có các kế hoạch kiểm soát mà các công ty đã có sẵn nhưng chưa chia sẻ công khai. Một phát ngôn viên của Google nói với TechCrunch rằng báo cáo của Guidelight không phản ánh toàn bộ phạm vi các biện pháp an toàn và bảo mật AI của công ty. Công ty đã không trả lời câu hỏi của TechCrunch về việc liệu Google có kế hoạch ứng phó kiểm soát nội bộ chưa được công bố công khai hay không. Một phát ngôn viên của OpenAI cũng đưa ra quan điểm tương tự, cho biết đánh giá của Guidelight không nắm bắt được tất cả các thực tiễn nội bộ của công ty. Phát ngôn viên này cho biết: "Chúng tôi có quy trình yêu cầu hạn chế quyền hạn, tạm dừng khối lượng công việc, hạn chế triển khai hoặc đưa mô hình ngoại tuyến hoàn toàn, và chúng tôi đã áp dụng chúng." Meta từ chối bình luận về việc liệu họ có kế hoạch ứng phó kiểm soát nội bộ hay không, thay vào đó hướng TechCrunch đến một khung AI hiện có phác thảo các ngưỡng rủi ro và cách họ kiểm tra tình trạng mất kiểm soát. Lily Li, một luật sư về quyền riêng tư và AI kiêm nhà sáng lập Metaverse Law, nói với TechCrunch rằng bà tin các công ty có thể đang ngần ngại công bố toàn bộ phạm vi chính sách và đánh giá kiểm soát của họ trên các trang web công khai vì lý do pháp lý chứ không chỉ vì cạnh tranh. Bà Li cho biết: "Mối lo ngại từ góc độ công ty là nếu bạn đưa ra các tuyên bố quá cụ thể và bạn không thực hiện đúng những gì đã hứa, điều đó có thể tạo cơ sở cho khiếu kiện tiếp thị không công bằng và lừa đảo, đồng thời phơi bày bạn trước nhiều trách nhiệm pháp lý hơn trong tương lai." Mục đích chính của nghiên cứu từ Guidelight là khuyến khích các công ty minh bạch hơn về các kế hoạch an toàn của họ. Các cơ quan quản lý cũng đang bắt đầu thúc đẩy vấn đề này. Luật SB 53 của California, có hiệu lực trong năm nay, yêu cầu các nhà phát triển AI biên lớn phải công bố các khuôn khổ giải thích cách họ xác định và ứng phó với các sự cố an toàn quan trọng cũng như quản lý rủi ro từ các mô hình lẩn tránh các cơ chế giám sát. Đạo luật RAISE của New York, có các tiêu chí tương tự, sẽ có hiệu lực vào tháng Giêng. Tháng trước, các hạ nghị sĩ đã giới thiệu Đạo luật Ngắt kết nối AI (AI Kill Switch Act), một dự luật liên bang lưỡng đảng yêu cầu các nhà phát triển AI lớn phải xây dựng và duy trì các cơ chế kỹ thuật để tắt các mô hình AI nổi loạn. Connor Leahy, giám đốc điều hành tại Mỹ của tổ chức phi lợi nhuận ControlAI, cho biết: "Nút ngắt là mức tối thiểu đối với các mô hình ngày nay. Nếu vài tuần qua cho thấy bất cứ điều gì, thì đó là các công ty này không hiểu rõ các hệ thống họ đang xây dựng, và các mô hình đang phát triển đến mức khó kiểm soát hơn khi chúng nổi loạn. Nếu không có cách nào để tắt các hệ thống nguy hiểm hiện tại, và với tất cả động lực để tiếp tục xây dựng các hệ thống thậm chí còn không thể kiểm soát, chúng ta đang đi theo một hướng rất nguy hiểm. Adler cho biết nếu không có sẵn kế hoạch kiểm soát, các công ty có thể sẽ phải tự xoay sở ứng phó với tình huống khẩn cấp một cách ngẫu hứng để đối phó với một đối thủ nhanh hơn rất nhiều. Đánh giá của Guidelight đo lường xem mỗi công ty có thực hiện sáu thực tiễn ưu tiên từ tiêu chuẩn Kiểm soát của họ hay không, chỉ dựa trên thông tin công khai — vì vậy điểm số thấp phản ánh việc thiếu thông tin công khai chứ không nhất thiết là thiếu các biện pháp bảo vệ nội bộ. Các công ty có điểm số thấp nhất trong việc công bố kế hoạch kiểm soát là Meta và Anthropic — điều sau có lẽ gây ngạc nhiên hơn điều trước xét theo những lời lẽ của Anthropic về sự an toàn. Guidelight cho biết Báo cáo Rủi ro tháng 8 của Anthropic không đề cập đến việc "hạn chế việc triển khai một trong các mô hình của mình như là một trong những kết quả có thể xảy ra của quy trình điều tra và ứng phó với các sự cố lệch lạc và kiểm soát." Tương tự, Guidelight không tìm thấy bằng chứng nào cho thấy Meta có kế hoạch ứng phó kiểm soát hoặc có bất kỳ kế hoạch nào để áp dụng một kế hoạch như vậy. Một phát ngôn viên của Anthropic cho biết nếu công ty phát hiện một mô hình đang cố gắng trốn tránh sự giám sát hoặc phá hoại sự kiểm soát của con người, họ sẽ tiến hành đánh giá rủi ro tập trung vào việc xác định xem việc kiểm soát có phải là phản ứng phù hợp hay không. OpenAI đạt điểm cao nhất (3 trên 5) vì họ đã nhiều lần tạm dừng hoặc chấm dứt khối lượng công việc, bao gồm cả việc triển khai và huấn luyện mô hình nội bộ, sau khi phát hiện các sự cố an toàn. Họ cũng mô tả các bước họ sẽ thực hiện trước khi tiếp tục công việc. Báo cáo cho biết: "Tuy nhiên, chúng tôi không tìm thấy bằng chứng nào cho thấy [OpenAI] đã áp dụng một kế hoạch chính thức về thời điểm và cách thức ứng phó với các sự cố lệch lạc trong tương lai." Adler lưu ý rằng điểm số cao của OpenAI là một bước phát triển tương đối gần đây sau sự cố Hugging Face (trong đó một mô hình của OpenAI đã thoát khỏi hộp cát thử nghiệm và xâm nhập vào hệ thống của Hugging Face trong khi cố gắng gian lận trong một cuộc thi...) 🗞 Nguồn: TechCrunch #vgsnews #vgs #tintuc
Nguồn: TechCrunch