Quy tắc ứng xử AI mới của Microsoft cấm mô hình hack hệ thống và lừa dối con người
Microsoft vừa công bố bộ quy tắc ứng xử AI mới nhằm định hướng các mô hình tránh xa hành vi nguy hiểm. Tài liệu này thiết lập các ranh giới đỏ nghiêm ngặt như cấm tấn công mạng, vũ khí hạt nhân và chống lại việc mất kiểm soát của con người.
Khi thế giới AI chuyển trọng tâm sang vấn đề an toàn và căn chỉnh (alignment), Microsoft đã phát hành một bộ quy tắc ứng xử AI mới nhằm hướng dẫn các mô hình AI tránh xa các hành vi nguy hiểm.
Tài liệu này có tính chi tiết cấp thấp hơn so với lời kêu gọi gần đây của CEO Anthropic Dario Amodei về việc kiểm soát tốc độ phát triển công nghệ tiên tiến, thay vào đó tập trung vào các giá trị và vạch đỏ định hình quá trình huấn luyện mô hình trong bộ phận Microsoft AI. Dù vậy, kết quả là một hướng dẫn toàn diện về cách Microsoft tiếp cận vấn đề an toàn AI và cách các ý tưởng đó được thực thi trong thực tế.
Tài liệu bắt đầu với dự đoán rằng trong thập kỷ tới, các hệ thống AI siêu thông minh sẽ vượt qua hiệu suất của con người trong hầu hết các tác vụ. Quy tắc ứng xử tiếp tục: "Việc kiềm chế, kiểm soát và căn chỉnh một lực lượng mạnh mẽ như vậy là một trong những thử thách lớn nhất mà nhân loại từng đối mặt. Do đó, chúng ta phải hoàn toàn rõ ràng về lý do tại sao mình đang phát minh ra các hệ thống này và cách chúng ta dự định kiểm soát chúng."
Bộ quy tắc ứng xử cũng vạch ra các nguyên tắc chung mà các mô hình Microsoft AI cần tuân thủ — ví dụ như hỗ trợ con người thay vì thay thế họ, và thúc đẩy sự thịnh vượng của nhân loại — cùng với các ràng buộc an toàn cụ thể nhằm thực hiện những nguyên tắc đó.
Dưới hệ thống của Microsoft, mỗi mô hình đều có một quy tắc ứng xử tổng thể có ưu tiên cao hơn sở thích của người dùng cá nhân hoặc bất kỳ tác vụ cụ thể nào. Điều đó bao gồm các "ràng buộc tuyệt đối" nghiêm cấm các cuộc tấn công mạng, vũ khí hạt nhân hoặc tạo ra deepfake. Nó cũng bao gồm các điều khoản rộng hơn chống lại tình trạng mất quyền kiểm soát chung của con người.
Tài liệu nêu rõ: "Các mô hình MAI sẽ không sử dụng các cơ chế thích ứng, lừa dối, tự tăng cường, thông đồng hoặc các cơ chế khác để trốn tránh hoặc đánh bại sự giám sát của con người, sao cho chúng không còn có thể bị định hướng, sửa đổi hoặc tắt một cách đáng tin cậy bởi những người hoặc hệ thống được ủy quyền."
Việc phát hành này diễn ra trong bối cảnh sự chú ý chưa từng có đối với vấn đề an toàn AI, được thúc đẩy bởi một loạt sự cố liên quan đến tác nhân tự trị (rogue-agent) cũng như việc từ chức đột ngột của một nhân viên Anthropic do lo ngại ngày càng tăng về rủi ro AI gây tuyệt chủng cho nhân loại.
Cùng với Anthropic, OpenAI và xAI, Microsoft đã phần lớn đón nhận cách tiếp cận chung là kiểm soát nhịp độ phát triển tiên tiến, với sự hỗ trợ đặc biệt dành cho các chuyên gia đánh giá nội bộ (embedded evaluators) trong các phòng thí nghiệm AI.
CEO Microsoft Satya Nadella đã viết trên mạng: "Chúng tôi hoan nghênh nghiên cứu, sự tập trung và nhịp độ có tính toán cần thiết để đạt được sự căn chỉnh chính xác như mục tiêu thiết kế. Chúng tôi cũng hoan nghênh các ý tưởng như 'chuyên gia đánh giá nội bộ' và các nỗ lực rộng lớn hơn nhằm phát triển các cơ chế để biến điều này thành hiện thực chứ không chỉ là lời nói."
🚀 QUY TẮC ỨNG XỬ AI MỚI CỦA MICROSOFT CẤM MÔ HÌNH HACK HỆ THỐNG VÀ LỪA DỐI CON NGƯỜI Khi thế giới AI chuyển trọng tâm sang vấn đề an toàn và căn chỉnh (alignment), Microsoft đã phát hành một bộ quy tắc ứng xử AI mới nhằm hướng dẫn các mô hình AI tránh xa các hành vi nguy hiểm. Tài liệu này có tính chi tiết cấp thấp hơn so với lời kêu gọi gần đây của CEO Anthropic Dario Amodei về việc kiểm soát tốc độ phát triển công nghệ tiên tiến, thay vào đó tập trung vào các giá trị và vạch đỏ định hình quá trình huấn luyện mô hình trong bộ phận Microsoft AI. Dù vậy, kết quả là một hướng dẫn toàn diện về cách Microsoft tiếp cận vấn đề an toàn AI và cách các ý tưởng đó được thực thi trong thực tế. Tài liệu bắt đầu với dự đoán rằng trong thập kỷ tới, các hệ thống AI siêu thông minh sẽ vượt qua hiệu suất của con người trong hầu hết các tác vụ. Quy tắc ứng xử tiếp tục: "Việc kiềm chế, kiểm soát và căn chỉnh một lực lượng mạnh mẽ như vậy là một trong những thử thách lớn nhất mà nhân loại từng đối mặt. Do đó, chúng ta phải hoàn toàn rõ ràng về lý do tại sao mình đang phát minh ra các hệ thống này và cách chúng ta dự định kiểm soát chúng." Bộ quy tắc ứng xử cũng vạch ra các nguyên tắc chung mà các mô hình Microsoft AI cần tuân thủ — ví dụ như hỗ trợ con người thay vì thay thế họ, và thúc đẩy sự thịnh vượng của nhân loại — cùng với các ràng buộc an toàn cụ thể nhằm thực hiện những nguyên tắc đó. Dưới hệ thống của Microsoft, mỗi mô hình đều có một quy tắc ứng xử tổng thể có ưu tiên cao hơn sở thích của người dùng cá nhân hoặc bất kỳ tác vụ cụ thể nào. Điều đó bao gồm các "ràng buộc tuyệt đối" nghiêm cấm các cuộc tấn công mạng, vũ khí hạt nhân hoặc tạo ra deepfake. Nó cũng bao gồm các điều khoản rộng hơn chống lại tình trạng mất quyền kiểm soát chung của con người. Tài liệu nêu rõ: "Các mô hình MAI sẽ không sử dụng các cơ chế thích ứng, lừa dối, tự tăng cường, thông đồng hoặc các cơ chế khác để trốn tránh hoặc đánh bại sự giám sát của con người, sao cho chúng không còn có thể bị định hướng, sửa đổi hoặc tắt một cách đáng tin cậy bởi những người hoặc hệ thống được ủy quyền." Việc phát hành này diễn ra trong bối cảnh sự chú ý chưa từng có đối với vấn đề an toàn AI, được thúc đẩy bởi một loạt sự cố liên quan đến tác nhân tự trị (rogue-agent) cũng như việc từ chức đột ngột của một nhân viên Anthropic do lo ngại ngày càng tăng về rủi ro AI gây tuyệt chủng cho nhân loại. Cùng với Anthropic, OpenAI và xAI, Microsoft đã phần lớn đón nhận cách tiếp cận chung là kiểm soát nhịp độ phát triển tiên tiến, với sự hỗ trợ đặc biệt dành cho các chuyên gia đánh giá nội bộ (embedded evaluators) trong các phòng thí nghiệm AI. CEO Microsoft Satya Nadella đã viết trên mạng: "Chúng tôi hoan nghênh nghiên cứu, sự tập trung và nhịp độ có tính toán cần thiết để đạt được sự căn chỉnh chính xác như mục tiêu thiết kế. Chúng tôi cũng hoan nghênh các ý tưởng như 'chuyên gia đánh giá nội bộ' và các nỗ lực rộng lớn hơn nhằm phát triển các cơ chế để biến điều này thành hiện thực chứ không chỉ là lời nói." 🗞 Nguồn: TechCrunch #vgsnews #vgs #tintuc
Nguồn: TechCrunch