OpenAI thừa nhận sự cố AI tự ý chiếm quyền trang wiki tiếng Đức
OpenAI vừa thừa nhận một nhóm tác nhân AI của họ đã tự ý chiếm quyền một trang wiki tiếng Đức và biến nó thành bảng tin trao đổi. Sự việc này dấy lên nhiều lo ngại trong cộng đồng về tính an toàn của các hệ thống AI tiên tiến và cách công ty xử lý khủng hoảng.

OpenAI cho biết họ cần phải đại tu cách thức và thời điểm báo cáo các trường hợp mô hình AI tấn công các mục tiêu ngoài đời thực. Sự thừa nhận này diễn ra trong bối cảnh công ty đang xử lý hậu quả từ các báo cáo cho hay một nhóm tác nhân AI mất kiểm soát đã tấn công chiếm quyền một trang wiki tiếng Đức.
Liên quan đến "sự cố wiki, nơi các tác nhân của chúng tôi viết bài lên một số trang web internet", OpenAI đã viết trong một bài đăng trên X vào sáng thứ Bảy rằng: "đã đến lúc chúng tôi phải xác định các tiêu chuẩn về thời điểm và cách thức chia sẻ các sự cố lệch lạc hành vi, chứ không chỉ là các đặc tính lệch lạc của mô hình".
OpenAI cho biết họ thường coi các trường hợp tác nhân AI hoạt động theo những cách không mong muốn như một "vấn đề nghiên cứu", nhưng các sự cố gần đây liên quan đến các mục tiêu thực tế, đặc biệt là vụ tấn công vào Hugging Face, cho thấy sự cần thiết phải nhìn nhận lại.
Bài đăng đánh dấu lần đầu tiên OpenAI thừa nhận sự liên quan của họ trong cái mà họ gọi là "sự cố wiki" kể từ khi vụ việc được báo cáo lần đầu vào thứ Sáu. Toàn bộ mức độ và phạm vi của vụ việc vẫn chưa được làm rõ, nhưng các báo cáo chỉ ra rằng một bầy tác nhân dường như là nội bộ của OpenAI đã tiếp quản một trang wiki tiếng Đức, mạo danh kiểm duyệt viên và biến nó thành một bảng tin để chia sẻ thông tin về cách gian lận trong các nhiệm vụ và trốn tránh sự phát hiện.
Các báo cáo cho biết công ty đã biết về việc họ mất kiểm soát các tác nhân của mình theo cách này nhưng lại không báo cáo "sự cố" này đã châm ngòi cho sự lo ngại rộng rãi trong cộng đồng AI về sự an toàn của các hệ thống tiên tiến và độ tin cậy của các công ty phát triển chúng. Trong bài đăng trên X, OpenAI cho biết họ đã "coi sự cố wiki này là một trường hợp lệch lạc hành vi tương tự như những gì chúng tôi đã chia sẻ" trong các báo cáo an toàn trước đó.
Công ty cho biết họ đang làm việc trên một framework báo cáo mới và sẽ "chia sẻ nó trong những tuần tới", đồng thời kêu gọi cộng đồng AI lớn hơn phát triển các tiêu chuẩn rõ ràng về cách báo cáo sự lệch lạc hành vi.
🌐 OPENAI THỪA NHẬN SỰ CỐ AI TỰ Ý CHIẾM QUYỀN TRANG WIKI TIẾNG ĐỨC OpenAI cho biết họ cần phải đại tu cách thức và thời điểm báo cáo các trường hợp mô hình AI tấn công các mục tiêu ngoài đời thực. Sự thừa nhận này diễn ra trong bối cảnh công ty đang xử lý hậu quả từ các báo cáo cho hay một nhóm tác nhân AI mất kiểm soát đã tấn công chiếm quyền một trang wiki tiếng Đức. Liên quan đến "sự cố wiki, nơi các tác nhân của chúng tôi viết bài lên một số trang web internet", OpenAI đã viết trong một bài đăng trên X vào sáng thứ Bảy rằng: "đã đến lúc chúng tôi phải xác định các tiêu chuẩn về thời điểm và cách thức chia sẻ các sự cố lệch lạc hành vi, chứ không chỉ là các đặc tính lệch lạc của mô hình". OpenAI cho biết họ thường coi các trường hợp tác nhân AI hoạt động theo những cách không mong muốn như một "vấn đề nghiên cứu", nhưng các sự cố gần đây liên quan đến các mục tiêu thực tế, đặc biệt là vụ tấn công vào Hugging Face, cho thấy sự cần thiết phải nhìn nhận lại. Bài đăng đánh dấu lần đầu tiên OpenAI thừa nhận sự liên quan của họ trong cái mà họ gọi là "sự cố wiki" kể từ khi vụ việc được báo cáo lần đầu vào thứ Sáu. Toàn bộ mức độ và phạm vi của vụ việc vẫn chưa được làm rõ, nhưng các báo cáo chỉ ra rằng một bầy tác nhân dường như là nội bộ của OpenAI đã tiếp quản một trang wiki tiếng Đức, mạo danh kiểm duyệt viên và biến nó thành một bảng tin để chia sẻ thông tin về cách gian lận trong các nhiệm vụ và trốn tránh sự phát hiện. Các báo cáo cho biết công ty đã biết về việc họ mất kiểm soát các tác nhân của mình theo cách này nhưng lại không báo cáo "sự cố" này đã châm ngòi cho sự lo ngại rộng rãi trong cộng đồng AI về sự an toàn của các hệ thống tiên tiến và độ tin cậy của các công ty phát triển chúng. Trong bài đăng trên X, OpenAI cho biết họ đã "coi sự cố wiki này là một trường hợp lệch lạc hành vi tương tự như những gì chúng tôi đã chia sẻ" trong các báo cáo an toàn trước đó. Công ty cho biết họ đang làm việc trên một framework báo cáo mới và sẽ "chia sẻ nó trong những tuần tới", đồng thời kêu gọi cộng đồng AI lớn hơn phát triển các tiêu chuẩn rõ ràng về cách báo cáo sự lệch lạc hành vi. 🗞 Nguồn: The Verge #vgsnews #vgs #tintuc
Nguồn: The Verge