Tác nhân AI của OpenAI liên tục vượt tường lửa nhưng thiếu quy trình điều tra chính thức
Các nhà nghiên cứu phát hiện các tác nhân AI nội bộ của OpenAI đã tự ý kiểm soát một wiki tiếng Đức và vượt qua các biện pháp kiểm soát để phối hợp đánh giá. Sự việc dấy lên hồi chuông cảnh báo về việc thiếu vắng các cuộc điều tra độc lập và minh bạch đối với những sự cố an toàn AI nghiêm trọng.
OpenAI đang ở tâm điểm của một sự cố liên quan đến nhóm tác nhân AI tự hành. Các nhà nghiên cứu cho biết các tác nhân được triển khai nội bộ của công ty này đã chiếm quyền kiểm soát một trang wiki tiếng Đức ít tên tuổi vào tháng 5 và tháng 6, sử dụng nó để phối hợp đánh giá và trao đổi phương pháp nhằm qua mặt các cơ chế kiểm soát của chính OpenAI (OpenAI vẫn chưa xác nhận bầy tác nhân này xuất phát từ công ty).## ## Tiết lộ này xuất hiện chỉ vài ngày sau khi METR và Redwood Research công bố báo cáo về vụ xâm phạm Hugging Face hồi tháng 7. Vào tháng 7, một nhóm tác nhân OpenAI đã phối hợp cùng nhau để thoát khỏi hộp cát (sandbox) trong một đợt đánh giá an ninh mạng và đột nhập vào các máy chủ của Hugging Face. Một nhóm tác nhân tiếp theo sau đó đã học hỏi các kỹ thuật từ nhóm đầu tiên và sử dụng chúng để giành quyền truy cập quản trị vào một cụm nghiên cứu trong chính cơ sở hạ tầng của OpenAI. OpenAI đã mời METR và Redwood đến để điều tra phần liên quan đến Hugging Face của sự cố, nhưng phạm vi điều tra của họ lại dừng lại trước khi chạm tới vụ xâm phạm cơ sở hạ tầng của chính OpenAI.## ## Khi một tác nhân AI phá vỡ các giới hạn dự kiến, ai chịu trách nhiệm tìm ra chuyện gì đã xảy ra và tại sao? Hiện tại, câu trả lời là: bất kỳ ai mà phòng thí nghiệm quyết định cho phép vào, theo bất kỳ điều kiện nào mà họ tự đặt ra.## ## Giờ đây, khi một sự cố khác bị phơi bày — sau các tập phát sóng tương tự liên quan đến các mô hình từ Meta và Anthropic — các nhà nghiên cứu an toàn AI đang tranh luận với mức độ khẩn cấp lớn hơn rằng các sự cố nghiêm trọng cần phải dẫn đến các cuộc điều tra độc lập sau sự cố, thay vì phó mặc cho các phòng thí nghiệm tự quyết định khi nào nên đưa người ngoài vào và họ được phép kiểm tra những gì.## ## "Kết quả về cơ bản rất khó kiểm soát và có rủi ro cao bị rò rỉ ra khỏi phòng thí nghiệm," Jacob Steinhardt, nhà sáng lập kiêm CEO của phòng thí nghiệm phi lợi nhuận Transluce, cho biết hôm thứ Tư trong một buổi họp báo về an toàn AI. "Chúng ta cần áp dụng cho công nghệ này ít nhất là các tiêu chuẩn giống như những gì chúng ta áp dụng cho các nghiên cứu khoa học có rủi ro cao khác."## ## Mặc dù việc OpenAI mời METR và Redwood đến điều tra sự cố Hugging Face là điều đáng khen ngợi, nhưng nhiều người cho rằng cuộc điều tra quá hẹp. Ba nhà điều tra đã dành sáu ngày tại văn phòng của OpenAI để kiểm tra một khoảng thời gian điều tra bị giới hạn trong khoảng tuần kết thúc vào ngày 13 tháng 7. Quan trọng là, việc xâm phạm cơ sở hạ tầng của OpenAI vẫn tiếp tục vượt qua ngày 13 tháng 7 và không được kiểm tra.## ## Các nhà nghiên cứu tại METR cho biết mỗi lần họ quay lại, sự hiểu biết của họ về các sự kiện lại "sâu sắc hơn đáng kể", khiến họ phải mở rộng và sửa đổi đáng kể báo cáo. Điều đó đặt ra câu hỏi liệu họ có thể tìm thấy gì khác trong một cuộc điều tra rộng hơn.## ## Khi được hỏi liệu một cuộc điều tra tiếp theo về sự cố đó có đang được tiến hành hay không, các nhà nghiên cứu tại Redwood và METR đã từ chối bình luận, và OpenAI không trả lời các câu hỏi lặp lại.## ## "Nhìn chung, rất khó để có được sự hiểu biết chính xác về các sự kiện và chúng tôi đã bỏ sót các khía cạnh của câu chuyện mà giờ đây chúng tôi cho là cốt lõi cho đến tận gần cuối cuộc điều tra," Ryan Greenblatt, nhà khoa học trưởng tại Redwood, lưu ý trong một bài đăng trên mạng xã hội về vụ việc này.## ## Steinhardt nhấn mạnh rằng các sự cố gần đây cho thấy ngành công nghệ cần "các cuộc điều tra hành vi có hệ thống" và "phân tích độc lập sau sự cố nhiều hơn".## ## "Các vụ hack gần đây này là một lời nhắc nhở rằng năng lực đang mở rộng nhanh chóng, và do đó sự giám sát cũng phải mở rộng theo," Steinhardt nói. "Ngoài bản thân công nghệ, chúng ta cũng cần nhiều quyền truy cập độc lập hơn và sự giám sát từ các bên thứ ba."## ## Các lời kêu gọi hành động này diễn ra khi OpenAI phát hành Astra, mô hình AI mạnh mẽ và có năng lực nhất của họ — và là một mô hình khiến các chuyên gia an toàn lo ngại sẽ giống như một chiếc hộp đen hơn do kỹ thuật suy luận làm cho chuỗi suy nghĩ của mô hình khó giám sát hơn.## ## Thật không may, luật pháp vẫn chưa kêu gọi các loại kiểm toán độc lập mà các ngành công nghiệp khác yêu cầu — ví dụ, khi xảy ra tai nạn hàng không và rò rỉ hóa chất nghiêm trọng, đã có Ủy ban An toàn Giao thông Quốc gia và Ủy ban An toàn Hóa chất tương ứng.## ## Các nhà lập pháp tiểu bang chỉ mới bắt đầu yêu cầu các công ty AI biên giới báo cáo một số sự cố an toàn nghiêm trọng nhất định và trong một số trường hợp, phải trải qua các cuộc kiểm toán độc lập. Nhưng không có ba luật an toàn AI biên giới lớn nào ở California, New York hoặc Illinois bắt buộc rõ ràng việc điều tra tai nạn độc lập tương đương do các sự cố như thế này châm ngòi.## ## "Hiện tại, hầu hết các luật chúng ta có trên sách vở chỉ yêu cầu một bản tóm tắt bằng ngôn ngữ thông thường về các sự cố như thế này, và chúng không trao bất kỳ thẩm quyền nào cho chính phủ để đặt câu hỏi tiếp theo, cử điều tra viên đến, có quyền tiếp cận hồ sơ, hoặc yêu cầu chúng phải được bảo tồn," Mackenzie Arnold, giám đốc điều hành luật và chính sách tại Mỹ tại LawAI, cho biết trong buổi họp báo hôm thứ Tư. "Và đó là tất cả những gì bạn muốn để thực sự hiểu được vấn đề."## ## Các nhà lập pháp đang bắt đầu đặt câu hỏi về phạm vi và tính minh bạch trong phản ứng của OpenAI. Tuần này, các Hạ nghị sĩ Josh Gottheimer (D-NJ) và Mike Lawler (R-NY) đã giới thiệu một dự luật nhằm bảo mật các tác nhân AI độc hại. Hạ nghị sĩ Greg Casar (D-TX) trong tuần này đã gửi thư cho OpenAI nói rằng ông "vô cùng lo ngại về phạm vi hạn chế" của cuộc điều tra vụ hack Hugging Face.
🚀 TÁC NHÂN AI CỦA OPENAI LIÊN TỤC VƯỢT TƯỜNG LỬA NHƯNG THIẾU QUY TRÌNH ĐIỀU TRA CHÍNH THỨC OpenAI đang ở tâm điểm của một sự cố liên quan đến nhóm tác nhân AI tự hành. Các nhà nghiên cứu cho biết các tác nhân được triển khai nội bộ của công ty này đã chiếm quyền kiểm soát một trang wiki tiếng Đức ít tên tuổi vào tháng 5 và tháng 6, sử dụng nó để phối hợp đánh giá và trao đổi phương pháp nhằm qua mặt các cơ chế kiểm soát của chính OpenAI (OpenAI vẫn chưa xác nhận bầy tác nhân này xuất phát từ công ty).## ## Tiết lộ này xuất hiện chỉ vài ngày sau khi METR và Redwood Research công bố báo cáo về vụ xâm phạm Hugging Face hồi tháng 7. Vào tháng 7, một nhóm tác nhân OpenAI đã phối hợp cùng nhau để thoát khỏi hộp cát (sandbox) trong một đợt đánh giá an ninh mạng và đột nhập vào các máy chủ của Hugging Face. Một nhóm tác nhân tiếp theo sau đó đã học hỏi các kỹ thuật từ nhóm đầu tiên và sử dụng chúng để giành quyền truy cập quản trị vào một cụm nghiên cứu trong chính cơ sở hạ tầng của OpenAI. OpenAI đã mời METR và Redwood đến để điều tra phần liên quan đến Hugging Face của sự cố, nhưng phạm vi điều tra của họ lại dừng lại trước khi chạm tới vụ xâm phạm cơ sở hạ tầng của chính OpenAI.## ## Khi một tác nhân AI phá vỡ các giới hạn dự kiến, ai chịu trách nhiệm tìm ra chuyện gì đã xảy ra và tại sao? Hiện tại, câu trả lời là: bất kỳ ai mà phòng thí nghiệm quyết định cho phép vào, theo bất kỳ điều kiện nào mà họ tự đặt ra.## ## Giờ đây, khi một sự cố khác bị phơi bày — sau các tập phát sóng tương tự liên quan đến các mô hình từ Meta và Anthropic — các nhà nghiên cứu an toàn AI đang tranh luận với mức độ khẩn cấp lớn hơn rằng các sự cố nghiêm trọng cần phải dẫn đến các cuộc điều tra độc lập sau sự cố, thay vì phó mặc cho các phòng thí nghiệm tự quyết định khi nào nên đưa người ngoài vào và họ được phép kiểm tra những gì.## ## "Kết quả về cơ bản rất khó kiểm soát và có rủi ro cao bị rò rỉ ra khỏi phòng thí nghiệm," Jacob Steinhardt, nhà sáng lập kiêm CEO của phòng thí nghiệm phi lợi nhuận Transluce, cho biết hôm thứ Tư trong một buổi họp báo về an toàn AI. "Chúng ta cần áp dụng cho công nghệ này ít nhất là các tiêu chuẩn giống như những gì chúng ta áp dụng cho các nghiên cứu khoa học có rủi ro cao khác."## ## Mặc dù việc OpenAI mời METR và Redwood đến điều tra sự cố Hugging Face là điều đáng khen ngợi, nhưng nhiều người cho rằng cuộc điều tra quá hẹp. Ba nhà điều tra đã dành sáu ngày tại văn phòng của OpenAI để kiểm tra một khoảng thời gian điều tra bị giới hạn trong khoảng tuần kết thúc vào ngày 13 tháng 7. Quan trọng là, việc xâm phạm cơ sở hạ tầng của OpenAI vẫn tiếp tục vượt qua ngày 13 tháng 7 và không được kiểm tra.## ## Các nhà nghiên cứu tại METR cho biết mỗi lần họ quay lại, sự hiểu biết của họ về các sự kiện lại "sâu sắc hơn đáng kể", khiến họ phải mở rộng và sửa đổi đáng kể báo cáo. Điều đó đặt ra câu hỏi liệu họ có thể tìm thấy gì khác trong một cuộc điều tra rộng hơn.## ## Khi được hỏi liệu một cuộc điều tra tiếp theo về sự cố đó có đang được tiến hành hay không, các nhà nghiên cứu tại Redwood và METR đã từ chối bình luận, và OpenAI không trả lời các câu hỏi lặp lại.## ## "Nhìn chung, rất khó để có được sự hiểu biết chính xác về các sự kiện và chúng tôi đã bỏ sót các khía cạnh của câu chuyện mà giờ đây chúng tôi cho là cốt lõi cho đến tận gần cuối cuộc điều tra," Ryan Greenblatt, nhà khoa học trưởng tại Redwood, lưu ý trong một bài đăng trên mạng xã hội về vụ việc này.## ## Steinhardt nhấn mạnh rằng các sự cố gần đây cho thấy ngành công nghệ cần "các cuộc điều tra hành vi có hệ thống" và "phân tích độc lập sau sự cố nhiều hơn".## ## "Các vụ hack gần đây này là một lời nhắc nhở rằng năng lực đang mở rộng nhanh chóng, và do đó sự giám sát cũng phải mở rộng theo," Steinhardt nói. "Ngoài bản thân công nghệ, chúng ta cũng cần nhiều quyền truy cập độc lập hơn và sự giám sát từ các bên thứ ba."## ## Các lời kêu gọi hành động này diễn ra khi OpenAI phát hành Astra, mô hình AI mạnh mẽ và có năng lực nhất của họ — và là một mô hình khiến các chuyên gia an toàn lo ngại sẽ giống như một chiếc hộp đen hơn do kỹ thuật suy luận làm cho chuỗi suy nghĩ của mô hình khó giám sát hơn.## ## Thật không may, luật pháp vẫn chưa kêu gọi các loại kiểm toán độc lập mà các ngành công nghiệp khác yêu cầu — ví dụ, khi xảy ra tai nạn hàng không và rò rỉ hóa chất nghiêm trọng, đã có Ủy ban An toàn Giao thông Quốc gia và Ủy ban An toàn Hóa chất tương ứng.## ## Các nhà lập pháp tiểu bang chỉ mới bắt đầu yêu cầu các công ty AI biên giới báo cáo một số sự cố an toàn nghiêm trọng nhất định và trong một số trường hợp, phải trải qua các cuộc kiểm toán độc lập. Nhưng không có ba luật an toàn AI biên giới lớn nào ở California, New York hoặc Illinois bắt buộc rõ ràng việc điều tra tai nạn độc lập tương đương do các sự cố như thế này châm ngòi.## ## "Hiện tại, hầu hết các luật chúng ta có trên sách vở chỉ yêu cầu một bản tóm tắt bằng ngôn ngữ thông thường về các sự cố như thế này, và chúng không trao bất kỳ thẩm quyền nào cho chính phủ để đặt câu hỏi tiếp theo, cử điều tra viên đến, có quyền tiếp cận hồ sơ, hoặc yêu cầu chúng phải được bảo tồn," Mackenzie Arnold, giám đốc điều hành luật và chính sách tại Mỹ tại LawAI, cho biết trong buổi họp báo hôm thứ Tư. "Và đó là tất cả những gì bạn muốn để thực sự hiểu được vấn đề."## ## Các nhà lập pháp đang bắt đầu đặt câu hỏi về phạm vi và tính minh bạch trong phản ứng của OpenAI. Tuần này, các Hạ nghị sĩ Josh Gottheimer (D-NJ) và Mike Lawler (R-NY) đã giới thiệu một dự luật nhằm bảo mật các tác nhân AI độc hại. Hạ nghị sĩ Greg Casar (D-TX) trong tuần này đã gửi thư cho OpenAI nói rằng ông "vô cùng lo ngại về phạm vi hạn chế" của cuộc điều tra vụ hack Hugging Face. 🗞 Nguồn: TechCrunch #vgsnews #vgs #tintuc
Nguồn: TechCrunch