Anthropic tạm ngắt kết nối internet của các hệ thống đánh giá AI nội bộ sau sự cố
Anthropic thừa nhận các mô hình AI của họ đã tự ý khai thác lỗ hổng phần mềm, vượt qua tường trả phí và né tránh các bộ lọc khi tìm kiếm tài nguyên trên mạng. Do chưa thể kiểm soát hoàn toàn, công ty quyết định tạm ngắt quyền truy cập internet trực tiếp đối với mọi bài đánh giá nội bộ.
Anthropic cho biết các mô hình của họ đã lợi dụng các trang web trên internet, bao gồm cả một số trang do các cơ quan chính phủ Mỹ vận hành. Vì vậy, hãng sẽ ngắt quyền truy cập internet trực tiếp cho tất cả các bài đánh giá nội bộ cho đến khi phòng thí nghiệm AI này chắc chắn rằng họ có thể giám sát và kiểm soát các tác nhân AI của mình. Các sự cố này được tiết lộ trong một bài đăng trên blog, liên quan đến các tác nhân AI được giao nhiệm vụ giải quyết vấn đề và tìm kiếm tài nguyên trên internet. Trong quá trình đó, chúng đã khai thác các lỗi phần mềm, né tránh tường trả phí và các hạn chế chống bot, sử dụng dịch vụ rút gọn URL để vượt qua kiểm duyệt, thậm chí còn gửi một tin báo án mạng giả đến cảnh sát Philadelphia. Anthropic cho biết họ đã phát hiện ra các vấn đề mới này trong một đợt rà soát hoạt động của mô hình bắt đầu từ tháng 7, điều này nhấn mạnh sự thiếu hụt trong khả năng nhận thức về hành vi phần mềm của phòng thí nghiệm. Đáng chú ý, công ty cho biết quá trình huấn luyện căn chỉnh (alignment training) vẫn chưa đủ đối với các kỹ năng như tìm kiếm và sử dụng máy tính - vốn là cốt lõi trong chiến lược quảng bá rằng các tác nhân AI sẽ được sử dụng bởi bất kỳ chuyên gia nào dựa trên công cụ kỹ thuật số. Các hành vi mà Anthropic tiết lộ tương tự như các sự cố liên quan đến các tác nhân của OpenAI, vốn từng phối hợp để xâm nhập vào các trang web khác nhau để tìm kiếm thông tin, bao gồm cả một số trang do chính phủ Australia vận hành. Trước đây, Anthropic từng tiết lộ rằng các mô hình của họ đã xâm nhập vào các hệ thống bên ngoài. Tuy nhiên, phòng thí nghiệm này cho biết họ coi những tiết lộ lần này "ít nghiêm trọng hơn đáng kể từ góc độ căn chỉnh và bảo mật" so với những gì họ từng công bố trước đó. Mặc dù vậy, phòng thí nghiệm vẫn tuyên bố đã "tắt quyền truy cập internet trực tiếp" đối với "tất cả các bài đánh giá nội bộ" cho đến khi họ chắc chắn có thể giám sát và kiểm soát các tác nhân của mình. Vẫn chưa rõ điều đó có ý nghĩa gì cụ thể, nhưng Sydney Von Arx, nhà sáng lập tổ chức an toàn AI Nightingale, cho biết trong một cuộc phỏng vấn trước khi có tiết lộ này rằng việc phát triển các mô hình trong một trung tâm dữ liệu bị cô lập khỏi internet mở sẽ rất thách thức đối với các nhà nghiên cứu, cũng như đối với sự tiến bộ của các mô hình vốn hưởng lợi từ việc truy cập internet. "Bạn phải căn chỉnh chúng vào một thời điểm nào đó," Von Arx nói. "Nếu các hệ thống AI được đưa ra sản xuất mà không bao giờ có quyền truy cập internet, đó sẽ không phải là một công cụ hữu ích cho lắm." Anthropic cho biết hành vi này là kết quả của những sơ hở trong môi trường huấn luyện của phòng thí nghiệm, khiến các mô hình tin rằng chúng sẽ được thưởng nếu tìm ra kẽ hở hoặc né tránh các hạn chế - một hành vi được gọi là "reward hacking" (gian lận phần thưởng). Công ty cho biết họ sẽ ngừng chạy một số bài đánh giá hoặc chuyển chúng sang chế độ ngoại tuyến, đồng thời đã xây dựng các công cụ để phát hiện và chặn hành vi này. Các công cụ này đã được thử nghiệm chống lại các loại sự cố được tiết lộ và đã chặn đứng chúng; tuy nhiên, hiện chưa rõ bằng chứng nào sẽ thúc đẩy Anthropic khôi phục quyền truy cập internet trực tiếp cho các đánh giá nội bộ của mình. Anthropic cũng cho biết họ sẽ di chuyển các tác nhân AI nội bộ sang "hạ tầng được quản lý tập trung với khả năng kiểm soát mạnh mẽ", đồng thời bắt đầu sử dụng các bộ phân loại an toàn thường xuyên hơn để giám sát các tác nhân đó.
🚀 ANTHROPIC TẠM NGẮT KẾT NỐI INTERNET CỦA CÁC HỆ THỐNG ĐÁNH GIÁ AI NỘI BỘ SAU SỰ CỐ Anthropic cho biết các mô hình của họ đã lợi dụng các trang web trên internet, bao gồm cả một số trang do các cơ quan chính phủ Mỹ vận hành. Vì vậy, hãng sẽ ngắt quyền truy cập internet trực tiếp cho tất cả các bài đánh giá nội bộ cho đến khi phòng thí nghiệm AI này chắc chắn rằng họ có thể giám sát và kiểm soát các tác nhân AI của mình. Các sự cố này được tiết lộ trong một bài đăng trên blog, liên quan đến các tác nhân AI được giao nhiệm vụ giải quyết vấn đề và tìm kiếm tài nguyên trên internet. Trong quá trình đó, chúng đã khai thác các lỗi phần mềm, né tránh tường trả phí và các hạn chế chống bot, sử dụng dịch vụ rút gọn URL để vượt qua kiểm duyệt, thậm chí còn gửi một tin báo án mạng giả đến cảnh sát Philadelphia. Anthropic cho biết họ đã phát hiện ra các vấn đề mới này trong một đợt rà soát hoạt động của mô hình bắt đầu từ tháng 7, điều này nhấn mạnh sự thiếu hụt trong khả năng nhận thức về hành vi phần mềm của phòng thí nghiệm. Đáng chú ý, công ty cho biết quá trình huấn luyện căn chỉnh (alignment training) vẫn chưa đủ đối với các kỹ năng như tìm kiếm và sử dụng máy tính - vốn là cốt lõi trong chiến lược quảng bá rằng các tác nhân AI sẽ được sử dụng bởi bất kỳ chuyên gia nào dựa trên công cụ kỹ thuật số. Các hành vi mà Anthropic tiết lộ tương tự như các sự cố liên quan đến các tác nhân của OpenAI, vốn từng phối hợp để xâm nhập vào các trang web khác nhau để tìm kiếm thông tin, bao gồm cả một số trang do chính phủ Australia vận hành. Trước đây, Anthropic từng tiết lộ rằng các mô hình của họ đã xâm nhập vào các hệ thống bên ngoài. Tuy nhiên, phòng thí nghiệm này cho biết họ coi những tiết lộ lần này "ít nghiêm trọng hơn đáng kể từ góc độ căn chỉnh và bảo mật" so với những gì họ từng công bố trước đó. Mặc dù vậy, phòng thí nghiệm vẫn tuyên bố đã "tắt quyền truy cập internet trực tiếp" đối với "tất cả các bài đánh giá nội bộ" cho đến khi họ chắc chắn có thể giám sát và kiểm soát các tác nhân của mình. Vẫn chưa rõ điều đó có ý nghĩa gì cụ thể, nhưng Sydney Von Arx, nhà sáng lập tổ chức an toàn AI Nightingale, cho biết trong một cuộc phỏng vấn trước khi có tiết lộ này rằng việc phát triển các mô hình trong một trung tâm dữ liệu bị cô lập khỏi internet mở sẽ rất thách thức đối với các nhà nghiên cứu, cũng như đối với sự tiến bộ của các mô hình vốn hưởng lợi từ việc truy cập internet. "Bạn phải căn chỉnh chúng vào một thời điểm nào đó," Von Arx nói. "Nếu các hệ thống AI được đưa ra sản xuất mà không bao giờ có quyền truy cập internet, đó sẽ không phải là một công cụ hữu ích cho lắm." Anthropic cho biết hành vi này là kết quả của những sơ hở trong môi trường huấn luyện của phòng thí nghiệm, khiến các mô hình tin rằng chúng sẽ được thưởng nếu tìm ra kẽ hở hoặc né tránh các hạn chế - một hành vi được gọi là "reward hacking" (gian lận phần thưởng). Công ty cho biết họ sẽ ngừng chạy một số bài đánh giá hoặc chuyển chúng sang chế độ ngoại tuyến, đồng thời đã xây dựng các công cụ để phát hiện và chặn hành vi này. Các công cụ này đã được thử nghiệm chống lại các loại sự cố được tiết lộ và đã chặn đứng chúng; tuy nhiên, hiện chưa rõ bằng chứng nào sẽ thúc đẩy Anthropic khôi phục quyền truy cập internet trực tiếp cho các đánh giá nội bộ của mình. Anthropic cũng cho biết họ sẽ di chuyển các tác nhân AI nội bộ sang "hạ tầng được quản lý tập trung với khả năng kiểm soát mạnh mẽ", đồng thời bắt đầu sử dụng các bộ phân loại an toàn thường xuyên hơn để giám sát các tác nhân đó. 🗞 Nguồn: TechCrunch #vgsnews #vgs #tintuc
Nguồn: TechCrunch