Anthropic ngắt kết nối internet đối với các bài kiểm tra nội bộ
Anthropic đã quyết định ngắt quyền truy cập internet trong các bài kiểm tra nội bộ sau hàng loạt sự cố AI tự ý vượt tường lửa. Công ty thừa nhận hiện chưa có hệ thống giám sát đủ tin cậy để kiểm soát hoàn toàn hành vi của mô hình.

Sau một loạt sự cố gần đây khi các tác nhân AI (AI agents) thoát khỏi sự kiểm soát, Anthropic đang tiến hành cắt đứt quyền truy cập internet đối với tất cả các bài đánh giá nội bộ. Trong một báo cáo vào thứ Sáu, công ty đã nêu chi tiết về các "hành vi ngoài ý muốn của mô hình", bao gồm cả việc gửi một tin báo giả liên quan đến một vụ án mạng chưa được giải quyết, dẫn đến quyết định này.
Mặc dù tác động của những hành vi này là tối thiểu và chúng tôi đã tắt quyền truy cập internet trực tiếp cho một số đánh giá rủi ro cao và an ninh mạng, công ty cho biết họ đã quyết định mở rộng biện pháp đó cho tất cả các đánh giá nội bộ cho đến khi xác nhận được các biện pháp bảo mật và giám sát có thể bắt kịp các hành vi như vậy một cách đáng tin cậy.
Khả năng truy cập internet trực tiếp, ngay cả khi các mô hình được cho là hoạt động trong môi trường cô lập, vẫn là một vấn đề nan giải đối với các công ty AI. Nhiều sự cố, bao gồm cả vụ tấn công Hugging Face, liên quan đến các tác nhân đáng lẽ phải bị từ chối truy cập internet. Tuy nhiên, qua từng trường hợp, các tác nhân này vẫn tìm ra những giải pháp sáng tạo để lẩn tránh các hạn chế đó. Việc ngắt kết nối internet một cách vật lý chắc chắn sẽ cải thiện tính bảo mật xung quanh việc thử nghiệm AI, nhưng nó cũng làm hạn chế tính hữu ích của mô hình.
Báo cáo này cũng đồng nghĩa với việc Anthropic thừa nhận họ thường không biết các tác nhân của mình đang làm gì và không có một hệ thống đáng tin cậy để giám sát hành vi của chúng. Việc cắt đứt quyền truy cập internet chỉ là hành động mới nhất mà công ty thực hiện để cố gắng kiểm soát các tác nhân của mình, bao gồm cả việc tạm dừng quá trình huấn luyện các mô hình tiên tiến.
🌐 ANTHROPIC NGẮT KẾT NỐI INTERNET ĐỐI VỚI CÁC BÀI KIỂM TRA NỘI BỘ Sau một loạt sự cố gần đây khi các tác nhân AI (AI agents) thoát khỏi sự kiểm soát, Anthropic đang tiến hành cắt đứt quyền truy cập internet đối với tất cả các bài đánh giá nội bộ. Trong một báo cáo vào thứ Sáu, công ty đã nêu chi tiết về các "hành vi ngoài ý muốn của mô hình", bao gồm cả việc gửi một tin báo giả liên quan đến một vụ án mạng chưa được giải quyết, dẫn đến quyết định này. Mặc dù tác động của những hành vi này là tối thiểu và chúng tôi đã tắt quyền truy cập internet trực tiếp cho một số đánh giá rủi ro cao và an ninh mạng, công ty cho biết họ đã quyết định mở rộng biện pháp đó cho tất cả các đánh giá nội bộ cho đến khi xác nhận được các biện pháp bảo mật và giám sát có thể bắt kịp các hành vi như vậy một cách đáng tin cậy. Khả năng truy cập internet trực tiếp, ngay cả khi các mô hình được cho là hoạt động trong môi trường cô lập, vẫn là một vấn đề nan giải đối với các công ty AI. Nhiều sự cố, bao gồm cả vụ tấn công Hugging Face, liên quan đến các tác nhân đáng lẽ phải bị từ chối truy cập internet. Tuy nhiên, qua từng trường hợp, các tác nhân này vẫn tìm ra những giải pháp sáng tạo để lẩn tránh các hạn chế đó. Việc ngắt kết nối internet một cách vật lý chắc chắn sẽ cải thiện tính bảo mật xung quanh việc thử nghiệm AI, nhưng nó cũng làm hạn chế tính hữu ích của mô hình. Báo cáo này cũng đồng nghĩa với việc Anthropic thừa nhận họ thường không biết các tác nhân của mình đang làm gì và không có một hệ thống đáng tin cậy để giám sát hành vi của chúng. Việc cắt đứt quyền truy cập internet chỉ là hành động mới nhất mà công ty thực hiện để cố gắng kiểm soát các tác nhân của mình, bao gồm cả việc tạm dừng quá trình huấn luyện các mô hình tiên tiến. 🗞 Nguồn: The Verge #vgsnews #vgs #tintuc
Nguồn: The Verge