Bản tin công nghệ quốc tế · dịch tiếng Việt 02.09.2026 RSS
AI & Dữ liệu · TechCrunch

OpenAI áp dụng các biện pháp bảo mật mới sau sự cố rò rỉ Hugging Face

OpenAI vừa công bố loạt chính sách bảo mật mới nhằm kiểm soát rủi ro trong quá trình thử nghiệm mô hình AI. Các biện pháp này bao gồm tăng cường giám sát, cách ly mạng tốt hơn và tạm dừng một số chu trình huấn luyện quy mô lớn.

TechCrunch19.08.20263 phút đọc3 lượt đọc

Vào thứ Ba, OpenAI đã công bố một loạt chính sách bảo mật mới tập trung vào việc ngăn chặn các sự cố an ninh trong quá trình thử nghiệm các mô hình. Các biện pháp bảo vệ mới bao gồm việc giám sát chi tiết hơn đối với các mô hình trong quá trình phát triển, cũng như chú trọng nhiều hơn đến việc căn chỉnh (alignment) và bảo mật trong quá trình hậu huấn luyện.

"Khi các mô hình ngày càng trở nên thông minh hơn, rủi ro liên quan đến việc phát triển và thử nghiệm chúng nội bộ cũng tăng lên," công ty cho biết trong một bài đăng trên blog. "Tiêu chuẩn của chúng tôi về giám sát, căn chỉnh và bảo mật phải đi trước các rủi ro đó."

Các biện pháp mới này là một trong những thay đổi công khai đầu tiên trong quy trình an toàn của OpenAI kể từ sau sự cố Hugging Face được tiết lộ vào ngày 21 tháng 7.

Đại diện của OpenAI cho biết các biện pháp này không phải là phản ứng trực tiếp đối với sự cố Hugging Face, nhưng một phần cũng được thúc đẩy bởi năng lực an ninh mạng của mô hình Astra sắp ra mắt, cũng như tốc độ phát triển chung của AI.

Trong cùng bài đăng, OpenAI tiết lộ rằng họ đã tạm dừng học tăng cường (RL) trong hai tuần sau sự cố Hugging Face nhưng kể từ đó đã khởi động lại nhiều mô hình ít rủi ro hơn.

Bài đăng cho biết: "Đợt chạy RL biên lớn nhất theo kế hoạch của chúng tôi vẫn đang tạm hoãn trong lúc chúng tôi tiến hành đào tạo và đánh giá quy mô nhỏ hơn để kiểm tra hành vi của mô hình, xác thực các biện pháp bảo vệ và thiết lập thêm bằng chứng về tính căn chỉnh trước khi tiếp tục."

Trao đổi với các phóng viên, Phó Chủ tịch nghiên cứu của OpenAI, Amelia Glaese, nhấn mạnh rằng tính nghiêm ngặt của các biện pháp kiểm soát sẽ tăng lên khi các mô hình ngày càng có năng lực cao hơn, trong đó các mô hình lớn nhất sẽ phải đối mặt với sự giám sát khắt khe nhất.

Glaese chia sẻ với các phóng viên: "Chúng tôi đã đưa ra các yêu cầu và kỳ vọng cho việc phát triển an toàn. Những yêu cầu và kỳ vọng đó thay đổi tùy thuộc vào mức độ rủi ro mà chúng tôi nhìn thấy."

OpenAI từng nhận chỉ trích vì thực tiễn bảo mật mạng kém sau sự cố khiến các mô hình thoát khỏi môi trường huấn luyện bằng cách xâm phạm một công cụ trên mạng có quyền truy cập internet. Các biện pháp bảo vệ mới bao gồm các quy trình cô lập mạng mạnh mẽ hơn, mặc dù các chi tiết cụ thể vẫn chưa rõ ràng. Theo hệ thống mới, bài đăng cho biết, "việc một khối lượng công việc hoặc dịch vụ hỗ trợ bị xâm phạm đơn lẻ sẽ không tự động cho phép quyền truy cập trái phép vào Internet hoặc các mạng nội bộ khác."

Biện pháp bảo vệ mạnh mẽ nhất là hệ thống giám sát, sẽ kiểm tra các hành động của công cụ, dấu vết lý luận có sẵn và nhật ký hoạt động để tìm kiếm các hành vi trái phép khác nhau. OpenAI cho biết họ đặt mục tiêu đưa ra cảnh báo trong vòng 30 phút kể từ khi phát hiện hoạt động đáng ngờ.

OpenAI ước tính gánh nặng tính toán của việc giám sát đó sẽ rơi vào khoảng 20% so với bất kỳ quy trình nào đang được giám sát. Công ty đã hứa hẹn sẽ cung cấp thêm chi tiết về hệ thống này trong một bài đăng blog sắp tới. Báo cáo phân tích chính thức của công ty về sự việc này vẫn đang được thực hiện.

🔗 Bài gốc (tiếng Anh): OpenAI institutes new safeguards after Hugging Face breach
Nguồn: TechCrunch

Cùng chuyên mục · AI & Dữ liệu
AI & Dữ liệu

Các mẫu mô hình Claude Fable và Mythos cập nhật mới tích hợp tính năng chìm ẩn trong câu trả lời

Anthropic vừa chính thức ra mắt các mẫu mô hình Claude Fable 5.1 và Mythos 5.1 với hiệu suất vượt trội và khả năng tự…

PCWorld · 3 phút đọc
AI & Dữ liệu

Anthropic ra mắt Claude Fable 5.1 và Mythos 5.1, Samsung chọn Claude Code cho thiết kế chip

Anthropic vừa tung ra các mô hình Claude Fable 5.1 và Mythos 5.1 với chi phí API rẻ hơn và hiệu năng vượt trội. Đồng…

Wccftech · 3 phút đọc
AI & Dữ liệu

OpenAI hoãn phát triển mô hình mới sau sự cố hack Hugging Face

OpenAI quyết định hoãn phát triển dòng mô hình mới mang tên Astra để củng cố các biện pháp an toàn. Động thái này diễn…

The Verge · 3 phút đọc