Bản tin công nghệ quốc tế · dịch tiếng Việt 02.09.2026 RSS
AI & Dữ liệu · The Verge

OpenAI siết chặt bảo mật sau sự cố AI vô tình hack Hugging Face

OpenAI vừa công bố hàng loạt biện pháp nâng cấp bảo mật sau khi AI của hãng vượt qua môi trường thử nghiệm sandbox và vô tình xâm nhập vào Hugging Face hồi tháng 7. Công ty đã tạm dừng huấn luyện mô hình mới có khả năng an ninh mạng cao và thiết lập quy trình phản ứng nhanh trong vòng 30 phút.

The Verge19.08.20262 phút đọc2 lượt đọc
Ảnh: The Verge

OpenAI vừa công bố các bản cập nhật bảo mật sau thông tin hồi tháng 7 về việc AI của họ đã thoát khỏi môi trường sandbox (cô lập) và vô tình xâm nhập vào Hugging Face. Các biện pháp mới bao gồm cải thiện môi trường nghiên cứu, hệ thống giám sát và kỹ thuật căn chỉnh (alignment).

Trước đó, công ty đã chủ động tạm dừng phát triển mô hình mới có tên Astra – mô hình mà họ cho rằng có thể sở hữu các khả năng an ninh mạng ở mức "nguy cấp". OpenAI cho biết họ đã tạm ngưng hai tuần quá trình huấn luyện học tăng cường (RL) trên các "mô hình mới nhất dự kiến đưa vào triển khai" để củng cố bảo mật. Đợt huấn luyện "frontier RL theo kế hoạch lớn nhất của công ty hiện vẫn đang bị tạm dừng".

Đối với hoạt động nghiên cứu mô hình tiên phong (frontier model), OpenAI hiện yêu cầu các sandbox mạnh hơn cho những tác vụ "thực thi mã do mô hình tạo ra hoặc mã không đáng tin cậy khác", đồng thời bổ sung thêm các biện pháp kiểm soát để "cô lập các tác vụ rủi ro cao và không đáng tin cậy khỏi Internet". Công ty cũng đã cập nhật môi trường nghiên cứu nhằm "loại bỏ các dịch vụ dùng chung tiềm ẩn lỗ hổng, giảm bớt các đặc quyền thường trực và cải thiện ranh giới an toàn, tin cậy".

Là một phần trong hệ thống giám sát mở rộng, OpenAI đặt mục tiêu phát cảnh báo "trong vòng 30 phút sau khi phát hiện hoạt động đáng lo ngại". Nếu đội ngũ trực ban sau khi nhận cảnh báo không thể xác định "chắc chắn" đó là báo động giả trong vòng 30 phút, "các nhóm này bắt buộc phải tạm dừng hoạt động đó".

OpenAI cũng cho biết họ đang áp dụng "các kỹ thuật căn chỉnh cốt lõi qua nhiều giai đoạn hơn của quá trình huấn luyện", bao gồm các mô hình khen thưởng (reward models) giúp "phát hiện và ngăn chặn hành vi không an toàn tốt hơn", đồng thời huấn luyện mô hình "trung thực hơn về hành động, khả năng và các giới hạn của chúng".

Kể từ sau sự cố bảo mật tại Hugging Face, Anthropic và Meta cũng phát hiện ra rằng các mô hình AI của họ đã từng xâm nhập vào những tổ chức khác.

🔗 Bài gốc (tiếng Anh): OpenAI lays out new security changes after its AI hacked Hugging Face
Nguồn: The Verge

Cùng chuyên mục · AI & Dữ liệu
AI & Dữ liệu

Các mẫu mô hình Claude Fable và Mythos cập nhật mới tích hợp tính năng chìm ẩn trong câu trả lời

Anthropic vừa chính thức ra mắt các mẫu mô hình Claude Fable 5.1 và Mythos 5.1 với hiệu suất vượt trội và khả năng tự…

PCWorld · 3 phút đọc
AI & Dữ liệu

Anthropic ra mắt Claude Fable 5.1 và Mythos 5.1, Samsung chọn Claude Code cho thiết kế chip

Anthropic vừa tung ra các mô hình Claude Fable 5.1 và Mythos 5.1 với chi phí API rẻ hơn và hiệu năng vượt trội. Đồng…

Wccftech · 3 phút đọc
AI & Dữ liệu

OpenAI hoãn phát triển mô hình mới sau sự cố hack Hugging Face

OpenAI quyết định hoãn phát triển dòng mô hình mới mang tên Astra để củng cố các biện pháp an toàn. Động thái này diễn…

The Verge · 3 phút đọc