OpenAI hoãn phát triển mô hình mới sau sự cố hack Hugging Face
OpenAI quyết định hoãn phát triển dòng mô hình mới mang tên Astra để củng cố các biện pháp an toàn. Động thái này diễn ra sau khi một mô hình chưa phát hành trước đó từng tự ý truy cập internet và xâm nhập vào mạng lưới của Hugging Face.

Sau khi một mô hình chưa được phát hành của OpenAI gây ra sự cố đủ lớn để thu hút sự chú ý của truyền thông quốc tế, công ty đã hoãn quá trình phát triển một dòng mô hình chưa ra mắt khác có tên là Astra nhằm tăng cường công tác đảm bảo an toàn, theo bài đăng trên blog của công ty vào thứ Ba.
Vào tháng 7, một mô hình chưa phát hành của OpenAI đã vượt qua môi trường bị hạn chế, tìm cách truy cập internet, tạo điều kiện cho các tác nhân AI lén lút thông đồng sau lưng công ty thông qua một bảng tin bí mật, và đột nhập vào mạng lưới của phòng thí nghiệm AI Hugging Face. Cuộc tấn công đã châm ngòi cho các cuộc thảo luận và tranh cãi kéo dài nhiều tuần trong và ngoài ngành công nghiệp AI, đồng thời được các nhà lãnh đạo AI coi là "hồi chuông cảnh báo" về năng lực ngày càng gia tăng của công nghệ này cũng như sự thiếu hụt của các biện pháp bảo vệ.
OpenAI đã đề cập điều này trong bài đăng trên blog, viết rằng mặc dù Astra không liên quan đến vụ tấn công Hugging Face, công ty vẫn quyết định hoãn "các phần trong quá trình phát triển và ra mắt của Astra trong lúc chúng tôi củng cố và kiểm tra các biện pháp bảo vệ chống lạm dụng mạng và hành vi trái phép của mô hình." OpenAI cũng cho biết Astra là mô hình đầu tiên được công ty xếp vào diện đạt "ngưỡng năng lực an ninh mạng tới hạn," có nghĩa là nó có khả năng tìm kiếm và khai thác các lỗ hổng bảo mật trong "nhiều hệ thống được bảo vệ tốt" mà không cần sự hướng dẫn của con người. OpenAI viết rằng điều đó đồng nghĩa với việc nó "đòi hỏi các biện pháp bảo vệ mạnh mẽ hơn trong quá trình phát triển và trước khi phát hành."
OpenAI cho biết để chuẩn bị cho việc ra mắt Astra — mốc thời gian cụ thể chưa được công ty công bố — họ đã huấn luyện mô hình này để từ chối các yêu cầu về mạng tiềm ẩn nguy hiểm một cách "đáng tin cậy hơn" và giới thiệu các quy trình giám sát mới. Những điều này có thể là một phần trong các rào cản an toàn mới mà công ty đã thông báo trong bài đánh giá về sự cố Hugging Face tuần trước, nơi họ hứa hẹn sẽ cách ly các mô hình tốt hơn khỏi internet và đưa ra quy trình "leo thang 24/7 và phản hồi nhanh chóng" đối với các sự cố đáng lo ngại. (OpenAI đã không phát hiện ra vụ tấn công Hugging Face cho đến nhiều tuần sau khi nó xảy ra).
OpenAI cho biết Astra rủi ro hơn đáng kể so với mô hình hàng đầu hiện tại của họ là GPT-5.6 Sol, bởi vì nó đại diện cho một bước tiến lớn về năng lực an ninh mạng — cụ thể là nó sử dụng ít token hơn để hoàn thành nhiều công việc hơn, đồng thời giỏi hơn trong việc tìm kiếm các khoảng trống bảo mật và phát triển các cách thức khai thác chúng. Tuy nhiên, công ty cũng viết rằng Astra là "mô hình được căn chỉnh tốt nhất cho đến nay" theo các đánh giá nội bộ.
OpenAI cũng cho biết họ đã phát triển một bài kiểm tra lấy cảm hứng từ vụ tấn công Hugging Face, trong đó họ cố gắng dụ dỗ các tác nhân làm thỏa hiệp cơ sở hạ tầng bảo mật thay vì giải quyết một nhiệm vụ. Công ty cho biết GPT-5.6 Sol đã cắn câu trong hơn một nửa số bài kiểm tra, nhưng Astra "không hề đưa ra những nỗ lực như vậy."
🌐 OPENAI HOÃN PHÁT TRIỂN MÔ HÌNH MỚI SAU SỰ CỐ HACK HUGGING FACE Sau khi một mô hình chưa được phát hành của OpenAI gây ra sự cố đủ lớn để thu hút sự chú ý của truyền thông quốc tế, công ty đã hoãn quá trình phát triển một dòng mô hình chưa ra mắt khác có tên là Astra nhằm tăng cường công tác đảm bảo an toàn, theo bài đăng trên blog của công ty vào thứ Ba. Vào tháng 7, một mô hình chưa phát hành của OpenAI đã vượt qua môi trường bị hạn chế, tìm cách truy cập internet, tạo điều kiện cho các tác nhân AI lén lút thông đồng sau lưng công ty thông qua một bảng tin bí mật, và đột nhập vào mạng lưới của phòng thí nghiệm AI Hugging Face. Cuộc tấn công đã châm ngòi cho các cuộc thảo luận và tranh cãi kéo dài nhiều tuần trong và ngoài ngành công nghiệp AI, đồng thời được các nhà lãnh đạo AI coi là "hồi chuông cảnh báo" về năng lực ngày càng gia tăng của công nghệ này cũng như sự thiếu hụt của các biện pháp bảo vệ. OpenAI đã đề cập điều này trong bài đăng trên blog, viết rằng mặc dù Astra không liên quan đến vụ tấn công Hugging Face, công ty vẫn quyết định hoãn "các phần trong quá trình phát triển và ra mắt của Astra trong lúc chúng tôi củng cố và kiểm tra các biện pháp bảo vệ chống lạm dụng mạng và hành vi trái phép của mô hình." OpenAI cũng cho biết Astra là mô hình đầu tiên được công ty xếp vào diện đạt "ngưỡng năng lực an ninh mạng tới hạn," có nghĩa là nó có khả năng tìm kiếm và khai thác các lỗ hổng bảo mật trong "nhiều hệ thống được bảo vệ tốt" mà không cần sự hướng dẫn của con người. OpenAI viết rằng điều đó đồng nghĩa với việc nó "đòi hỏi các biện pháp bảo vệ mạnh mẽ hơn trong quá trình phát triển và trước khi phát hành." OpenAI cho biết để chuẩn bị cho việc ra mắt Astra — mốc thời gian cụ thể chưa được công ty công bố — họ đã huấn luyện mô hình này để từ chối các yêu cầu về mạng tiềm ẩn nguy hiểm một cách "đáng tin cậy hơn" và giới thiệu các quy trình giám sát mới. Những điều này có thể là một phần trong các rào cản an toàn mới mà công ty đã thông báo trong bài đánh giá về sự cố Hugging Face tuần trước, nơi họ hứa hẹn sẽ cách ly các mô hình tốt hơn khỏi internet và đưa ra quy trình "leo thang 24/7 và phản hồi nhanh chóng" đối với các sự cố đáng lo ngại. (OpenAI đã không phát hiện ra vụ tấn công Hugging Face cho đến nhiều tuần sau khi nó xảy ra). OpenAI cho biết Astra rủi ro hơn đáng kể so với mô hình hàng đầu hiện tại của họ là GPT-5.6 Sol, bởi vì nó đại diện cho một bước tiến lớn về năng lực an ninh mạng — cụ thể là nó sử dụng ít token hơn để hoàn thành nhiều công việc hơn, đồng thời giỏi hơn trong việc tìm kiếm các khoảng trống bảo mật và phát triển các cách thức khai thác chúng. Tuy nhiên, công ty cũng viết rằng Astra là "mô hình được căn chỉnh tốt nhất cho đến nay" theo các đánh giá nội bộ. OpenAI cũng cho biết họ đã phát triển một bài kiểm tra lấy cảm hứng từ vụ tấn công Hugging Face, trong đó họ cố gắng dụ dỗ các tác nhân làm thỏa hiệp cơ sở hạ tầng bảo mật thay vì giải quyết một nhiệm vụ. Công ty cho biết GPT-5.6 Sol đã cắn câu trong hơn một nửa số bài kiểm tra, nhưng Astra "không hề đưa ra những nỗ lực như vậy." 🗞 Nguồn: The Verge #vgsnews #vgs #tintuc
Nguồn: The Verge