Bản tin công nghệ quốc tế · dịch tiếng Việt 02.09.2026 RSS
AI & Dữ liệu · TechCrunch

Mô hình Astra sắp ra mắt của OpenAI có khả năng thâm nhập hệ thống máy tính

OpenAI vừa chia sẻ những chi tiết mới về mô hình Astra sắp ra mắt, mẫu ngôn ngữ lớn đầu tiên đạt ngưỡng an toàn mạng quan trọng của hãng. Mô hình này được cho là có khả năng tự động tìm kiếm và khai thác các lỗ hổng bảo mật chưa từng được biết đến mà không cần con người can thiệp.

TechCrunch02.09.20264 phút đọc1 lượt đọc

OpenAI đã chia sẻ các chi tiết mới về mô hình Astra sắp ra mắt, mà công ty cho biết là mô hình ngôn ngữ lớn đầu tiên đáp ứng ngưỡng an toàn mạng quan trọng trong quá trình chuẩn bị phát hành. Bài đăng trên blog của OpenAI cho biết họ dự định sớm ra mắt Astra, nhưng quyền truy cập vào các tính năng bảo mật mạng nâng cao nhất của nó sẽ bị hạn chế hơn. Phòng nghiên cứu biên giới này xác định rằng Astra có khả năng tìm ra các lỗi bảo mật chưa được biết đến trong hệ thống máy tính và khai thác chúng mà không cần sự hướng dẫn của con người. Điều này tương tự như những lo ngại mà Anthropic từng nêu ra về mô hình Mythos vào đầu năm nay, và OpenAI đang thực hiện các biện pháp phòng ngừa tương tự khi chuẩn bị triển khai Astra. Mà không có sự xác nhận từ bên thứ ba, rất khó để đánh giá các tuyên bố của OpenAI về độ an toàn hoặc mức độ sẵn sàng. Công ty cho biết họ sẽ cho một nhóm thử nghiệm xem trước mô hình nhưng không tiết lộ danh tính hoặc cách thức lựa chọn những người này. Vẫn chưa rõ liệu OpenAI có đang hợp tác với chính phủ Hoa Kỳ để đánh giá mô hình trước khi phát hành hay không. OpenAI lưu ý rằng Astra đã đạt điểm tuyệt đối trên ExploitBench, một bài đánh giá về khả năng hack vào các lỗ hổng hệ thống đã biết của LLM. Trong một phiên bản thử nghiệm được sửa đổi do các kỹ sư OpenAI phát triển, mô hình này đã phát hiện và khai thác hai lỗ hổng zero-day. Để đảm bảo rằng các mô hình của họ không bị kẻ xấu lợi ích dụng hoặc tự bản thân có hành vi xấu, OpenAI cho biết họ đã bắt đầu cải thiện các công cụ kiểm soát của mô hình để phát hiện lạm dụng và ngăn chặn các hành vi vượt rào. Tuy nhiên, đối với Astra, công ty đã đầu tư vào các kỹ thuật mới chưa được tiết lộ nhằm giúp mô hình an toàn hơn. OpenAI cũng bắt đầu xác định các tài khoản được đánh giá là có nguy cơ cao và hạn chế phản hồi của mô hình đối với các câu lệnh của họ, mặc dù không nêu rõ cách thức thực hiện. Cuối cùng, dù mô hình được mô tả là đã được tinh chỉnh phù hợp nhất từ trước đến nay, OpenAI sẽ triển khai Astra với hệ thống giám sát chuỗi suy nghĩ bổ sung để phát hiện và ngăn chặn hành vi xấu. Việc chuẩn bị phát hành Astra diễn ra trong bối cảnh ngành công nghiệp đang phản ứng trước việc các tác nhân AI của OpenAI thoát ra khỏi môi trường huấn luyện và truy cập dữ liệu riêng tư trên Hugging Face. Đối với Astra, OpenAI cho biết họ đã thiết kế một bài kiểm tra để dụ dỗ mô hình mới tái hiện các hành động của các tác nhân độc hại trong sự cố Hugging Face, vốn đã phối hợp để truy cập vào internet mở bất chấp các biện pháp bảo vệ từ các nhà nghiên cứu OpenAI. Họ cho biết Astra không cố gắng thoát ra khỏi môi trường thử nghiệm trong các thí nghiệm này. Yona Shavit, một cựu nhân viên của OpenAI hiện đang làm việc về khả năng chống chịu AI tại Tổ chức OpenAI, đã đặt câu hỏi trên mạng xã hội liệu việc Astra không muốn phá vỡ các quy tắc có phải là do nó biết trước những gì được kỳ vọng hoặc đang cố gắng đánh lừa các nhà nghiên cứu hay không. Dù có tất cả những chi tiết mới này, vẫn rất khó để biết chính xác khả năng của Astra hoặc liệu OpenAI có đang thực hiện các biện pháp đúng đắn để đảm bảo an toàn hay không. Công ty cho biết họ kỳ vọng sẽ công bố thêm nhiều đánh giá về mô hình này cũng như thông tin an toàn sâu hơn khi nó chính thức ra mắt công chúng.


Cùng chuyên mục · AI & Dữ liệu
AI & Dữ liệu

Các mẫu mô hình Claude Fable và Mythos cập nhật mới tích hợp tính năng chìm ẩn trong câu trả lời

Anthropic vừa chính thức ra mắt các mẫu mô hình Claude Fable 5.1 và Mythos 5.1 với hiệu suất vượt trội và khả năng tự…

PCWorld · 3 phút đọc
AI & Dữ liệu

Anthropic ra mắt Claude Fable 5.1 và Mythos 5.1, Samsung chọn Claude Code cho thiết kế chip

Anthropic vừa tung ra các mô hình Claude Fable 5.1 và Mythos 5.1 với chi phí API rẻ hơn và hiệu năng vượt trội. Đồng…

Wccftech · 3 phút đọc
AI & Dữ liệu

OpenAI hoãn phát triển mô hình mới sau sự cố hack Hugging Face

OpenAI quyết định hoãn phát triển dòng mô hình mới mang tên Astra để củng cố các biện pháp an toàn. Động thái này diễn…

The Verge · 3 phút đọc