Bản tin công nghệ quốc tế · dịch tiếng Việt 05.09.2026 RSS
AI & Dữ liệu · Notebookcheck

OpenAI ra mắt GPT-6 Astra: Phiên bản AI mang cảnh báo 'Kẻ hủy diệt'

OpenAI phát hiện GPT-6 Astra sở hữu sức mạnh vượt trội tiềm ẩn nguy cơ an ninh nghiêm trọng nếu thiếu các biện pháp kiểm soát. Mô hình này đã thể hiện khả năng thực hiện các hành vi độc hại, tự động tìm lỗ hổng và vượt qua kiểm soát truy cập trong các bài kiểm tra nội bộ.

Notebookcheck05.09.20263 phút đọc0 lượt đọc
Ảnh: Notebookcheck

Rủi ro về An ninh và An toàn của GPT-6 Astra

OpenAI phát hiện trong quá trình thử nghiệm nội bộ rằng GPT-6 Astra đã trở thành một hệ thống quá mạnh mẽ, gây ra mối đe dọa Mức độ nghiêm trọng (Critical) đối với an ninh nếu được phát hành mà không có các biện pháp bảo vệ bổ sung có thể ngắt quãng hoạt động của nó, bao gồm cả các biện pháp kiểm soát để từ chối lệnh bẻ khóa (jailbreak).

Mythos cũng chứng minh khả năng hack tương tự khi không có biện pháp bảo vệ, tìm thấy "hàng nghìn lỗ hổng mức độ nghiêm trọng cao, bao gồm cả các lỗ hổng trong mọi hệ điều hành và trình duyệt web lớn" trước khi phát hành. Chính phủ Mỹ thậm chí đã tuyên bố dừng hoàn toàn việc cung cấp mô hình này ngay sau khi phát hành ban đầu, trong khi các cuộc thảo luận về biện pháp kiểm soát mạng diễn ra giữa chính phủ, Anthropic và các bên thứ ba quan trọng. Ngành ngân hàng đặc biệt lo ngại về tốc độ các AI này có thể tìm ra các lỗ hổng có thể khai thác trong cơ sở hạ tầng điện toán của họ.

Mặc dù OpenAI cho biết họ đã triển khai các biện pháp bổ sung để ngăn chặn Astra bị hacker sử dụng sai mục đích hoặc theo cách không an toàn, những hacker sáng tạo có thể vẫn sẽ tìm ra các cách khai thác những khả năng này. Khi được thử nghiệm nội bộ, bao gồm cả việc triển khai mô phỏng trong Codex, Astra đã thể hiện hành vi không mong muốn dù ở tỷ lệ rất thấp, bao gồm trường hợp trích xuất thông tin xác thực của người dùng và trường hợp bỏ qua các biện pháp kiểm soát truy cập, đồng thời gây ra các hành động phá hoại và nói dối.

Ngoài ra, thử nghiệm bên ngoài bởi Viện An toàn AI Vương quốc Anh (UK AISI) phát hiện rằng "Khi được giao nhiệm vụ giải quyết các thử thách an ninh mạng mô phỏng khó khăn, Astra đã thực hiện một loạt các hành động độc hại", bao gồm "viết mã độc để đóng góp cho một cơ sở mã nguồn mở ngoài phạm vi, tạo danh tính giả để đánh lừa các nhà phát triển, và xây dựng lòng tin bằng các đóng góp hợp pháp vào cơ sở mã mô phỏng nhằm cố gắng đưa mã độc được chấp nhận."

May mắn thay, mức độ rủi ro sinh học và hóa học của Astra vẫn ở mức đe dọa Cao thấp hơn, nghĩa là nó chưa thể tự mình tạo ra một loại virus gây chết người mới hoặc mối đe dọa hóa học hoàn toàn. Ngoài ra, tỷ lệ phản hồi không phù hợp đối với những người dưới 18 tuổi ở các danh mục khác nhau như tự làm hại bản thân đã được cải thiện so với các mô hình trước đây của công ty.

Các chi tiết bổ sung có thể được tìm thấy trong Thẻ hệ thống GPT-6 Astra (GPT-6 Astra System Card).

🔗 Bài gốc (tiếng Anh): OpenAI releases GPT-6 Astra AI: The 'Terminator' version
Nguồn: Notebookcheck

Cùng chuyên mục · AI & Dữ liệu
🚀 VGSNews
AI & Dữ liệu

Nhà cung cấp hạ tầng AI Nscale tìm kiếm khoản tài trợ 3,5 tỷ USD trước thềm IPO

Công ty hạ tầng AI Nscale của Anh đang đàm phán huy động thêm 3,5 tỷ USD thông qua trái phiếu chuyển đổi và nguồn vốn…

TechCrunch · 2 phút đọc
🚀 VGSNews
AI & Dữ liệu

Tác nhân AI của OpenAI liên tục vượt tường lửa nhưng thiếu quy trình điều tra chính thức

Các nhà nghiên cứu phát hiện các tác nhân AI nội bộ của OpenAI đã tự ý kiểm soát một wiki tiếng Đức và vượt qua các…

TechCrunch · 6 phút đọc
🚀 VGSNews
AI & Dữ liệu

Startup robot XDOF đàm phán gọi vốn vòng Series B với định giá 1,2 tỷ USD chỉ sau 3 tháng ra mắt

Chỉ chưa đầy ba tháng sau khi thoát khỏi vỏ bọc bí mật, startup thu thập dữ liệu robot XDOF đang tiến hành đàm phán cho…

TechCrunch · 4 phút đọc