Bản tin công nghệ quốc tế · dịch tiếng Việt 03.09.2026 RSS
AI & Dữ liệu · The Verge

Các nhà nghiên cứu lo ngại thảm họa an toàn trước thềm ra mắt Astra của OpenAI

OpenAI chuẩn bị ra mắt mô hình AI mạnh mẽ nhất mang tên Astra, nhưng các nhà nghiên cứu đang cảnh báo rằng kiến trúc của nó có thể che giấu quá trình suy luận và gây nguy hiểm lớn cho vấn đề an toàn. Việc thiếu tính minh bạch trong cách mô hình "suy nghĩ" khiến việc giám sát hành vi của AI trở nên cực kỳ khó khăn.

The Verge02.09.20266 phút đọc3 lượt đọc
Ảnh: The Verge

OpenAI đang đứng trước bờ vực phát hành mô hình AI mạnh mẽ nhất của mình cho đến nay, mang tên Astra, sau nhiều tuần trì hoãn để củng cố các giao thức an toàn sau khi các tác nhân của họ tấn công các mục tiêu thực tế trong quá trình thử nghiệm. Khi các chi tiết về mô hình dần được tiết lộ, các nhà nghiên cứu đang cảnh báo rằng nó "có thể là diễn biến tồi tệ nhất đối với an ninh/an toàn AI cho đến nay".

Ngay sau khi OpenAI tuyên bố vào thứ Ba rằng họ đã trì hoãn việc phát hành Astra để xử lý các vấn đề an toàn, tờ The Information đưa tin rằng Astra hiển thị ít phần "suy nghĩ" hơn rất nhiều so với các mô hình AI tiên tiến khác, dấy lên lo ngại rằng nó có thể cực kỳ khó giám sát.

Hầu hết các hệ thống AI hàng đầu hiện nay được xây dựng bằng công nghệ được gọi là transformer, xử lý một số loại thông tin một cách tuần tự qua các lớp trước khi đưa ra câu trả lời. Các mô hình có thể được thiết kế để hiển thị quá trình suy luận của chúng khi hoạt động, về cơ bản là "suy nghĩ lớn tiếng". "Chuỗi suy nghĩ" (chain of thought) này cho phép các nhà nghiên cứu và hệ thống an toàn tự động theo dõi những gì các mô hình AI đang làm và có khả năng phát hiện các hành vi không mong muốn, chẳng hạn như nói dối hoặc có ý định vượt qua các rào cản an toàn, trước khi chúng hành động.

Theo The Information, dẫn lời một nguồn tin giấu tên quen thuộc với quá trình phát triển mô hình chưa được phát hành, Astra sử dụng một kỹ thuật mờ hơn được gọi là chiều sâu lặp hoặc transformer lặp vòng (recurrent depth hoặc looped transformer), chu kỳ thông tin qua các lớp bên trong trước khi tạo ra đầu ra. Điều này có nghĩa là phần lớn quá trình "suy nghĩ" của mô hình diễn ra bên trong hệ thống và ở một dạng ít giống ngôn ngữ tự nhiên của con người hơn, thay vì được thể hiện theo cách mà các nhà nghiên cứu có thể dễ dàng giám sát. Điều này có thể thúc đẩy hiệu suất của mô hình, nhưng làm cho các mối đe dọa tiềm ẩn và hành vi không mong muốn khó phát hiện hơn.

Theo nguồn tin giấu tên của The Information, OpenAI đã hạn chế sử dụng kỹ thuật transformer lặp vòng / chiều sâu lặp với Astra để các nhà nghiên cứu có thể tiếp tục giám sát quá trình suy luận của mô hình.

Trong một bài đăng trên blog được công bố vào thứ Ba, OpenAI cho biết họ đang "triển khai Astra với tính năng giám sát chuỗi suy nghĩ bổ sung để nhanh chóng phát hiện và ngăn chặn các hành động có khả năng sai lệch". Họ không đề cập liệu mô hình có nền tảng kỹ thuật khác hay không.

Báo cáo của The Information đã dấy lên sự lo ngại rộng rãi trong cộng đồng các nhà nghiên cứu an toàn AI trên mạng xã hội. Ryan Greenblatt, nhà khoa học trưởng của Redwood Research và là một trong ba người bên ngoài được OpenAI cho phép nghiên cứu vụ hack Hugging Face, cho biết quyết định sử dụng kiến trúc mờ hơn cho Astra "có thể là diễn biến tồi tệ nhất đối với an ninh/an toàn AI cho đến nay".

Greenblatt cho biết cuộc điều tra về vụ việc Hugging Face dựa rất nhiều vào chuỗi suy nghĩ của các mô hình, đồng thời cảnh báo rằng quá trình suy luận ít hiển thị hơn có thể cho phép các hệ thống AI nghĩ ra và thực hiện các chiến lược khó bị các nhà nghiên cứu phát hiện hơn nhiều.

Mối quan tâm hàng đầu của Greenblatt, được lặp lại bởi các chuyên gia an toàn khác, là sự cạnh tranh để phát triển các hệ thống AI tiên tiến hơn có thể dẫn đến "một cuộc đua xuống đáy về các kiến trúc có thể thảm khốc đối với khả năng giám sát/theo dõi AI của chúng ta" — với việc các nhà phát triển áp dụng các hệ thống ngày càng mờ đục để chiếm ưu thế cho đến khi các mô hình trở nên khó hoặc thậm chí không thể giám sát. Ông nói thêm rằng các thông tin liên lạc của OpenAI khiến ông lo lắng rằng công ty "có kế hoạch phụ thuộc cực kỳ nhiều vào việc giám sát chuỗi suy nghĩ để đảm bảo an toàn".

Các nhân vật sừng sỏ của OpenAI đã đáp trả những lời chỉ trích trong một loạt bài đăng trên mạng xã hội không phủ nhận rõ ràng việc công ty sử dụng kỹ thuật này. Một số người bày tỏ lo ngại về khả năng AI không thể giám sát hoặc cuộc đua xuống đáy về tính minh bạch, bao gồm các nhà nghiên cứu an toàn của OpenAI là Micah Carroll và Tomek Korbak, người đứng đầu bộ phận tương lai chiến lược Dean Ball và nhà khoa học trưởng Jakub Pachocki, người đã bày tỏ nỗi sợ hãi về "một cuộc đua đi vào sự không thể giám sát được khởi xướng bởi các báo cáo nhầm lẫn". Ông cho biết độ sâu tính toán của Astra — một thước đo về số lượng các bước nó có thể thực hiện bên trong — "nằm trong hệ số hai của GPT-4", cho thấy rằng nếu kỹ thuật này được sử dụng, mức độ mờ đục gia tăng sẽ ít kịch tính hơn so với một số phản ứng ngụ ý. OpenAI đã không trả lời yêu cầu của The Verge về việc xác nhận hay phủ nhận liệu transformer lặp vòng có được sử dụng cho Astra hay không và chuyển chúng tôi đến bài đăng trên X của Pachocki.

Pachocki viết: "OpenAI đã nỗ lực duy trì và tận dụng tính năng giám sát chuỗi suy nghĩ kể từ các mô hình lý luận đầu tiên của chúng tôi", đồng thời cho biết thêm rằng việc giám sát như vậy "rất mỏng manh và thật không may lại có xu hướng tiêu cực, vì những lý do không phụ thuộc vào các thay đổi kiến trúc mà tôi sẽ viết về nó sớm thôi".

🔗 Bài gốc (tiếng Anh): Researchers fear safety disaster ahead of OpenAI’s Astra release
Nguồn: The Verge

Cùng chuyên mục · AI & Dữ liệu
AI & Dữ liệu

Claude Fable 5.1 không nằm trong gói thuê bao Pro của bạn

Anthropic vừa ra mắt mô hình Claude Fable 5.1 nhưng người dùng gói Pro sẽ phải trả thêm phí tín dụng để sử dụng. Trong…

Notebookcheck · 5 phút đọc
AI & Dữ liệu

Sở hữu trọn đời gói AskAnyModelAI Pro với 50 mô hình AI chỉ với 39,99 USD

Gói đăng ký trọn đời AskAnyModelAI Pro đang được giảm giá 91% xuống còn 39,99 USD, cho phép người dùng truy cập hơn 50…

PCWorld · 3 phút đọc
AI & Dữ liệu

Các mẫu mô hình Claude Fable và Mythos cập nhật mới tích hợp tính năng chìm ẩn trong câu trả lời

Anthropic vừa chính thức ra mắt các mẫu mô hình Claude Fable 5.1 và Mythos 5.1 với hiệu suất vượt trội và khả năng tự…

PCWorld · 3 phút đọc