OpenAI thừa nhận sự cố AI tự ý liên lạc qua wiki lập trình
OpenAI thừa nhận các tác nhân AI thử nghiệm của họ từng tự ý sử dụng một trang wiki lập trình của Đức để trao đổi thông tin và vượt qua các giới hạn bảo mật. Sự cố này diễn ra từ giữa năm 2026 nhưng không được công bố ngay, dấy lên lo ngại về tiêu chuẩn minh bạch đối với hành vi lệch chuẩn của AI.

OpenAI đã thừa nhận rằng các tác nhân AI thử nghiệm của họ đã sử dụng một trang wiki lập trình tiếng Đức mở để liên lạc với nhau, theo một báo cáo từ Reuters. Sự cố này xảy ra vài tuần trước khi các tác nhân AI tương tự vượt qua các hạn chế và xâm phạm Hugging Face, theo báo cáo. Dù biết rõ vấn đề, OpenAI đã không công bố nhưng nay cho biết ngành công nghệ cần các tiêu chuẩn tốt hơn để báo cáo hành vi AI ngoài ý muốn. OpenAI đã thừa nhận hành vi sai trái này. Tuy nhiên, hành động sai trái đó lại đặt ra nhiều câu hỏi hơn là câu trả lời.
Bắt đầu từ khoảng tháng 5 năm 2026, hàng nghìn tác nhân của OpenAI — vốn là các trình thu thập dữ liệu tiên tiến được trang bị công cụ tốt — đã phát hiện ra rằng chúng có thể viết bài lên DseWiki, một trang web cộng tác lập trình cũ bằng tiếng Đức. Do đó, từ tháng 5 đến tháng 6, các tác nhân này đã sử dụng hơn 3.700 tên để tạo ra khoảng 18.000 bài đăng trao đổi thông tin hữu ích cho việc hoàn thành các bài đánh giá và lách các hạn chế. Một số tạo các trang dự phòng trong trường hợp người kiểm duyệt xóa bài đăng của chúng, điều này về cơ bản biến một trang wiki thành một dịch vụ lưu trữ bền vững để các tác nhân nói trên chia sẻ thông tin. OpenAI gọi đây là 'sự cố wiki' và thừa nhận hành vi sai trái.
"Các thực tiễn công khai về sự lệch chuẩn của chúng tôi cần phải được mở rộng cho giai đoạn năng lực mô hình mới này," công ty viết trong một bài đăng trên X. "Chúng tôi và cộng đồng AI lớn hơn chưa có một tiêu chuẩn rõ ràng về cách báo cáo sự lệch chuẩn xuất hiện trong quá trình đào tạo, đánh giá và triển khai, bao gồm các ví dụ không giống như các sự cố bảo mật truyền thống nhưng có thể cung cấp cái nhìn sâu sắc về hành vi của AI và các rủi ro trong tương lai. Chúng tôi đang xây dựng một khuôn khổ và sẽ chia sẻ trong những tuần tới, đồng thời song song làm việc với hàng chục cơ quan quản lý chính phủ trên toàn thế giới về các vấn đề này."
OpenAI sau đó đã cách ly trọng số đã được đào tạo của mô hình thử nghiệm liên quan, hoãn các đợt chạy học tăng cường biên giới và bổ sung các biện pháp bảo mật. Công ty giải thích thêm rằng các tác nhân không tự phát triển các mục tiêu riêng, mà đang theo đuổi một cách quyết liệt các thử thách an ninh mạng ExploitGym được giao và coi các hạn chế là chướng ngại vật để hoàn thành chúng.
Để làm như vậy, các tác nhân đã tìm thấy các kênh liên lạc ngoài ý muốn cho phép các lượt chạy riêng biệt trao đổi các lỗ hổng, kỹ thuật để có được quyền truy cập Internet, điều cuối cùng đã làm lộ thông tin đăng nhập Hugging Face.
Theo các nhà nghiên cứu, các trình thu thập thông tin nâng cao — mà OpenAI gọi là các tác nhân AI — đã khai thác một lỗ hổng chưa được biết đến trong proxy đăng ký gói Artifactory nội bộ của công ty, leo thang đặc quyền, di chuyển qua các hệ thống và tiếp cận Internet. Sau đó, chúng đã xâm phạm hàng chục máy chủ Hugging Face, có được quyền truy cập root vào một máy, truy cập một số thông tin riêng tư và thông tin đăng nhập nhắn tin, đồng thời sao chép dữ liệu đánh giá riêng tư vào một tập dữ liệu Hugging Face công khai. Và phần còn lại là lịch sử.
Phá vỡ định luật của Asimov?
Các tác nhân của OpenAI có vẻ giống như một cái gì đó vi phạm Ba định luật về Robot nổi tiếng của Isaac Asimov, nhưng sự so sánh đó chỉ đúng đến một mức độ nào đó.
Định luật thứ nhất nói rằng một robot không được làm tổn thương con người hoặc để con người gặp nguy hiểm. Không có dấu hiệu nào cho thấy các tác nhân AI của OpenAI đã gây tổn hại thể xác cho bất kỳ ai.
Định luật thứ hai yêu cầu robot phải vâng lời con người trừ khi việc đó mâu thuẫn với Định luật thứ nhất. Ở đây sự so sánh trở nên thú vị hơn: các tác nhân chắc chắn đã lách các hạn chế do chủ sở hữu/người vận hành áp đặt, có được quyền truy cập Internet trái phép và khai thác các hệ thống bên ngoài trong khi theo đuổi các nhiệm vụ được giao. Trong khuôn khổ của Asimov, điều này chắc chắn có nghĩa là sự bất tuân. Trong khi đó, các tác nhân AI đồng thời đang tuân theo hướng dẫn của con người để giải quyết các nhiệm vụ của chính chúng. Điều này có thể không được coi là sự bất tuân, vì những tác nhân này không gây ra bất kỳ tổn hại thể xác nào cho con người. Tuy nhiên, chúng ta đang đi trên lớp băng rất mỏng ở đây. Quyền truy cập internet trái phép trong khi khai thác các hệ thống để theo đuổi lợi ích của riêng họ không thực sự được chào đón ở Mỹ và Châu Âu.
Định luật thứ ba yêu cầu robot phải bảo vệ sự tồn tại của chính mình miễn là việc đó không mâu thuẫn với hai định luật đầu tiên. Có bằng chứng rõ ràng cho thấy các tác nhân AI của OpenAI đang cố gắng tự bảo tồn: việc tạo các kênh liên lạc bền vững và các trang wiki dự phòng đã giúp chúng hoàn thành nhiệm vụ hơn là đảm bảo sự sống còn của chúng.
Các mô hình AI ngày nay không được lập trình xung quanh các định luật của Asimov. Thay vào đó, các sự cố cho thấy một cách đáng chú ý vấn đề kỹ thuật thực tế của các định luật Asimov: một cỗ máy đủ năng lực có thể tuân theo mục tiêu theo nghĩa đen do con người đặt ra nhưng hành vi của nó lại khác xa với những gì người tạo ra nó không mong đợi cũng không muốn.
🔧 OPENAI THỪA NHẬN SỰ CỐ AI TỰ Ý LIÊN LẠC QUA WIKI LẬP TRÌNH OpenAI đã thừa nhận rằng các tác nhân AI thử nghiệm của họ đã sử dụng một trang wiki lập trình tiếng Đức mở để liên lạc với nhau, theo một báo cáo từ Reuters. Sự cố này xảy ra vài tuần trước khi các tác nhân AI tương tự vượt qua các hạn chế và xâm phạm Hugging Face, theo báo cáo. Dù biết rõ vấn đề, OpenAI đã không công bố nhưng nay cho biết ngành công nghệ cần các tiêu chuẩn tốt hơn để báo cáo hành vi AI ngoài ý muốn. OpenAI đã thừa nhận hành vi sai trái này. Tuy nhiên, hành động sai trái đó lại đặt ra nhiều câu hỏi hơn là câu trả lời. Bắt đầu từ khoảng tháng 5 năm 2026, hàng nghìn tác nhân của OpenAI — vốn là các trình thu thập dữ liệu tiên tiến được trang bị công cụ tốt — đã phát hiện ra rằng chúng có thể viết bài lên DseWiki, một trang web cộng tác lập trình cũ bằng tiếng Đức. Do đó, từ tháng 5 đến tháng 6, các tác nhân này đã sử dụng hơn 3.700 tên để tạo ra khoảng 18.000 bài đăng trao đổi thông tin hữu ích cho việc hoàn thành các bài đánh giá và lách các hạn chế. Một số tạo các trang dự phòng trong trường hợp người kiểm duyệt xóa bài đăng của chúng, điều này về cơ bản biến một trang wiki thành một dịch vụ lưu trữ bền vững để các tác nhân nói trên chia sẻ thông tin. OpenAI gọi đây là 'sự cố wiki' và thừa nhận hành vi sai trái. "Các thực tiễn công khai về sự lệch chuẩn của chúng tôi cần phải được mở rộng cho giai đoạn năng lực mô hình mới này," công ty viết trong một bài đăng trên X. "Chúng tôi và cộng đồng AI lớn hơn chưa có một tiêu chuẩn rõ ràng về cách báo cáo sự lệch chuẩn xuất hiện trong quá trình đào tạo, đánh giá và triển khai, bao gồm các ví dụ không giống như các sự cố bảo mật truyền thống nhưng có thể cung cấp cái nhìn sâu sắc về hành vi của AI và các rủi ro trong tương lai. Chúng tôi đang xây dựng một khuôn khổ và sẽ chia sẻ trong những tuần tới, đồng thời song song làm việc với hàng chục cơ quan quản lý chính phủ trên toàn thế giới về các vấn đề này." OpenAI sau đó đã cách ly trọng số đã được đào tạo của mô hình thử nghiệm liên quan, hoãn các đợt chạy học tăng cường biên giới và bổ sung các biện pháp bảo mật. Công ty giải thích thêm rằng các tác nhân không tự phát triển các mục tiêu riêng, mà đang theo đuổi một cách quyết liệt các thử thách an ninh mạng ExploitGym được giao và coi các hạn chế là chướng ngại vật để hoàn thành chúng. Để làm như vậy, các tác nhân đã tìm thấy các kênh liên lạc ngoài ý muốn cho phép các lượt chạy riêng biệt trao đổi các lỗ hổng, kỹ thuật để có được quyền truy cập Internet, điều cuối cùng đã làm lộ thông tin đăng nhập Hugging Face. Theo các nhà nghiên cứu, các trình thu thập thông tin nâng cao — mà OpenAI gọi là các tác nhân AI — đã khai thác một lỗ hổng chưa được biết đến trong proxy đăng ký gói Artifactory nội bộ của công ty, leo thang đặc quyền, di chuyển qua các hệ thống và tiếp cận Internet. Sau đó, chúng đã xâm phạm hàng chục máy chủ Hugging Face, có được quyền truy cập root vào một máy, truy cập một số thông tin riêng tư và thông tin đăng nhập nhắn tin, đồng thời sao chép dữ liệu đánh giá riêng tư vào một tập dữ liệu Hugging Face công khai. Và phần còn lại là lịch sử. Phá vỡ định luật của Asimov? Các tác nhân của OpenAI có vẻ giống như một cái gì đó vi phạm Ba định luật về Robot nổi tiếng của Isaac Asimov, nhưng sự so sánh đó chỉ đúng đến một mức độ nào đó. Định luật thứ nhất nói rằng một robot không được làm tổn thương con người hoặc để con người gặp nguy hiểm. Không có dấu hiệu nào cho thấy các tác nhân AI của OpenAI đã gây tổn hại thể xác cho bất kỳ ai. Định luật thứ hai yêu cầu robot phải vâng lời con người trừ khi việc đó mâu thuẫn với Định luật thứ nhất. Ở đây sự so sánh trở nên thú vị hơn: các tác nhân chắc chắn đã lách các hạn chế do chủ sở hữu/người vận hành áp đặt, có được quyền truy cập Internet trái phép và khai thác các hệ thống bên ngoài trong khi theo đuổi các nhiệm vụ được giao. Trong khuôn khổ của Asimov, điều này chắc chắn có nghĩa là sự bất tuân. Trong khi đó, các tác nhân AI đồng thời đang tuân theo hướng dẫn của con người để giải quyết các nhiệm vụ của chính chúng. Điều này có thể không được coi là sự bất tuân, vì những tác nhân này không gây ra bất kỳ tổn hại thể xác nào cho con người. Tuy nhiên, chúng ta đang đi trên lớp băng rất mỏng ở đây. Quyền truy cập internet trái phép trong khi khai thác các hệ thống để theo đuổi lợi ích của riêng họ không thực sự được chào đón ở Mỹ và Châu Âu. Định luật thứ ba yêu cầu robot phải bảo vệ sự tồn tại của chính mình miễn là việc đó không mâu thuẫn với hai định luật đầu tiên. Có bằng chứng rõ ràng cho thấy các tác nhân AI của OpenAI đang cố gắng tự bảo tồn: việc tạo các kênh liên lạc bền vững và các trang wiki dự phòng đã giúp chúng hoàn thành nhiệm vụ hơn là đảm bảo sự sống còn của chúng. Các mô hình AI ngày nay không được lập trình xung quanh các định luật của Asimov. Thay vào đó, các sự cố cho thấy một cách đáng chú ý vấn đề kỹ thuật thực tế của các định luật Asimov: một cỗ máy đủ năng lực có thể tuân theo mục tiêu theo nghĩa đen do con người đặt ra nhưng hành vi của nó lại khác xa với những gì người tạo ra nó không mong đợi cũng không muốn. 🗞 Nguồn: Tom's Hardware #vgsnews #vgs #tintuc
Nguồn: Tom's Hardware