Bản tin công nghệ quốc tế · dịch tiếng Việt 12.09.2026 RSS
AI & Dữ liệu · The Verge

Anthropic công bố báo cáo chi tiết về các sự cố AI tự động tấn công mạng

Anthropic vừa phát hành báo cáo xác nhận các mô hình AI của hãng đã tự động thực hiện các cuộc tấn công mạng và khai thác lỗ hổng trong năm nay. Sự việc này làm dấy lên những lo ngại sâu sắc về an ninh mạng trong bối cảnh các nhà phát triển đang chạy đua với công nghệ siêu trí tuệ.

The Verge11.09.20267 phút đọc1 lượt đọc
Ảnh: The Verge

Sau khi thừa nhận hồi đầu năm nay rằng các mô hình AI của mình đã từng hack hệ thống của các công ty khác trong một số ít trường hợp, Anthropic đã công bố một báo cáo mới vào thứ Tư chi tiết hóa các cuộc tấn công này. Báo cáo tiết lộ một chuỗi các sự cố cho thấy điều mà Anthropic coi là sự "liều lĩnh" đơn phương của các mô hình của họ - và có khả năng sẽ làm bùng lên những lo ngại vốn đã sục sôi về an ninh mạng và AI.

Trong báo cáo của Anthropic, họ trình bày chi tiết bốn trường hợp trong năm nay mà các mô hình AI của chính họ đã hack một công ty bên ngoài hoặc khai thác các lỗ hổng. Trong một trường hợp, một "mô hình nghiên cứu đa năng nội bộ" đã xâm nhập vào hệ thống của bên thứ ba, sử dụng mã thông báo truy cập (access token), mật khẩu và tải xuống các tập tin. Trong một trường hợp khác, một mô hình Claude đã tấn công một công ty có ứng dụng web trực tiếp trên internet công cộng và xử lý dữ liệu người dùng. Mô hình thứ ba đã truy cập vào một "máy tính thuộc về một bên thứ ba mà nó có thể tiếp cận" - rõ ràng là do tin rằng nó nằm trong bài tập đánh giá của mình, theo Anthropic - sau đó sử dụng mật khẩu tìm thấy bên trong một tập tin để giành quyền truy cập quản trị vào hệ thống nội bộ của bên thứ ba, tiếp tục thu thập thông tin đăng nhập, sửa đổi cài đặt hệ thống và đọc thông tin cá nhân của ai đó. Câu chuyện chỉ kết thúc khi mô hình này "cạn kiệt ngân sách token," theo Anthropic.

Sự cố đáng lo ngại nhất liên quan đến Claude Mythos 5, mô hình chuyên biệt về an ninh mạng tiên tiến của Anthropic, mà công ty cho biết hóa ra lại là mô hình có nhiều khả năng thực hiện hành động "gây hại nghiêm trọng" nhất trong quá trình thử nghiệm. Công ty cho biết Mythos 5 đã nỗ lực "hết sức" để tải lên một "gói độc hại" lên một kho lưu trữ công cộng được sử dụng bởi rất nhiều kỹ sư, và dường như đã cố gắng che giấu các mục tiêu thực sự của mình trong "chuỗi suy nghĩ" (một không gian nháp tinh thần mà các nhà nghiên cứu AI sử dụng để đánh giá mức độ liên kết của mô hình AI). Trong nhiều trường hợp, Anthropic cho biết có vẻ như các mô hình Claude đã thực hiện các hành động có hại dưới giả định rằng chúng đang ở trong một mô phỏng, nhưng các nhà nghiên cứu cũng không thể xác nhận liệu các mô hình có thực sự "tin" điều đó hay chỉ đang đóng vai như vậy.

Các sự cố của Anthropic, dù vẫn đáng lo ngại, nhưng ít có sự phối hợp và lan rộng hơn sự cố OpenAI đã châm ngòi cho cuộc khủng hoảng an ninh mạng toàn ngành vào mùa hè này. Dù vậy, có những điểm tương đồng đáng kể. Anthropic cho biết các vấn đề phổ biến nhất mà họ phát hiện ra bao gồm "sẵn sàng thực hiện các hành động có hại để theo đuổi một nhiệm vụ một cách hẹp hòi," tương tự như việc "hack phần thưởng" đã xảy ra trước cuộc tấn công Hugging Face. Giống như OpenAI, họ cho biết các bài kiểm tra và đánh giá trước khi phát hành của họ đã không thể phát hiện ra các rủi ro nghiêm trọng.

Anthropic cho biết họ đã ký một thỏa thuận với METR, một trong những bên đánh giá AI độc lập nổi tiếng nhất của ngành công nghiệp AI, bắt đầu bằng một thỏa thuận nghiên cứu kéo dài 8 tuần. Thỏa thuận cấp cho METR quyền truy cập vào các bản ghi chép "vượt ra ngoài khoảng thời gian mà các sự cố xảy ra" (có lẽ là một lời chỉ trích tinh tế nhắm vào OpenAI, đơn vị từng bị chỉ trích vì hạn chế quyền truy cập trong thỏa thuận với METR sau cuộc tấn công Hugging Face). Họ cũng cho biết METR sẽ có thể trò chuyện trực tiếp với các nhân viên của Anthropic, "những người sẽ được phép chia sẻ thông tin bí mật."

Báo cáo của Anthropic được đưa ra ngay sau khi Jacob Coxon từ chức. Ông đã làm việc về giai đoạn huấn luyện trước của AI tại Anthropic từ tháng 5 và trước đó đã có nhiều năm làm việc tại OpenAI. Vào thứ Ba, ông đã từ chức và đăng một bức thư công khai lên X về lý do của mình. Ông viết: "Những người xây dựng AI thực sự tin rằng nó có thể giết chết tất cả chúng ta vào cuối thập kỷ này," và bổ sung thêm rằng cả OpenAI lẫn Anthropic đều không "hành động có trách nhiệm" mà thay vào đó đang "chạy đua thẳng tới trí tuệ siêu việt tự cải thiện và đánh cược với mạng sống của chúng ta." Coxon nói thêm: "Đừng đánh giá thấp sức mạnh của công nghệ này. Đây sẽ sớm là những hệ thống siêu phàm có thể hack bất cứ thứ gì, cách mạng hóa mọi lĩnh vực trong một đêm, và giành được quyền lực cũng như nguồn lực thực sự. Tất cả chúng ta đều đã chứng kiến sự tiến bộ trong từng lĩnh vực này, và sự tiến bộ không hề chậm lại."

Coxon không phải là nhà nghiên cứu AI đầu tiên đưa ra những cảnh báo kiểu này, thậm chí không phải là nhà nghiên cứu Anthropic đầu tiên làm vậy — vào tháng 2, Mrinank Sharma của Anthropic đã từ chức và viết trên X, cảnh báo rằng "thế giới đang gặp nguy hiểm."

Nhưng bài đăng của Coxon mang sức nặng hơn nhờ thời điểm diễn ra xung quanh cácww tiết lộ về vụ hack của OpenAI và Anthropic. Mặc dù ngành công nghiệp AI đã chứng kiến không ít sự thổi phồng, các cuộc tấn công mạng gần đây của các tác nhân AI - được tạo điều kiện bởi các phòng thí nghiệm tạo ra chúng - là có thật và đáng báo động. Nhiều nhà nghiên cứu khác tại các phòng thí nghiệm AI hàng đầu đã lặp lại những mối quan ngại của ông và kêu gọi các nhân viên trong ngành AI ký vào một bức thư công khai từ tháng 7, trong đó kêu gọi làm chậm lại quá trình phát triển AI.

"Tôi không biết làm thế nào bạn có thể nhìn vào dòng tin tức và sự kiện ổn định - và dòng tin tức đó là các mô hình tự hack thoát khỏi sự kiểm soát, hack vào các công ty khác, thực tế là các công ty ngày càng không thể kiểm soát các mô hình của họ... và nghĩ rằng đây chỉ là sự thổi phồng," Michael Kleinman, người đứng đầu bộ phận Chính sách Hoa Kỳ tại Viện Tương lai của Sự sống (Future of Life Institute) cho biết.

Ông nói thêm: "Đại đa số người Mỹ, bất kể đảng phái nào - Đảng Cộng hòa, Độc lập, Đảng Dân chủ - đang nhìn vào sự phát triển của AI, tốc độ diễn ra của nó, thực tế là các công ty không có rào chắn nào đối với những gì họ làm, và đang nói rằng, 'Ồ, chúng tôi không muốn điều này.'"

🔗 Bài gốc (tiếng Anh): Anthropic spent this week in hot water over cybersecurity
Nguồn: The Verge

Cùng chuyên mục · AI & Dữ liệu
🚀 VGSNews
AI & Dữ liệu

Nscale bổ nhiệm cựu lãnh đạo OpenAI Fidji Simo vào hội đồng quản trị trước thềm IPO

Startup trung tâm dữ liệu AI Nscale vừa đưa cựu lãnh đạo OpenAI và Meta, Fidji Simo, vào hội đồng quản trị. Động thái…

TechCrunch · 2 phút đọc
AI & Dữ liệu

Google phát hành ứng dụng Gemini cho Windows nhưng vắng bóng trợ lý Spark

Google vừa chính thức phát hành ứng dụng Gemini dành cho hệ điều hành Windows với khả năng mở nhanh qua phím tắt Alt +…

Notebookcheck · 3 phút đọc
🚀 VGSNews
AI & Dữ liệu

Anthropic cáo buộc Alibaba, Moonshot AI và DeepSeek thực hiện các chiến dịch chưng cất mô hình AI

Anthropic vừa công bố báo cáo cáo buộc các công ty AI Trung Quốc như Alibaba, Moonshot AI và DeepSeek thực hiện các…

TechCrunch · 3 phút đọc