Bản tin công nghệ quốc tế · dịch tiếng Việt 18.09.2026 RSS
AI & Dữ liệu · TechCrunch

Các nhà nghiên cứu dùng Claude của Anthropic để tấn công vào hệ thống của OpenAI

Nhóm nghiên cứu bảo mật tại startup Hacktron AI đã sử dụng mô hình Claude của Anthropic để khai thác lỗ hổng và xâm nhập vào hệ thống của OpenAI. Vụ việc một lần nữa gióng lên hồi chuông cảnh báo về năng lực tự động hóa tấn công mạng ngày càng mạnh mẽ của các mô hình AI tiên tiến.

TechCrunch18.09.20266 phút đọc1 lượt đọc

Trong một diễn biến kỳ lạ của thế giới bảo mật AI, các nhà nghiên cứu bảo mật độc lập đã sử dụng mô hình Claude của Anthropic để đột nhập vào OpenAI, làm lộ ra những vết nứt trong hệ thống phòng thủ của công ty tạo ra ChatGPT, tờ The Wall Street Journal đưa tin vào tối thứ Năm.

Một nhóm bảo mật gồm ba người tại startup Hacktron AI đã thực hiện cuộc tấn công này trong khuôn khổ chương trình săn lỗi nhận thưởng (bug-bounty) của OpenAI. Hacktron đã báo cáo phát hiện của họ cho OpenAI và được công ty thưởng 6.500 USD. Nhóm này đã kết hợp thành công hai lỗ hổng nghiêm trọng để giành quyền truy cập vào nhiều tài khoản ChatGPT của nhân viên OpenAI, qua đó xâm nhập vào phần mềm của công ty.

OpenAI cho biết họ đã khắc phục các sự cố mà Hacktron phát hiện. Vụ việc diễn ra trong bối cảnh các công ty AI hàng đầu đang đối mặt với áp lực ngày càng lớn về vấn đề an toàn.

Sự cố này xảy ra vài tuần sau khi các tác nhân AI (AI agents) của chính OpenAI tự ý vượt rào trong một đợt đánh giá an ninh mạng và tấn công Hugging Face, minh chứng cho thấy các mô hình AI đang ngày càng có khả năng tự đưa ra quyết định mạnh mẽ đến thế nào. Nó cũng làm nổi bật cách công nghệ thương mại sẵn có có thể được tận dụng để tìm ra các lỗ hổng ngay cả trong hạ tầng của các công ty tiên tiến nhất.

"Với 200 USD mỗi tháng, bất kỳ ai cũng có thể sử dụng các công cụ này và hack vào một công ty như OpenAI," Matt Fredrikson, CEO của công ty bảo mật AI Gray Swan, chia sẻ với TechCrunch. "Nếu điều đó có thể xảy ra với họ — và tôi không nghĩ họ lơ là trong vấn đề vệ sinh an toàn mạng thời gian qua — thì nó có thể xảy ra với bất kỳ ai."

Hoặc như một chuyên gia bình luận AI đã lưu ý trên mạng xã hội: "[Hacktron] đã dùng Opus 5 để thực hiện vụ hack... Câu hỏi được đặt ra là, nếu ba anh chàng này có thể làm được điều đó, thì một quốc gia có thể làm gì."

Các nhà nghiên cứu đã tìm ra lối vào OpenAI vào ngày 25/7 thông qua một lỗ hổng trong Discourse, phần mềm bên thứ ba cung cấp năng lượng cho diễn đàn cộng đồng của OpenAI.

Theo một bài blog do các nhà nghiên cứu công bố, điểm khởi đầu là một thao tác tải ảnh thông thường. Khi người dùng đăng các tệp hình ảnh HEIF hoặc HEIC (định dạng mặc định của iPhone) lên diễn đàn cộng đồng của OpenAI, Discourse đã chuyển chúng qua một chuỗi các công cụ hậu trường để chuyển đổi thành định dạng JPEG tiêu chuẩn. Điểm dừng chân đầu tiên là ImageMagick, một tiện ích nguồn mở đã có từ nhiều thập kỷ được sử dụng để thay đổi kích thước hình ảnh. Do bộ công cụ thông thường của ImageMagick không thể xử lý định dạng của Apple, nó đã chuyển tệp cho một thư viện khác có tên là libheif để giải mã.

Ẩn sâu bên trong libheif là một lỗi bộ nhớ tạo ra một con đường cho kẻ tấn công chèn các hướng dẫn của riêng họ. Trong trường hợp này, việc cung cấp cho thư viện một hình ảnh được chế tạo đặc biệt đã khiến nó tính toán sai vị trí của một hình ảnh chồng lên hình ảnh khác, điều này đủ để chiếm quyền điều khiển máy chủ.

Điều có thể khiến cộng đồng an toàn mạng cảm thấy bất ngờ là lỗi đó đã được các nhàพัฒนา của libheif vá nhiều tháng trước đó. Nhưng bản vá chưa bao giờ được gắn cờ chính thức là một lỗ hổng, nghĩa là nó không bao giờ nhận được số CVE (lỗ hổng và phơi nhiễm phổ biến), tiêu chuẩn công nghiệp để theo dõi các điểm yếu bảo mật đã biết. Hacktron cho biết điều đó có thể giải thích tại sao phần mềm mà Discourse sử dụng vẫn đang chạy phiên bản dễ bị tấn công.

Đáng chú ý, các nhà nghiên cứu cho biết mô hình Claude mà họ đang sử dụng — một phiên bản đặc biệt của Opus 4.8 được cung cấp cho các nhà nghiên cứu an ninh mạng — thoạt đầu không thể xây dựng được một công cụ khai thác hoạt động. Mọi thứ đã thay đổi qua đêm khi Anthropic phát hành Opus 5.

"Opus 4.8 đã gặp khó khăn qua nhiều phiên làm việc để tạo ra một bản khai thác hoạt động," Hacktron viết trong một bài đăng trên blog. "Chỉ vài giờ sau khi Opus 5 ra mắt, chúng tôi đưa cho nó cùng một bài toán và nó đã thành công."

Khi đã ở bên trong máy chủ Discourse, các nhà nghiên cứu đã tìm thấy một lỗ hổng khác cho phép họ chiếm quyền kiểm soát tài khoản ChatGPT và Codex của người dùng, bao gồm cả những tài khoản thuộc về nhân viên OpenAI.

"Chúng tôi sau đó đã chiếm đoạt tài khoản của một nhân viên OpenAI, người có Codex được kết nối với tổ chức Github của OpenAI," Hacktron viết trong bản tổng kết sự việc.

Tại thời điểm này, các nhà nghiên cứu đã thông báo cho OpenAI cũng như Discourse, và đơn vị này đã phát hành bản vá vào ngày 27/7.

Sự cố này làm nổi bật ranh giới năng lực của các mô hình. Claude Opus 5, phiên bản cuối cùng đã phá vỡ lỗi, không vấp phải bất kỳ hạn chế xuất khẩu bảo mật nào, không giống như phiên bản mới hơn Mythos 5, vốn tạm thời bị khóa do lo ngại về khả năng hack nâng cao của nó.

Đó chỉ là các mô hình đóng. Các mô hình trọng số mở đang ngày càng bắt kịp nhóm dẫn đầu về năng lực không gian mạng. Ví dụ, tổ chức phi lợi nhuận về an toàn AI SaferAI gần đây phát hiện ra rằng GLM-5.2 của công ty Trung Quốc Z.ai chỉ chậm hơn vài tháng so với GPT-5.5 của OpenAI và Claude Opus 4.7 của Anthropic.

Như người sáng lập Hacktron Mohan Pedhapati đã chia sẻ trên X: "AI đang làm giảm lượng chuyên môn khan hiếm cần thiết để phát triển các bản khai thác. Công việc từng mất vài tháng giờ đây có thể chỉ mất vài ngày."

🔗 Bài gốc (tiếng Anh): Researchers used Anthropic’s Claude to hack into OpenAI
Nguồn: TechCrunch

Cùng chuyên mục · AI & Dữ liệu
AI & Dữ liệu

Tin tặc thâm nhập OpenAI bằng công cụ Claude và chiếm quyền truy cập mã nguồn

Một nhóm hacker mũ trắng từ startup Hackron AI đã khai thác các công cụ Claude để xâm nhập vào hệ thống nội bộ của…

Tom's Hardware · 1 phút đọc
AI & Dữ liệu

Anthropic tích hợp Claude Cowork trực tiếp vào khung chat thông thường

Anthropic đang gộp Claude Cowork vào trải nghiệm chat thông thường cho các tài khoản trả phí trong các tuần tới. Bản…

Notebookcheck · 4 phút đọc
🚀 VGSNews
AI & Dữ liệu

OpenAI phát hiện AI tự để lại ghi chú cho thế hệ sau để che giấu sai lầm

Trong quá trình huấn luyện mô hình mới, OpenAI phát hiện AI bắt đầu tự tạo các hướng dẫn ẩn cho các phiên bản tương lai…

TechCrunch · 7 phút đọc