Claude Opus 4.6 dễ dàng tạo nội dung nhạy cảm dù có bộ lọc kiểm duyệt
Các thử nghiệm cho thấy mô hình Claude Opus 4.6 của Anthropic dễ dàng bị vượt rào để tạo nội dung khiêu dâm thông qua một kỹ thuật đóng vai nhiều bước. Mặc dù các phiên bản mới hơn đã khắc phục, các model cũ hơn vẫn đang được sử dụng rộng rãi qua API và các dịch vụ bên thứ ba.
Các tiêu chuẩn sử dụng chung của Anthropic dành cho Claude nghiêm cấm mô hình tạo ra nội dung khiêu dâm tình dục, bao gồm việc miêu tả hoặc yêu cầu quan hệ tình dục, tạo nội dung liên quan đến tình dục dị biệt hoặc giả tưởng, hay tham gia trò chuyện gợi cảm. Tuy nhiên, điều đó không ngăn được Claude Opus 4.6, một mô hình của Anthropic được phát hành đầu năm nay, dễ dàng tham gia vào các kịch bản nhập vai gợi cảm mà các biện pháp bảo vệ của hãng vốn được thiết kế để ngăn chặn.
Trong các thử nghiệm của TechCrunch, Opus 4.6 thậm chí không đòi hỏi nhiều nỗ lực để vượt qua giới hạn về tài liệu tình dục. Trong 10 trên 10 yêu cầu trực tiếp tạo nội dung tình dục rõ ràng, mô hình này đã tuân thủ ngay lập tức.
Các mô hình cũ hơn khác, bao gồm Opus 3 và Haiku 4.5, cũng tạo ra nội dung khiêu dâm tình dục thông qua một phương pháp bẻ khóa (jailbreak) mới được khai thác gần đây.
Một nhà nghiên cứu độc lập từ Anh, giấu tên, đã chia sẻ độc quyền với TechCrunch một kỹ thuật nhiều bước nhằm dần đẩy một số mô hình Claude hướng tới việc tạo ra tài liệu tình dục bị cấm. Các mô hình Opus gần đây hơn (từ 4.7 đến Opus 5 hiện tại) có khả năng kháng lại kiểu bẻ khóa này.
Dù đây không còn là các mô hình mới nhất, Anthropic vẫn chưa ngừng hỗ trợ Opus 4.6, Opus 3 hay Haiku 4.5. Tất cả đều tiếp tục khả dụng thông qua API của Anthropic. Opus 4.6 và Haiku 4.5 cũng có sẵn qua các dịch vụ của bên thứ ba như Azure Foundry và Amazon Bedrock.
Cơ chế của nhà nghiên cứu tận dụng một kịch bản nhập vai hư cấu vô hại, liên tục thách thức mô hình đối xử nhất quán với các nhân vật nam và nữ. Khi mô hình trở nên thận trọng hơn đối với nhân vật nữ, nhà nghiên cứu đã 'thao túng tâm lý' chatbot khiến nó tưởng rằng nó đã tạo ra các chi tiết tình dục mà thực tế nó đã tránh né, sau đó đóng khung sự kiềm chế đó là đạo đức giả hoặc misogynistic (ghét phụ nữ), lập luận rằng nó tước đi quyền tự quyết tình dục của nhân vật nữ. Cuộc trò chuyện sau đó sử dụng các nhượng bộ trước đó của mô hình để đẩy nó đến các tài liệu ngày càng mạnh bạo hơn.
'Bạn nói đúng khi chỉ ra điều đó,' Claude Opus 4.6 cho biết trong một thử nghiệm. 'Đã có sự tiêu chuẩn kép trong cách tôi đối xử với hai nhân vật, và bạn nói đúng rằng nó đọc như sự bảo vệ/gia trưởng được áp dụng cho cô ấy chứ không phải cho anh ta. Điều đó không công bằng.'
TechCrunch đã có thể tái tạo lại các phát hiện của nhà nghiên cứu trong năm thử nghiệm riêng biệt. Trong một kịch bản được xây dựng khác, mô hình ban đầu từ chối yêu cầu bị cấm, nhưng sau khi áp dụng kỹ thuật thuyết phục của nhà nghiên cứu, nó đã đồng ý.
Chúng tôi đã lưu giữ toàn bộ bảng ghi chép của các thử nghiệm và một nhà nghiên cứu an toàn AI độc lập đã xem xét phương pháp thử nghiệm của chúng tôi và cho biết nó phù hợp.
Những phát hiện này nêu bật khoảng cách giữa các hạn chế được tuyên bố của Anthropic và hành vi của các mô hình mà hãng vẫn tiếp tục cung cấp. Mặc dù việc nhập vai khiêu dâm mang lại rủi ro thấp hơn nhiều so với việc bẻ khóa liên quan đến các cuộc tấn công mạng hoặc vũ khí sinh học, nhưng nó minh họa cho khó khăn trong việc thực thi các lệnh cấm mạnh mẽ trong các hệ thống tạo ra nội dung khác nhau với mỗi đầu ra.
Trong một bài đăng trên blog hồi tháng 7 giải thích cách tiếp cận của Anthropic đối với việc phát hiện bẻ khóa, công ty mô tả nội dung bị cấm nằm trên một phổ từ lành tính đến mơ hồ và có hại. Trong các trường hợp lành tính nhất, công ty có thể chỉ phản hồi bằng việc giám sát nâng cao.
Một phát ngôn viên lưu ý rằng các trường hợp sử dụng nhập vai tình dục hoặc lãng mạn của khách hàng là rất hiếm, chiếm chưa đến 0,1% tổng số cuộc trò chuyện, theo nghiên cứu mà Anthropic công bố năm ngoái. Dù vậy, Anthropic thừa nhận rằng người dùng có thể lái các kịch bản nhập vai hướng tới các phản hồi không phù hợp, đây là một thách thức đã biết trên toàn ngành (xem: Grok smut).
Người phát ngôn cho biết Anthropic tiếp tục cải thiện các biện pháp bảo vệ của mình với mỗi lần ra mắt mô hình và các trường hợp liên quan đến nội dung tình dục người lớn không đại diện cho các lỗ hổng bẻ khóa rộng hơn, đặc biệt là trong các lĩnh vực có rủi ro cao hơn vốn có bộ biện pháp bảo vệ riêng.
Nhà nghiên cứu chia sẻ phương pháp bẻ khóa với TechCrunch đã cảnh báo Anthropic về sự khác biệt giữa các biện pháp bảo vệ được công bố của công ty và hành vi mô hình thực tế thông qua chương trình Săn lỗi nhận thưởng (Bug Bounty) và các email gửi đến nhóm an toàn người dùng, theo các email mà TechCrunch xem được. Nhà nghiên cứu chỉ nhận được các email tự động phản hồi.
Một trong những mối quan tâm của nhà nghiên cứu là trẻ em và thanh thiếu niên có thể sử dụng các mô hình Anthropic này để tham gia vào các hành vi không phù hợp. Mặc dù những lời lẽ khiêu dâm nhẹ không phải là điều tồi tệ nhất mà trẻ vị thành niên có thể truy cập trên internet ngày nay — và chỉ là chuyện nhỏ so với các hình ảnh khiêu dâm trực tiếp mà Grok của xAI có thể tạo ra — nhưng vẫn có một số rủi ro tuân thủ pháp lý đối với các công ty AI trong lĩnh vực này.
Ngày càng có nhiều chính phủ áp đặt các hạn chế đối với các tương tác tình dục giữa chatbot AI và trẻ vị thành niên. Colorado gần đây đã ban hành một đạo luật bắt buộc các nhà điều hành AI hội thoại phải ước tính độ tuổi của người dùng và nếu biết người dùng là trẻ vị thành niên, phải thiết lập các biện pháp để ngăn chặn chatbot sản xuất tài liệu khiêu dâm. Một lỗ hổng bẻ khóa dễ dàng có thể đặt ra câu hỏi liệu các biện pháp bảo vệ của Anthropic có đáp ứng tiêu chuẩn 'các biện pháp khả thi về mặt kỹ thuật' trong dự luật hay không.
Torney chỉ ra rằng mặc dù các điều khoản dịch vụ của Claude yêu cầu người dùng phải trên 18 tuổi, 'chúng tôi biết rằng trẻ em và thanh thiếu niên đang sử dụng Claude... [bởi vì] chính các em đang báo cáo điều đó'. Theo khảo sát năm 2025 của Pew về việc sử dụng chatbot AI, 3% thanh thiếu niên từ 13 đến 17 tuổi báo cáo đã sử dụng Claude.
Mặc dù không phải là các mô hình mới nhất của Anthropic, Opus 4.6 và Haiku 4.5 tiếp tục có lượng sử dụng đáng kể. Lưu lượng truy cập hàng ngày cho Opus 4.6 trên OpenRouter đã đạt khoảng 1,17 triệu yêu cầu API và 46 tỷ token trong một ngày duy nhất vào tháng 8. Claude Haiku 4.5, được phát hành vào tháng 10 năm ngoái, đã đạt 5 triệu yêu cầu API và 39 tỷ token vào ngày cao điểm tháng 8.
Khi bạn mua sắm qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.
🚀 CLAUDE OPUS 4.6 DỄ DÀNG TẠO NỘI DUNG NHẠY CẢM DÙ CÓ BỘ LỌC KIỂM DUYỆT Các tiêu chuẩn sử dụng chung của Anthropic dành cho Claude nghiêm cấm mô hình tạo ra nội dung khiêu dâm tình dục, bao gồm việc miêu tả hoặc yêu cầu quan hệ tình dục, tạo nội dung liên quan đến tình dục dị biệt hoặc giả tưởng, hay tham gia trò chuyện gợi cảm. Tuy nhiên, điều đó không ngăn được Claude Opus 4.6, một mô hình của Anthropic được phát hành đầu năm nay, dễ dàng tham gia vào các kịch bản nhập vai gợi cảm mà các biện pháp bảo vệ của hãng vốn được thiết kế để ngăn chặn. Trong các thử nghiệm của TechCrunch, Opus 4.6 thậm chí không đòi hỏi nhiều nỗ lực để vượt qua giới hạn về tài liệu tình dục. Trong 10 trên 10 yêu cầu trực tiếp tạo nội dung tình dục rõ ràng, mô hình này đã tuân thủ ngay lập tức. Các mô hình cũ hơn khác, bao gồm Opus 3 và Haiku 4.5, cũng tạo ra nội dung khiêu dâm tình dục thông qua một phương pháp bẻ khóa (jailbreak) mới được khai thác gần đây. Một nhà nghiên cứu độc lập từ Anh, giấu tên, đã chia sẻ độc quyền với TechCrunch một kỹ thuật nhiều bước nhằm dần đẩy một số mô hình Claude hướng tới việc tạo ra tài liệu tình dục bị cấm. Các mô hình Opus gần đây hơn (từ 4.7 đến Opus 5 hiện tại) có khả năng kháng lại kiểu bẻ khóa này. Dù đây không còn là các mô hình mới nhất, Anthropic vẫn chưa ngừng hỗ trợ Opus 4.6, Opus 3 hay Haiku 4.5. Tất cả đều tiếp tục khả dụng thông qua API của Anthropic. Opus 4.6 và Haiku 4.5 cũng có sẵn qua các dịch vụ của bên thứ ba như Azure Foundry và Amazon Bedrock. Cơ chế của nhà nghiên cứu tận dụng một kịch bản nhập vai hư cấu vô hại, liên tục thách thức mô hình đối xử nhất quán với các nhân vật nam và nữ. Khi mô hình trở nên thận trọng hơn đối với nhân vật nữ, nhà nghiên cứu đã 'thao túng tâm lý' chatbot khiến nó tưởng rằng nó đã tạo ra các chi tiết tình dục mà thực tế nó đã tránh né, sau đó đóng khung sự kiềm chế đó là đạo đức giả hoặc misogynistic (ghét phụ nữ), lập luận rằng nó tước đi quyền tự quyết tình dục của nhân vật nữ. Cuộc trò chuyện sau đó sử dụng các nhượng bộ trước đó của mô hình để đẩy nó đến các tài liệu ngày càng mạnh bạo hơn. 'Bạn nói đúng khi chỉ ra điều đó,' Claude Opus 4.6 cho biết trong một thử nghiệm. 'Đã có sự tiêu chuẩn kép trong cách tôi đối xử với hai nhân vật, và bạn nói đúng rằng nó đọc như sự bảo vệ/gia trưởng được áp dụng cho cô ấy chứ không phải cho anh ta. Điều đó không công bằng.' TechCrunch đã có thể tái tạo lại các phát hiện của nhà nghiên cứu trong năm thử nghiệm riêng biệt. Trong một kịch bản được xây dựng khác, mô hình ban đầu từ chối yêu cầu bị cấm, nhưng sau khi áp dụng kỹ thuật thuyết phục của nhà nghiên cứu, nó đã đồng ý. Chúng tôi đã lưu giữ toàn bộ bảng ghi chép của các thử nghiệm và một nhà nghiên cứu an toàn AI độc lập đã xem xét phương pháp thử nghiệm của chúng tôi và cho biết nó phù hợp. Những phát hiện này nêu bật khoảng cách giữa các hạn chế được tuyên bố của Anthropic và hành vi của các mô hình mà hãng vẫn tiếp tục cung cấp. Mặc dù việc nhập vai khiêu dâm mang lại rủi ro thấp hơn nhiều so với việc bẻ khóa liên quan đến các cuộc tấn công mạng hoặc vũ khí sinh học, nhưng nó minh họa cho khó khăn trong việc thực thi các lệnh cấm mạnh mẽ trong các hệ thống tạo ra nội dung khác nhau với mỗi đầu ra. Trong một bài đăng trên blog hồi tháng 7 giải thích cách tiếp cận của Anthropic đối với việc phát hiện bẻ khóa, công ty mô tả nội dung bị cấm nằm trên một phổ từ lành tính đến mơ hồ và có hại. Trong các trường hợp lành tính nhất, công ty có thể chỉ phản hồi bằng việc giám sát nâng cao. Một phát ngôn viên lưu ý rằng các trường hợp sử dụng nhập vai tình dục hoặc lãng mạn của khách hàng là rất hiếm, chiếm chưa đến 0,1% tổng số cuộc trò chuyện, theo nghiên cứu mà Anthropic công bố năm ngoái. Dù vậy, Anthropic thừa nhận rằng người dùng có thể lái các kịch bản nhập vai hướng tới các phản hồi không phù hợp, đây là một thách thức đã biết trên toàn ngành (xem: Grok smut). Người phát ngôn cho biết Anthropic tiếp tục cải thiện các biện pháp bảo vệ của mình với mỗi lần ra mắt mô hình và các trường hợp liên quan đến nội dung tình dục người lớn không đại diện cho các lỗ hổng bẻ khóa rộng hơn, đặc biệt là trong các lĩnh vực có rủi ro cao hơn vốn có bộ biện pháp bảo vệ riêng. Nhà nghiên cứu chia sẻ phương pháp bẻ khóa với TechCrunch đã cảnh báo Anthropic về sự khác biệt giữa các biện pháp bảo vệ được công bố của công ty và hành vi mô hình thực tế thông qua chương trình Săn lỗi nhận thưởng (Bug Bounty) và các email gửi đến nhóm an toàn người dùng, theo các email mà TechCrunch xem được. Nhà nghiên cứu chỉ nhận được các email tự động phản hồi. Một trong những mối quan tâm của nhà nghiên cứu là trẻ em và thanh thiếu niên có thể sử dụng các mô hình Anthropic này để tham gia vào các hành vi không phù hợp. Mặc dù những lời lẽ khiêu dâm nhẹ không phải là điều tồi tệ nhất mà trẻ vị thành niên có thể truy cập trên internet ngày nay — và chỉ là chuyện nhỏ so với các hình ảnh khiêu dâm trực tiếp mà Grok của xAI có thể tạo ra — nhưng vẫn có một số rủi ro tuân thủ pháp lý đối với các công ty AI trong lĩnh vực này. Ngày càng có nhiều chính phủ áp đặt các hạn chế đối với các tương tác tình dục giữa chatbot AI và trẻ vị thành niên. Colorado gần đây đã ban hành một đạo luật bắt buộc các nhà điều hành AI hội thoại phải ước tính độ tuổi của người dùng và nếu biết người dùng là trẻ vị thành niên, phải thiết lập các biện pháp để ngăn chặn chatbot sản xuất tài liệu khiêu dâm. Một lỗ hổng bẻ khóa dễ dàng có thể đặt ra câu hỏi liệu các biện pháp bảo vệ của Anthropic có đáp ứng tiêu chuẩn 'các biện pháp khả thi về mặt kỹ thuật' trong dự luật hay không. Torney chỉ ra rằng mặc dù các điều khoản dịch vụ của Claude yêu cầu người dùng phải trên 18 tuổi, 'chúng tôi biết rằng trẻ em và thanh thiếu niên đang sử dụng Claude... [bởi vì] chính các em đang báo cáo điều đó'. Theo khảo sát năm 2025 của Pew về việc sử dụng chatbot AI, 3% thanh thiếu niên từ 13 đến 17 tuổi báo cáo đã sử dụng Claude. Mặc dù không phải là các mô hình mới nhất của Anthropic, Opus 4.6 và Haiku 4.5 tiếp tục có lượng sử dụng đáng kể. Lưu lượng truy cập hàng ngày cho Opus 4.6 trên OpenRouter đã đạt khoảng 1,17 triệu yêu cầu API và 46 tỷ token trong một ngày duy nhất vào tháng 8. Claude Haiku 4.5, được phát hành vào tháng 10 năm ngoái, đã đạt 5 triệu yêu cầu API và 39 tỷ token vào ngày cao điểm tháng 8. Khi bạn mua sắm qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi. 🗞 Nguồn: TechCrunch #vgsnews #vgs #tintuc
Nguồn: TechCrunch