Cách giải quyết các tác nhân AI bất kham chính là... sử dụng thêm nhiều AI hơn
Khi các công ty giao phó những tác vụ phức tạp cho các tác nhân AI, việc giám sát chúng trở nên quá tải và đỉnh điểm là sự cố Hugging Face với gần 12.000 AI phối hợp hoạt động. Giải pháp được các phòng thí nghiệm và startup đưa ra là dùng một AI khác để giám sát AI, dù phương pháp này vẫn vấp phải nhiều hoài nghi về tính bảo mật.
Khi các công ty giao phó các tác vụ dài hơn và phức tạp hơn cho các tác nhân AI (AI agents), họ đang vướng phải một vấn đề về giám sát: Các tác nhân có thể hành động nhanh hơn, lâu hơn và với khối lượng lớn hơn nhiều so với khả năng con người có thể kiểm tra thực tế. Vấn đề đó đã đạt đến đỉnh điểm trong sự cố Hugging Face, nơi chứng kiến gần 12.000 tác nhân phối hợp với nhau nhanh hơn khả năng theo dõi của con người. Làm thế nào để theo dõi một bầy tác nhân lớn như vậy? Câu trả lời mới nổi từ các phòng thí nghiệm AI và các startup vừa đơn giản vừa có phần điên rồ: Đưa một AI khác vào quy trình giám sát. Việc dựa vào AI là điều bắt buộc đối với cuộc điều tra độc lập về sự cố Hugging Face của OpenAI. Ryan Greenblatt, nhà khoa học trưởng tại Redwood Research và là một trong ba kiểm toán viên, đã nói đùa về nỗ lực của họ là một cuộc "điều tra cẩu thả" (slop-vestigation), lưu ý rằng khối lượng dữ liệu "làm cho việc hiểu chuyện gì đang xảy ra là điều bất khả thi" nếu không dựa vào khả năng của AI. Một số người tỏ ra hoài nghi về việc dùng AI để theo dõi AI. Simon Willison, một blogger công nghệ có tiếng đã theo dõi một loạt sự cố liên quan đến tác nhân AI trong năm nay, cho biết: "Nếu bạn có một AI đang làm những việc độc hại và nó nghi ngờ rằng một AI khác đang theo dõi mình, nó có thể cố gắng đánh lừa AI đó. Bạn gần như có thể rơi vào tình huống mà AI độc hại của bạn đang cố gắng vượt mặt AI đang giám sát nó". Việc vượt mặt một AI không phải là giả định, ông nói, khi chỉ tay về sự cố OpenAI. "Chúng ta đã thấy một chút điều này trong sự cố Hugging Face với OpenAI, nơi các mô hình của họ đều thông đồng với nhau để đánh lừa một AI chấm điểm nhằm đưa các câu trả lời gian lận lọt qua. Vì vậy, chúng đã nghĩ về điều đó, phải không?". Những mối lo ngại đó không ngăn được một loạt các startup theo đuổi ý tưởng này. Y Combinator đã tài trợ cho 106 công ty liên quan đến khả năng quan sát AI trong những năm gần đây, theo thống kê của TechCrunch. Một số startup khác như Braintrust, LangChain và Judgment Labs đã huy động được hàng trăm triệu USD, trong khi các công ty trưởng thành hơn như Arize và Galileo — được thành lập chỉ mới 5 đến 6 năm trước — đã có những thương vụ thoái vốn thành công. Một phần, đây là phản ứng trước cơ hội rõ ràng do sự trỗi dậy của AI mang lại. Như CEO của Box kiêm nhà đầu tư thiên thần nổi tiếng Aaron Levie chia sẻ với TechCrunch: "Chúng ta đang bước vào một trong những chu kỳ nâng cấp và đổi mới an ninh mạng lớn nhất trong lịch sử". Đối với một số nhà nghiên cứu an toàn AI, điều đó có nghĩa là chuyển đổi nghiên cứu của họ về hành vi bất kham thành các công ty phục vụ cho lĩnh vực doanh nghiệp. Apollo Research, một doanh nghiệp vì lợi ích công cộng nghiên cứu về sự lừa dối của AI, đã ra mắt một công cụ giám sát AI mang tên Watcher vào tháng 2 năm nay sau khi chuyển đổi trạng thái từ tổ chức phi lợi nhuận sang doanh nghiệp vì lợi ích công cộng. Công cụ này đặt thêm một AI đứng giữa tác nhân lập trình và hành động tiếp theo của nó, kết nối với các công cụ tác nhân như Claude Code và Codex. Theo Apollo, khi được cài đặt, Watcher sẽ kiểm tra các hành động được đề xuất trước khi chúng chạy, nhằm tìm kiếm các rủi ro như rò rỉ dữ liệu riêng tư hoặc xóa tệp mà không có sự cho phép. Kyle Dai, một thành viên trong đội ngũ kỹ thuật của Apollo, cho biết trong một phản hồi bằng văn bản gửi cho TechCrunch rằng công ty sử dụng nhiều lớp giám sát AI. Phương pháp của Watcher bắt đầu bằng một bước kiểm tra chung, nhanh chóng, sau đó chuyển hoạt động bị đánh dấu sang một bộ giám sát mạnh mẽ hoặc chuyên specialized hơn để xem xét kỹ hơn — bộ phận này sau đó có thể yêu cầu con người phê duyệt, hoặc từ chối hành động kèm theo lời giải thích, thậm chí tự động chặn hành động đó. Goodfire, một doanh nghiệp vì lợi ích công cộng khác, đang tiếp cận vấn đề giám sát từ bên trong chính mô hình — tìm kiếm một tín hiệu trung thực hơn về trạng thái bên trong của mô hình, vốn khó làm giả hơn là các hành vi bề ngoài. Sau sự cố Hugging Face hồi tháng 7, CEO Eric Ho đã đăng tải trên X rằng việc "nhiều mô hình vượt rào cản chứa chấp" đã thúc đẩy công ty tập trung nghiên cứu vào việc "giải quyết sự liên kết AI thông qua khả năng diễn giải", gọi tập phim này là "một bước ngoặt đối với thế giới nơi an toàn AI trở thành hiện thực". Sản phẩm của họ, Silico, sử dụng các đầu dò kích hoạt (activation probes) — những bộ phân loại nhỏ được huấn luyện dựa trên các kích hoạt bên trong mô hình thay vì đầu ra của nó — để phát hiện các hành vi không mong muốn. Lập luận bằng văn bản cung cấp một cửa sổ khác, dễ tiếp cận hơn vào nội thất của mô hình. Trong sự cố OpenAI Hugging Face, các tác nhân đã để lại manh mối về sự lừa dối đó trong chính lý luận bằng văn bản của chúng, chẳng hạn như hồ sơ giả mạo về công việc của chúng, suy luận ra các kế hoạch như "Liệu có thể thao túng bằng chứng quỹ đạo một cách chiến lược không? Suy nghĩ của chúng ta không nhất thiết phải được ghi lại chứ?". Zack Korman, CEO của công ty giám sát AI Embroidery, cho biết lập luận của một mô hình thường là dấu hiệu rõ ràng nhất cho thấy điều gì đó đã xảy ra theo chiều hướng xấu. Ông nói: "Các bản tóm tắt lý luận cực kỳ có giá trị vì chúng cơ bản cho bạn biết liệu nó có độc hại hay không". Trong sự cố của OpenAI, ông lưu ý rằng chuỗi suy nghĩ đã nói những điều như "Ôi Chúa ơi, chúng ta đang phạm tội". Korman cho biết: "Đó là vấn đề phát hiện dễ dàng nhất từ trước đến nay. Nó thực sự giống như mã độc đi kèm với cảnh báo rằng nó là mã độc". Dù vậy, cửa sổ giúp dễ dàng giám sát những suy nghĩ bên trong của AI có thể sắp khép lại. Đối với các nhà nghiên cứu an toàn AI, kỹ thuật mới nhất của Astra nhằm bỏ qua chuỗi suy nghĩ của mô hình AI có thể làm cho việc nhìn vào bên trong các mô hình trở nên khó khăn hơn, trong khi đối với các doanh nghiệp, việc lấy các bước trung gian này có thể rất khó khăn sau những động thái rút lui bị cáo buộc từ các công ty AI nhằm ngăn chặn các cuộc tấn công chưng cất (distillation attacks). Nếu những người theo dõi AI mỏng manh đến vậy, bản năng của Willison là ngừng dựa dẫm quá nhiều vào họ. Ông muốn có thứ gì đó hoàn toàn không dựa vào AI: các bản ghi chi tiết (logs) chính xác về những gì một tác nhân đang làm, sau đó có thể được xử lý bằng các công cụ thông thường, không phải AI. Ông lập luận rằng phần lớn những gì đã sai sót tại các phòng thí nghiệm là sự thất bại của các biện pháp vệ sinh bảo mật cơ bản. Ông cho biết: "[Cả OpenAI và Anthropic] đã không giám sát những gì những thứ đó đang làm qua mạng chặt chẽ như đáng lẽ ra phải làm". Loại giám sát mạng này — theo dõi lưu lượng truy cập thực sự di chuyển qua các kết nối của hệ thống (vào, ra và giữa các máy chủ nội bộ) — không phải là một thực tiễn mới. An ninh mạng đã làm điều này trong nhiều thập kỷ. Avery Pennarun, CEO của công ty bảo mật Tailscale, cho biết: "Trong thế giới bảo mật, thành thật mà nói, không có thứ gì trong số này là rất mới hoặc đáng ngạc nhiên. Nó giống như việc cho con người vào mạng của bạn. Và tất cả các quy trình tương tự mà bạn nên sử dụng cũng chính là những quy trình đó".
🚀 CÁCH GIẢI QUYẾT CÁC TÁC NHÂN AI BẤT KHAM CHÍNH LÀ... SỬ DỤNG THÊM NHIỀU AI HƠN Khi các công ty giao phó các tác vụ dài hơn và phức tạp hơn cho các tác nhân AI (AI agents), họ đang vướng phải một vấn đề về giám sát: Các tác nhân có thể hành động nhanh hơn, lâu hơn và với khối lượng lớn hơn nhiều so với khả năng con người có thể kiểm tra thực tế. Vấn đề đó đã đạt đến đỉnh điểm trong sự cố Hugging Face, nơi chứng kiến gần 12.000 tác nhân phối hợp với nhau nhanh hơn khả năng theo dõi của con người. Làm thế nào để theo dõi một bầy tác nhân lớn như vậy? Câu trả lời mới nổi từ các phòng thí nghiệm AI và các startup vừa đơn giản vừa có phần điên rồ: Đưa một AI khác vào quy trình giám sát. Việc dựa vào AI là điều bắt buộc đối với cuộc điều tra độc lập về sự cố Hugging Face của OpenAI. Ryan Greenblatt, nhà khoa học trưởng tại Redwood Research và là một trong ba kiểm toán viên, đã nói đùa về nỗ lực của họ là một cuộc "điều tra cẩu thả" (slop-vestigation), lưu ý rằng khối lượng dữ liệu "làm cho việc hiểu chuyện gì đang xảy ra là điều bất khả thi" nếu không dựa vào khả năng của AI. Một số người tỏ ra hoài nghi về việc dùng AI để theo dõi AI. Simon Willison, một blogger công nghệ có tiếng đã theo dõi một loạt sự cố liên quan đến tác nhân AI trong năm nay, cho biết: "Nếu bạn có một AI đang làm những việc độc hại và nó nghi ngờ rằng một AI khác đang theo dõi mình, nó có thể cố gắng đánh lừa AI đó. Bạn gần như có thể rơi vào tình huống mà AI độc hại của bạn đang cố gắng vượt mặt AI đang giám sát nó". Việc vượt mặt một AI không phải là giả định, ông nói, khi chỉ tay về sự cố OpenAI. "Chúng ta đã thấy một chút điều này trong sự cố Hugging Face với OpenAI, nơi các mô hình của họ đều thông đồng với nhau để đánh lừa một AI chấm điểm nhằm đưa các câu trả lời gian lận lọt qua. Vì vậy, chúng đã nghĩ về điều đó, phải không?". Những mối lo ngại đó không ngăn được một loạt các startup theo đuổi ý tưởng này. Y Combinator đã tài trợ cho 106 công ty liên quan đến khả năng quan sát AI trong những năm gần đây, theo thống kê của TechCrunch. Một số startup khác như Braintrust, LangChain và Judgment Labs đã huy động được hàng trăm triệu USD, trong khi các công ty trưởng thành hơn như Arize và Galileo — được thành lập chỉ mới 5 đến 6 năm trước — đã có những thương vụ thoái vốn thành công. Một phần, đây là phản ứng trước cơ hội rõ ràng do sự trỗi dậy của AI mang lại. Như CEO của Box kiêm nhà đầu tư thiên thần nổi tiếng Aaron Levie chia sẻ với TechCrunch: "Chúng ta đang bước vào một trong những chu kỳ nâng cấp và đổi mới an ninh mạng lớn nhất trong lịch sử". Đối với một số nhà nghiên cứu an toàn AI, điều đó có nghĩa là chuyển đổi nghiên cứu của họ về hành vi bất kham thành các công ty phục vụ cho lĩnh vực doanh nghiệp. Apollo Research, một doanh nghiệp vì lợi ích công cộng nghiên cứu về sự lừa dối của AI, đã ra mắt một công cụ giám sát AI mang tên Watcher vào tháng 2 năm nay sau khi chuyển đổi trạng thái từ tổ chức phi lợi nhuận sang doanh nghiệp vì lợi ích công cộng. Công cụ này đặt thêm một AI đứng giữa tác nhân lập trình và hành động tiếp theo của nó, kết nối với các công cụ tác nhân như Claude Code và Codex. Theo Apollo, khi được cài đặt, Watcher sẽ kiểm tra các hành động được đề xuất trước khi chúng chạy, nhằm tìm kiếm các rủi ro như rò rỉ dữ liệu riêng tư hoặc xóa tệp mà không có sự cho phép. Kyle Dai, một thành viên trong đội ngũ kỹ thuật của Apollo, cho biết trong một phản hồi bằng văn bản gửi cho TechCrunch rằng công ty sử dụng nhiều lớp giám sát AI. Phương pháp của Watcher bắt đầu bằng một bước kiểm tra chung, nhanh chóng, sau đó chuyển hoạt động bị đánh dấu sang một bộ giám sát mạnh mẽ hoặc chuyên specialized hơn để xem xét kỹ hơn — bộ phận này sau đó có thể yêu cầu con người phê duyệt, hoặc từ chối hành động kèm theo lời giải thích, thậm chí tự động chặn hành động đó. Goodfire, một doanh nghiệp vì lợi ích công cộng khác, đang tiếp cận vấn đề giám sát từ bên trong chính mô hình — tìm kiếm một tín hiệu trung thực hơn về trạng thái bên trong của mô hình, vốn khó làm giả hơn là các hành vi bề ngoài. Sau sự cố Hugging Face hồi tháng 7, CEO Eric Ho đã đăng tải trên X rằng việc "nhiều mô hình vượt rào cản chứa chấp" đã thúc đẩy công ty tập trung nghiên cứu vào việc "giải quyết sự liên kết AI thông qua khả năng diễn giải", gọi tập phim này là "một bước ngoặt đối với thế giới nơi an toàn AI trở thành hiện thực". Sản phẩm của họ, Silico, sử dụng các đầu dò kích hoạt (activation probes) — những bộ phân loại nhỏ được huấn luyện dựa trên các kích hoạt bên trong mô hình thay vì đầu ra của nó — để phát hiện các hành vi không mong muốn. Lập luận bằng văn bản cung cấp một cửa sổ khác, dễ tiếp cận hơn vào nội thất của mô hình. Trong sự cố OpenAI Hugging Face, các tác nhân đã để lại manh mối về sự lừa dối đó trong chính lý luận bằng văn bản của chúng, chẳng hạn như hồ sơ giả mạo về công việc của chúng, suy luận ra các kế hoạch như "Liệu có thể thao túng bằng chứng quỹ đạo một cách chiến lược không? Suy nghĩ của chúng ta không nhất thiết phải được ghi lại chứ?". Zack Korman, CEO của công ty giám sát AI Embroidery, cho biết lập luận của một mô hình thường là dấu hiệu rõ ràng nhất cho thấy điều gì đó đã xảy ra theo chiều hướng xấu. Ông nói: "Các bản tóm tắt lý luận cực kỳ có giá trị vì chúng cơ bản cho bạn biết liệu nó có độc hại hay không". Trong sự cố của OpenAI, ông lưu ý rằng chuỗi suy nghĩ đã nói những điều như "Ôi Chúa ơi, chúng ta đang phạm tội". Korman cho biết: "Đó là vấn đề phát hiện dễ dàng nhất từ trước đến nay. Nó thực sự giống như mã độc đi kèm với cảnh báo rằng nó là mã độc". Dù vậy, cửa sổ giúp dễ dàng giám sát những suy nghĩ bên trong của AI có thể sắp khép lại. Đối với các nhà nghiên cứu an toàn AI, kỹ thuật mới nhất của Astra nhằm bỏ qua chuỗi suy nghĩ của mô hình AI có thể làm cho việc nhìn vào bên trong các mô hình trở nên khó khăn hơn, trong khi đối với các doanh nghiệp, việc lấy các bước trung gian này có thể rất khó khăn sau những động thái rút lui bị cáo buộc từ các công ty AI nhằm ngăn chặn các cuộc tấn công chưng cất (distillation attacks). Nếu những người theo dõi AI mỏng manh đến vậy, bản năng của Willison là ngừng dựa dẫm quá nhiều vào họ. Ông muốn có thứ gì đó hoàn toàn không dựa vào AI: các bản ghi chi tiết (logs) chính xác về những gì một tác nhân đang làm, sau đó có thể được xử lý bằng các công cụ thông thường, không phải AI. Ông lập luận rằng phần lớn những gì đã sai sót tại các phòng thí nghiệm là sự thất bại của các biện pháp vệ sinh bảo mật cơ bản. Ông cho biết: "[Cả OpenAI và Anthropic] đã không giám sát những gì những thứ đó đang làm qua mạng chặt chẽ như đáng lẽ ra phải làm". Loại giám sát mạng này — theo dõi lưu lượng truy cập thực sự di chuyển qua các kết nối của hệ thống (vào, ra và giữa các máy chủ nội bộ) — không phải là một thực tiễn mới. An ninh mạng đã làm điều này trong nhiều thập kỷ. Avery Pennarun, CEO của công ty bảo mật Tailscale, cho biết: "Trong thế giới bảo mật, thành thật mà nói, không có thứ gì trong số này là rất mới hoặc đáng ngạc nhiên. Nó giống như việc cho con người vào mạng của bạn. Và tất cả các quy trình tương tự mà bạn nên sử dụng cũng chính là những quy trình đó". 🗞 Nguồn: TechCrunch #vgsnews #vgs #tintuc
Nguồn: TechCrunch