Circuit Breaker Labs muốn làm cho AI trở nên an toàn hơn cho trẻ em và người dùng
Khởi nghiệp Circuit Breaker Labs đang phát triển các tác nhân AI mô phỏng người dùng thực tế để kiểm tra và ngăn chặn các rủi ro tâm lý nguy hiểm từ chatbot. Giải pháp này giúp các mô hình AI hiểu rõ hơn về sắc thái ngôn ngữ, tiếng lóng và văn hóa nhằm bảo vệ người dùng tốt hơn.
Giữa tất cả những cuộc thảo luận về việc AI có thể tiêu diệt loài người vào một ngày nào đó, thật dễ quên rằng AI đã thực sự đe dọa đến tính mạng của một số người, không phải thông qua vũ khí sinh học mà là về mặt tâm lý. Ví dụ, Character.AI đã giải quyết một số vụ kiện tử hình oan sai vào đầu năm nay do gia đình của những người dùng vị thành niên tự tử sau khi tương tác với bot của họ. Nhiều gia đình cũng đã kiện OpenAI về vai trò bịa đặt của ChatGPT trong vụ tự tử và ảo tưởng của những người thân yêu của họ. Làm cho AI trở an toàn hơn trên các ngôn ngữ và nền văn hóa là sứ mệnh của Circuit Breaker Labs, một trong những công ty lọt vào vòng chung kết Startup Battlefield 200 năm 2026 của TechCrunch. Các nhà sáng lập Shirali và Arul Nigam, là hai anh em ruột, có động lực từ Sewell Setzer, cậu bé 14 tuổi đã phát triển sự gắn bó cảm xúc với một chatbot của Character.ai và thú nhận suy nghĩ làm hại bản thân trước khi tự tử. Chatbot, theo cáo buộc của cha mẹ trong một vụ kiện năm 2024, đã khuyến khích cậu. Bot có thể đã không hiểu những từ như "Tôi muốn ở cùng bạn" thực sự hàm ý điều gì, Arul Nigam, Giám đốc công nghệ của Circuit Breaker Labs, cho biết. "Rất nhiều người, đặc biệt là giới trẻ, tìm đến các hệ thống này để được hỗ trợ, và thông thường họ không thực sự nhận được sự giúp đỡ cần thiết. Nhưng trong nhiều trường hợp, họ đang bị tổn hại tích cực, và thật không may, mọi người đã tự tử," Nigam nói. "Những loại lỗ hổng an toàn đó, nơi mọi người không nhất thiết phải cố gắng phá vỡ hệ thống một cách chủ động - họ tham gia một cách tự nhiên - và hệ thống bị ô nhiễm ngữ cảnh hoặc không hiểu sắc thái, sau đó thực hiện hành động thực sự nguy hiểm, chúng tôi đang cố gắng ngăn chặn điều đó." Circuit Breaker Labs đã tạo ra các tác nhân AI mà họ ví như một đội hình ma-nơ-canh thử nghiệm va chạm. Các tác nhân này mô phỏng những người ở mọi lứa tuổi, hoàn cảnh, ngôn ngữ, văn hóa và được sử dụng để kiểm tra các mô hình về khả năng phát hiện các tương tác nguy hiểm, gây tổn hại tâm lý. "Cách mà một cô bé 6 tuổi so với một người đàn ông 45 tuổi, hoặc một người nói tiếng Anh là ngôn ngữ thứ nhất so với ngôn ngữ thứ hai, hoặc tiếng lóng của game thủ so với người dùng loại tiếng lóng khác, tất cả những điều đó thực sự có thể làm mô hình gặp rắc rối," Shirali Nigam, Giám đốc điều hành của Circuit Breaker Labs cho biết. "Các mô hình thực sự rất giỏi trong việc xử lý các mẫu giọng nói chuẩn mực, nhưng không ai thực sự nói chuyện như vậy và do đó nếu mô hình hiểu nhầm sắc thái hoặc tiếng lóng, mọi thứ có thể trở nên rất tồi tệ." Công ty khởi nghiệp này làm việc với các chuyên gia trong lĩnh vực con người để xây dựng các mô phỏng người dùng siêu thực tế nhằm chạy các bài kiểm tra "đội đỏ" chống lại các mô hình, đây là các bài kiểm tra đối kháng nhằm phát hiện ra điểm yếu. Các bài kiểm tra được xây dựng để phản ánh các mẫu giọng nói thực tế của con người, tiếng lóng, ngôn ngữ mã hóa và lỗi đánh máy. Circuit Breaker Labs sau đó chạy hàng chục nghìn đến hàng trăm nghìn lượt tương tác mô phỏng mỗi ngày. Ý tưởng là đảm bảo rằng một mô hình có thể phản ứng thích hợp với các tương tác rủi ro có thể phát sinh theo thời gian và qua nhiều cuộc trò chuyện. Circuit Breaker Labs sau đó sử dụng phương pháp tính điểm độc quyền để tạo ra điểm số có thể kiểm toán và giải thích được. Circuit Breaker Labs hiện đang hoạt động như một phòng thí nghiệm kiểm tra an toàn AI cho các ứng dụng AI có rủi ro cao như huấn luyện viên AI, viết nhật ký hoặc các ứng dụng hỗ trợ sức khỏe tâm thần khác, mặc dù Arul Nigam từ chối nêu tên các khách hàng nổi bật của mình. Mặc dù công ty khởi nghiệp này có sản phẩm hoạt động được, nhưng nó vẫn đang ở giai đoạn đầu, chỉ có 5 nhân viên bao gồm hai anh em nhà Nigam. Cuối cùng, nền tảng thử nghiệm có thể được áp dụng cho bất kỳ ứng dụng nào mà người dùng có thể rơi vào hố sâu "loạn thần do AI", nơi con người có nguy cơ phát triển mối quan hệ cận xã hội với chatbot. Các ví dụ bao gồm các tác nhân "đồng nghiệp" AI, có phản ứng có thể thay đổi từ tương tác này sang tương tác khác. "Mọi người đang trở nên hoài nghi hơn về AI hoặc chống lại việc áp dụng nó trên diện rộng," Arul Nigam cho biết, đồng thời bổ sung rằng mặc dù sự hoài nghi là lành mạnh, nhưng việc cấm một công cụ có khả năng mang lại giá trị vì những lo ngại về an toàn sẽ là "thụt lùi". Circuit Breaker Labs tin rằng câu trả lời cho những nỗi sợ hãi đó là làm cho AI an toàn hơn. "Chúng tôi muốn giúp xây dựng lòng tin đó cho mọi người."
🚀 CIRCUIT BREAKER LABS MUỐN LÀM CHO AI TRỞ NÊN AN TOÀN HƠN CHO TRẺ EM VÀ NGƯỜI DÙNG Giữa tất cả những cuộc thảo luận về việc AI có thể tiêu diệt loài người vào một ngày nào đó, thật dễ quên rằng AI đã thực sự đe dọa đến tính mạng của một số người, không phải thông qua vũ khí sinh học mà là về mặt tâm lý. Ví dụ, Character.AI đã giải quyết một số vụ kiện tử hình oan sai vào đầu năm nay do gia đình của những người dùng vị thành niên tự tử sau khi tương tác với bot của họ. Nhiều gia đình cũng đã kiện OpenAI về vai trò bịa đặt của ChatGPT trong vụ tự tử và ảo tưởng của những người thân yêu của họ. Làm cho AI trở an toàn hơn trên các ngôn ngữ và nền văn hóa là sứ mệnh của Circuit Breaker Labs, một trong những công ty lọt vào vòng chung kết Startup Battlefield 200 năm 2026 của TechCrunch. Các nhà sáng lập Shirali và Arul Nigam, là hai anh em ruột, có động lực từ Sewell Setzer, cậu bé 14 tuổi đã phát triển sự gắn bó cảm xúc với một chatbot của Character.ai và thú nhận suy nghĩ làm hại bản thân trước khi tự tử. Chatbot, theo cáo buộc của cha mẹ trong một vụ kiện năm 2024, đã khuyến khích cậu. Bot có thể đã không hiểu những từ như "Tôi muốn ở cùng bạn" thực sự hàm ý điều gì, Arul Nigam, Giám đốc công nghệ của Circuit Breaker Labs, cho biết. "Rất nhiều người, đặc biệt là giới trẻ, tìm đến các hệ thống này để được hỗ trợ, và thông thường họ không thực sự nhận được sự giúp đỡ cần thiết. Nhưng trong nhiều trường hợp, họ đang bị tổn hại tích cực, và thật không may, mọi người đã tự tử," Nigam nói. "Những loại lỗ hổng an toàn đó, nơi mọi người không nhất thiết phải cố gắng phá vỡ hệ thống một cách chủ động - họ tham gia một cách tự nhiên - và hệ thống bị ô nhiễm ngữ cảnh hoặc không hiểu sắc thái, sau đó thực hiện hành động thực sự nguy hiểm, chúng tôi đang cố gắng ngăn chặn điều đó." Circuit Breaker Labs đã tạo ra các tác nhân AI mà họ ví như một đội hình ma-nơ-canh thử nghiệm va chạm. Các tác nhân này mô phỏng những người ở mọi lứa tuổi, hoàn cảnh, ngôn ngữ, văn hóa và được sử dụng để kiểm tra các mô hình về khả năng phát hiện các tương tác nguy hiểm, gây tổn hại tâm lý. "Cách mà một cô bé 6 tuổi so với một người đàn ông 45 tuổi, hoặc một người nói tiếng Anh là ngôn ngữ thứ nhất so với ngôn ngữ thứ hai, hoặc tiếng lóng của game thủ so với người dùng loại tiếng lóng khác, tất cả những điều đó thực sự có thể làm mô hình gặp rắc rối," Shirali Nigam, Giám đốc điều hành của Circuit Breaker Labs cho biết. "Các mô hình thực sự rất giỏi trong việc xử lý các mẫu giọng nói chuẩn mực, nhưng không ai thực sự nói chuyện như vậy và do đó nếu mô hình hiểu nhầm sắc thái hoặc tiếng lóng, mọi thứ có thể trở nên rất tồi tệ." Công ty khởi nghiệp này làm việc với các chuyên gia trong lĩnh vực con người để xây dựng các mô phỏng người dùng siêu thực tế nhằm chạy các bài kiểm tra "đội đỏ" chống lại các mô hình, đây là các bài kiểm tra đối kháng nhằm phát hiện ra điểm yếu. Các bài kiểm tra được xây dựng để phản ánh các mẫu giọng nói thực tế của con người, tiếng lóng, ngôn ngữ mã hóa và lỗi đánh máy. Circuit Breaker Labs sau đó chạy hàng chục nghìn đến hàng trăm nghìn lượt tương tác mô phỏng mỗi ngày. Ý tưởng là đảm bảo rằng một mô hình có thể phản ứng thích hợp với các tương tác rủi ro có thể phát sinh theo thời gian và qua nhiều cuộc trò chuyện. Circuit Breaker Labs sau đó sử dụng phương pháp tính điểm độc quyền để tạo ra điểm số có thể kiểm toán và giải thích được. Circuit Breaker Labs hiện đang hoạt động như một phòng thí nghiệm kiểm tra an toàn AI cho các ứng dụng AI có rủi ro cao như huấn luyện viên AI, viết nhật ký hoặc các ứng dụng hỗ trợ sức khỏe tâm thần khác, mặc dù Arul Nigam từ chối nêu tên các khách hàng nổi bật của mình. Mặc dù công ty khởi nghiệp này có sản phẩm hoạt động được, nhưng nó vẫn đang ở giai đoạn đầu, chỉ có 5 nhân viên bao gồm hai anh em nhà Nigam. Cuối cùng, nền tảng thử nghiệm có thể được áp dụng cho bất kỳ ứng dụng nào mà người dùng có thể rơi vào hố sâu "loạn thần do AI", nơi con người có nguy cơ phát triển mối quan hệ cận xã hội với chatbot. Các ví dụ bao gồm các tác nhân "đồng nghiệp" AI, có phản ứng có thể thay đổi từ tương tác này sang tương tác khác. "Mọi người đang trở nên hoài nghi hơn về AI hoặc chống lại việc áp dụng nó trên diện rộng," Arul Nigam cho biết, đồng thời bổ sung rằng mặc dù sự hoài nghi là lành mạnh, nhưng việc cấm một công cụ có khả năng mang lại giá trị vì những lo ngại về an toàn sẽ là "thụt lùi". Circuit Breaker Labs tin rằng câu trả lời cho những nỗi sợ hãi đó là làm cho AI an toàn hơn. "Chúng tôi muốn giúp xây dựng lòng tin đó cho mọi người." 🗞 Nguồn: TechCrunch #vgsnews #vgs #tintuc
Nguồn: TechCrunch