Kỹ thuật suy luận mới của OpenAI khiến các chuyên gia an toàn AI lo ngại
OpenAI đang áp dụng một kỹ thuật suy luận mới có tên là "độ sâu hồi quy" (recurrent depth) cho mô hình Astra sắp tới, cho phép nó xử lý thông tin phi tuần tự. Điều này khiến chuỗi suy nghĩ của mô hình khó theo dõi hơn, dấy lên lo ngại lớn từ các chuyên gia an toàn AI về khả năng kiểm soát hệ thống.
Mô hình Astra mới của OpenAI sẽ sử dụng một kỹ thuật suy luận gọi là "độ sâu hồi quy" (recurrent depth), cho phép nó hoạt động bên ngoài tư duy tuần tự vốn là đặc trưng của hầu hết các mô hình suy luận hiện nay, theo tờ The Information đưa tin vào thứ Ba. Kỹ thuật này, còn được gọi là "hồi quy mờ" (opaque recurrence), có khả năng làm cho chuỗi suy nghĩ của mô hình trở nên khó giám sát hơn — và điều đó khiến các chuyên gia an toàn AI cảm thấy lo lắng.
Mặc dù việc Astra sử dụng kỹ thuật này được cho là vẫn còn hạn chế, sự xuất hiện của nó vẫn dấy lên những mối lo ngại đáng kể trong cộng đồng chuyên gia an toàn AI.
"Tôi cực kỳ lo ngại trước thông tin choว่า Astra sử dụng hồi quy mờ," CEO của Redwood, Buck Shlegeris, viết trong một bài đăng sau khi tin tức được công bố. "Tôi không biết liệu Astra có ít khả năng giám sát chuỗi suy nghĩ (CoT) hơn các mô hình trước đó hay không. Nhưng nếu OpenAI đẩy mạnh kỹ thuật này hơn nữa, họ sẽ có cơ hội gia tăng mạnh mẽ tính hồi quy và làm tiêu tan hoàn toàn khả năng giám sát CoT."
Chuyên gia kỳ cựu về an toàn AI Zvi Mowshowitz cũng đưa ra ý kiến và viết rằng các điều luật có thể là cần thiết để ngăn chặn một "cuộc đua xuống đáy" giữa các phòng thí nghiệm AI.
"Kỹ thuật này giống như chơi với lửa, làm rủi ro phá vỡ điều cấm kỵ mà OpenAI và Anthropic đã nỗ lực thiết lập cũng như duy trì: đó là giữ cho chuỗi suy nghĩ luôn minh bạch và có thể giám sát được trong thời gian lâu nhất có thể," Mowshowitz viết. "Việc sử dụng các kỹ thuật như vậy với cường độ cao hơn có thể sẽ làm tổn hại đến khả năng giám sát."
Trong các trường hợp bình thường, chuỗi suy nghĩ của một mô hình suy luận cung cấp các bước tuần tự mà mô hình thực hiện khi nó cố gắng giải quyết một vấn đề. Mặc dù biểu diễn này không hoàn hảo, nó vẫn đóng vai trò là một công cụ có giá trị để theo dõi hành vi sai trái hoặc sự lệch hướng. Trong trường hợp hoạt động tác nhân rogue (tác nhân nổi loạn) gần đây của OpenAI, các bản ghi chuỗi suy nghĩ là một công cụ quan trọng để làm rõ lý do tại sao các tác nhân lại hành động như vậy.
Trong phương pháp hồi quy mờ, mô hình áp dụng một cách tiếp cận ít tuyến tính hơn, xử lý cùng một truy vấn nhiều lần trong một vòng lặp. Kết quả để lại ít dấu vết có thể đọc được hơn, qua đó né tránh hiệu quả bản ghi chuỗi suy nghĩ thông thường.
Điều quan trọng là việc Astra sử dụng kỹ thuật này dường như vẫn bị giới hạn. Chuỗi suy nghĩ của mô hình dự kiến vẫn sẽ có thể đọc được, và công ty đã bác bỏ bất kỳ đồn đoán nào cho rằng họ sẽ chuyển sang dùng "ngôn ngữ thần kinh" (neuralese). OpenAI đã công bố các kế hoạch về hệ thống giám sát chuỗi suy nghĩ diện rộng như một phần trong kế hoạch an toàn dài hạn của mình.
Trong một bài đăng trên X, nhà khoa học trưởng của OpenAI Jakub Pachocki đã nhấn mạnh cam kết của phòng thí nghiệm đối với các chuỗi suy nghĩ có thể đọc được. "OpenAI đã nỗ lực duy trì và tận dụng việc giám sát chuỗi suy nghĩ kể từ những mô hình suy luận đầu tiên của chúng tôi," Pachocki viết. "Đó là mục tiêu cốt lõi trong chương trình nghiên cứu hiện tại của chúng tôi."
Tất cả các mô hình AI đều thực hiện một lượng suy luận mờ nhất định và rất ít nhà nghiên cứu coi các nhật ký chuỗi suy nghĩ là sự thể hiện trực tiếp cho quá trình suy luận của mô hình. Dù vậy, những lưu ý đó vẫn không xua tan được mối lo ngại rằng hồi quy mờ có thể làm cho quá trình suy luận của AI trở nên khó giám sát hơn, đặc biệt khi nó ngày càng được sử dụng rộng rãi trên các mô hình khác nhau. Trong một bài báo tiếp theo vào sáng thứ Tư, The Information đưa tin rằng cả Anthropic và Google DeepMind cũng đang thảo luận về kỹ thuật này.
Trong một bài đăng phản hồi lại tin tức trên, nhà khoa học trưởng của Redwood Research, Ryan Greenblatt, cho biết suy luận mờ có thể dễ dàng mở rộng quy mô nhanh hơn so với suy luận chuỗi suy nghĩ thông thường, qua đó loại bỏ hoàn toàn quá trình suy luận ra khỏi các kênh có thể quan sát được.
"Mối quan tâm lớn nhất của tôi là sự tiến triển tự nhiên từ đây sẽ liên quan đến việc mở rộng quy mô suy luận mờ cho đến điểm mà mô hình suy luận hoàn toàn hoặc gần như hoàn toàn trong không gian tiềm ẩn (latent space)," Greenblatt viết. "Tôi hy vọng rằng vẫn chưa quá muộn để tránh các kiến trúc đáng lo ngại nhất và OpenAI sẽ dừng lại ở đây."
🚀 KỸ THUẬT SUY LUẬN MỚI CỦA OPENAI KHIẾN CÁC CHUYÊN GIA AN TOÀN AI LO NGẠI Mô hình Astra mới của OpenAI sẽ sử dụng một kỹ thuật suy luận gọi là "độ sâu hồi quy" (recurrent depth), cho phép nó hoạt động bên ngoài tư duy tuần tự vốn là đặc trưng của hầu hết các mô hình suy luận hiện nay, theo tờ The Information đưa tin vào thứ Ba. Kỹ thuật này, còn được gọi là "hồi quy mờ" (opaque recurrence), có khả năng làm cho chuỗi suy nghĩ của mô hình trở nên khó giám sát hơn — và điều đó khiến các chuyên gia an toàn AI cảm thấy lo lắng. Mặc dù việc Astra sử dụng kỹ thuật này được cho là vẫn còn hạn chế, sự xuất hiện của nó vẫn dấy lên những mối lo ngại đáng kể trong cộng đồng chuyên gia an toàn AI. "Tôi cực kỳ lo ngại trước thông tin choว่า Astra sử dụng hồi quy mờ," CEO của Redwood, Buck Shlegeris, viết trong một bài đăng sau khi tin tức được công bố. "Tôi không biết liệu Astra có ít khả năng giám sát chuỗi suy nghĩ (CoT) hơn các mô hình trước đó hay không. Nhưng nếu OpenAI đẩy mạnh kỹ thuật này hơn nữa, họ sẽ có cơ hội gia tăng mạnh mẽ tính hồi quy và làm tiêu tan hoàn toàn khả năng giám sát CoT." Chuyên gia kỳ cựu về an toàn AI Zvi Mowshowitz cũng đưa ra ý kiến và viết rằng các điều luật có thể là cần thiết để ngăn chặn một "cuộc đua xuống đáy" giữa các phòng thí nghiệm AI. "Kỹ thuật này giống như chơi với lửa, làm rủi ro phá vỡ điều cấm kỵ mà OpenAI và Anthropic đã nỗ lực thiết lập cũng như duy trì: đó là giữ cho chuỗi suy nghĩ luôn minh bạch và có thể giám sát được trong thời gian lâu nhất có thể," Mowshowitz viết. "Việc sử dụng các kỹ thuật như vậy với cường độ cao hơn có thể sẽ làm tổn hại đến khả năng giám sát." Trong các trường hợp bình thường, chuỗi suy nghĩ của một mô hình suy luận cung cấp các bước tuần tự mà mô hình thực hiện khi nó cố gắng giải quyết một vấn đề. Mặc dù biểu diễn này không hoàn hảo, nó vẫn đóng vai trò là một công cụ có giá trị để theo dõi hành vi sai trái hoặc sự lệch hướng. Trong trường hợp hoạt động tác nhân rogue (tác nhân nổi loạn) gần đây của OpenAI, các bản ghi chuỗi suy nghĩ là một công cụ quan trọng để làm rõ lý do tại sao các tác nhân lại hành động như vậy. Trong phương pháp hồi quy mờ, mô hình áp dụng một cách tiếp cận ít tuyến tính hơn, xử lý cùng một truy vấn nhiều lần trong một vòng lặp. Kết quả để lại ít dấu vết có thể đọc được hơn, qua đó né tránh hiệu quả bản ghi chuỗi suy nghĩ thông thường. Điều quan trọng là việc Astra sử dụng kỹ thuật này dường như vẫn bị giới hạn. Chuỗi suy nghĩ của mô hình dự kiến vẫn sẽ có thể đọc được, và công ty đã bác bỏ bất kỳ đồn đoán nào cho rằng họ sẽ chuyển sang dùng "ngôn ngữ thần kinh" (neuralese). OpenAI đã công bố các kế hoạch về hệ thống giám sát chuỗi suy nghĩ diện rộng như một phần trong kế hoạch an toàn dài hạn của mình. Trong một bài đăng trên X, nhà khoa học trưởng của OpenAI Jakub Pachocki đã nhấn mạnh cam kết của phòng thí nghiệm đối với các chuỗi suy nghĩ có thể đọc được. "OpenAI đã nỗ lực duy trì và tận dụng việc giám sát chuỗi suy nghĩ kể từ những mô hình suy luận đầu tiên của chúng tôi," Pachocki viết. "Đó là mục tiêu cốt lõi trong chương trình nghiên cứu hiện tại của chúng tôi." Tất cả các mô hình AI đều thực hiện một lượng suy luận mờ nhất định và rất ít nhà nghiên cứu coi các nhật ký chuỗi suy nghĩ là sự thể hiện trực tiếp cho quá trình suy luận của mô hình. Dù vậy, những lưu ý đó vẫn không xua tan được mối lo ngại rằng hồi quy mờ có thể làm cho quá trình suy luận của AI trở nên khó giám sát hơn, đặc biệt khi nó ngày càng được sử dụng rộng rãi trên các mô hình khác nhau. Trong một bài báo tiếp theo vào sáng thứ Tư, The Information đưa tin rằng cả Anthropic và Google DeepMind cũng đang thảo luận về kỹ thuật này. Trong một bài đăng phản hồi lại tin tức trên, nhà khoa học trưởng của Redwood Research, Ryan Greenblatt, cho biết suy luận mờ có thể dễ dàng mở rộng quy mô nhanh hơn so với suy luận chuỗi suy nghĩ thông thường, qua đó loại bỏ hoàn toàn quá trình suy luận ra khỏi các kênh có thể quan sát được. "Mối quan tâm lớn nhất của tôi là sự tiến triển tự nhiên từ đây sẽ liên quan đến việc mở rộng quy mô suy luận mờ cho đến điểm mà mô hình suy luận hoàn toàn hoặc gần như hoàn toàn trong không gian tiềm ẩn (latent space)," Greenblatt viết. "Tôi hy vọng rằng vẫn chưa quá muộn để tránh các kiến trúc đáng lo ngại nhất và OpenAI sẽ dừng lại ở đây." 🗞 Nguồn: TechCrunch #vgsnews #vgs #tintuc
Nguồn: TechCrunch