Bản tin công nghệ quốc tế · dịch tiếng Việt 17.09.2026 RSS
AI & Dữ liệu · TechCrunch

Anthropic và OpenAI muốn đưa chuyên gia đánh giá an toàn vào nội bộ: Liệu có thực sự độc lập?

Anthropic và OpenAI đang đề xuất đưa các tổ chức đánh giá an toàn bên thứ ba vào sâu trong nội bộ công ty để kiểm tra mô hình AI. Tuy nhiên, giới chuyên gia cho rằng cần có những quy định pháp lý rõ ràng để đảm bảo tính độc lập thực sự thay vì chỉ là hình thức.

TechCrunch17.09.202610 phút đọc1 lượt đọc

Trong một bài luận dài được công bố vào cuối tuần qua, CEO Anthropic Dario Amodei đã đưa ra một đề xuất mà ngành công nghiệp AI có thể đã lập tức bác bỏ chỉ một năm trước: đưa các bên đánh giá thứ ba vào sâu bên trong tất cả các công ty AI tiên phong, trao cho họ quyền báo cáo các sự cố an toàn, đánh giá xem các mô hình AI có thực sự được định hướng đúng đắn hay không, và chia sẻ những phát hiện chưa qua chỉnh sửa của họ với thế giới.

Amodei cho biết Anthropic sẽ cam kết cấp cho các bên đánh giá độc lập như METR và Redwood Research quyền tiếp cận chưa từng có đối với các hệ thống của công ty. CEO Sam Altman cho biết OpenAI cũng sẽ cam kết thực hiện phương pháp này, báo hiệu một sự thay đổi có khả năng rất sâu sắc trong cách ngành công nghiệp làm việc với các nhóm nghiên cứu bên ngoài.

Các bên đánh giá bên thứ ba trả lời phỏng vấn của TechCrunch nhìn chung hoan nghênh đề xuất này, nhưng cho biết các chi tiết cần phải được giải quyết thấu đáo — và lý tưởng nhất là được hậu thuẫn bởi luật pháp — để họ biết liệu mình sẽ đóng vai trò là những bên giám sát thực sự độc lập hay chỉ là nhà cung cấp hoạt động theo các điều khoản của các công ty AI.

Quyền tiếp cận sâu hơn đó đang trở nên quan trọng hơn khi các mô hình ngày càng giỏi hơn trong việc nhận biết khi nào chúng đang bị đánh giá, làm tăng nguy cơ chúng sẽ cư xử tốt trong quá trình kiểm tra trong khi che giấu hành vi có vấn đề. Các nhà nghiên cứu cho biết những manh mối về hành vi đó có thể bị bỏ lỡ khi kiểm tra mô hình hoàn thiện, nhưng lại có thể được phát hiện bằng cách điều tra cách nó cư xử trong suốt quá trình huấn luyện.

Alexander Meinke, trưởng bộ phận nghiên cứu tại Apollo Research, chia sẻ với TechCrunch: “Các công ty AI nên có khả năng trả lời một số câu hỏi rất cơ bản về quá trình huấn luyện của họ, chẳng hạn như: AI đã bao giờ chủ động cố gắng phá hoại quá trình huấn luyện căn chỉnh của chính nó trong khi nó đang trải qua quá trình huấn luyện hay không? Câu trả lời cho điều này phải là một tiếng 'không' dứt khoát, và ngay bây giờ chúng ta hoàn toàn phụ thuộc vào các công ty AI để vừa tự cẩn thận kiểm tra điều này vừa trung thực báo cáo điều đó cho công chúng. Và chúng ta đã thấy từ các sự cố gần đây rằng, theo mặc định, họ sẽ không làm cả hai điều đó. Là những chuyên gia đánh giá được nhúng vào trong, chúng ta thực sự có thể kiểm tra.”

Trước đây, các công ty AI thường đưa vào các đánh giá viên bên ngoài để kiểm tra các mô hình đã hoàn thành ngay trước khi phát hành. Giờ đây, các chuyên gia đánh giá mà TechCrunch trao đổi đề xuất cấp cho họ quyền tiếp cận không chỉ với mô hình cuối cùng, mà còn với các phiên bản trung gian, hay các “điểm kiểm tra” (checkpoints) từ vòng đời huấn luyện của mô hình đó. Adam Gleave, CEO của FAR.AI, cho biết các đánh giá viên có thể so sánh các điểm kiểm tra đó để xác định thời điểm hành vi đáng lo ngại xuất hiện, kiểm tra môi trường hậu huấn luyện thưởng cho các mô hình vì những hành vi nhất định, đồng thời kiểm tra bản ghi chép và nhật ký đánh giá để xác minh tuyên bố của công ty về hiệu suất của mô hình.

Việc Anthropic và OpenAI có kế hoạch cung cấp quyền tiếp cận loại đó hay không và khi nào vẫn chưa rõ ràng. Cả hai công ty đều chưa chia sẻ họ sẽ làm việc với những đánh giá viên nào, khi nào họ sẽ được đưa vào, họ sẽ mang lại bao nhiêu người, chính xác những hệ thống và thông tin nào họ sẽ được phép truy cập hoặc những gì có thể được tiết lộ cho công chúng, bất chấp những câu hỏi lặp đi lặp lại từ TechCrunch.

Nhìn vào bên trong cấu trúc như thế này rất quan trọng bởi vì các mô hình hoạt động tốt trong các bài kiểm tra an toàn chưa chắc đã an toàn nếu chúng đã học cụ thể cách để vượt qua bài kiểm tra đó. John Steidley, trưởng bộ phận chiến lược tại Palisade Research, đã chỉ ra một ví dụ về “tiêu chuẩn kháng cự việc tắt” (shutdown resistance benchmark) đo lường xem AI có chống lại việc bị tắt trong một số trường hợp nhất định hay không.

Steidley cho biết: “Việc AI đã được huấn luyện đặc biệt để hoạt động tốt trên tiêu chuẩn đó là vô cùng quan trọng”, và so sánh nó với bê bối Dieselgate của Volkswagen, trong đó các ô tô được lập trình để nhận diện các bài kiểm tra khí thải và hoạt động khác đi trong các điều kiện kiểm tra.

Gleave lưu ý rằng quyền tiếp cận có ý nghĩa có thể vượt ra ngoài bản thân các mô hình, với việc các đánh giá viên được cấp quyền phỏng vấn nhân viên để kiểm tra xem tài liệu của công ty và các mô tả công khai về thực tiễn an toàn của họ có khớp với những gì diễn ra nội bộ hay không.

Amodei đã phác thảo một đề xuất khá toàn diện có thể mang lại cho các chuyên gia đánh giá loại quyền tiếp cận mà họ cho là cần thiết, bao gồm quyền “công bố các phát hiện quan trọng về mức độ rủi ro, sự cố, thông lệ và quyền truy cập mà họ nhận được hoặc không nhận được — mà không có sự kiểm soát biên tập bởi Anthropic.”

Nhưng các đánh giá viên cho biết một hệ thống như vậy sẽ chỉ hoạt động nếu các công ty AI thực sự sẵn sàng từ bỏ quyền kiểm soát quá trình này. Các nỗ lực đánh giá độc lập trước đây cho thấy việc từ bỏ đó sẽ rất khó khăn, vì các bên thứ ba thường vấp phải những căng thẳng về quyền truy cập, thời gian, tính bảo mật và những gì họ có thể nói công khai.

Giới hạn thời gian

Cũng có câu hỏi liệu các nhà đánh giá có nhận được đủ thời gian và quyền truy cập để thực hiện công việc được giao hay không. Khi điều tra sự cố Hugging Face, OpenAI đã cho METR và Redwood khoảng một tuần tại cơ sở để điều tra, và cả hai sau đó đều cho biết họ không thể đưa ra kết luận chắc chắn một phần do các giới hạn về phạm vi và thời gian.

Vấn đề tương tự đã xảy ra trong quá trình kiểm tra trước khi phát hành đối với GPT-6 Astra, mô hình mà OpenAI đã quảng cáo là mô hình được căn chỉnh tốt nhất từ trước đến nay. Theo đóng góp của Apollo Research vào thẻ mô hình (model card), công ty này chỉ có ba ngày để kiểm tra Astra, điều này khiến việc đưa ra các kết luận vững chắc trở nên khó khăn.

Công ty viết trong đánh giá của mình: “Apollo tin rằng, với tỷ lệ nhận thức về đánh giá cao hơn và thời gian đánh giá bị giới hạn, tỷ lệ hành vi sai trái thấp ở đây không cung cấp bằng chứng đáng kể về việc mô hình được căn chỉnh hay lệch hướng.”

Hồ sơ theo dõi đó khiến các chuyên gia đánh giá đặt ra một câu hỏi cơ bản: Tại sao lần này lại khác?

Gleave nói: “Chắc chắn là có khả năng Dario và Sam vừa thay đổi quan điểm, và họ sẽ rất cởi mở về điều này. Nhưng tài sản trí tuệ của các công ty này có giá trị vô cùng lớn đối với họ, và tôi nghĩ theo mặc định, họ sẽ rất cẩn trọng về những gì có thể được chia sẻ.”

Một số nhà nghiên cứu trò chuyện với TechCrunch đã kêu gọi một khung làm việc minh bạch mà tất cả họ cùng đồng ý công khai. Steidley cho biết một phần của khung làm việc này nên liên quan đến các tiêu chuẩn về loại kiểm toán viên nào mà các công ty có thể dựa vào, kẻo họ cố gắng né tránh vấn đề bằng cách tìm kiếm các đánh giá viên không đủ trình độ hoặc không quan tâm đến việc đánh giá rủi ro đáng lo ngại nhất.

Henry Papadatos, giám đốc điều hành của Safer AI, cho biết vấn đề, ngay cả với một khung làm việc công khai, là các biện pháp tự nguyện luôn phụ thuộc vào thiện chí của công ty.

Papadatos chia sẻ với TechCrunch: “Lý tưởng nhất là chúng ta có các quy định tốt bắt buộc điều này… bởi vì khi đó các công ty không thể thay đổi ý định vào ngày mai nếu họ gặp khủng hoảng truyền thông lớn”, đồng thời lưu ý rằng đây cũng là một phương Rất tốt để thúc đẩy tất cả các công ty tuân thủ các quy tắc, chứ không chỉ những bên sẵn lòng nhất.

Không phải ai cũng đã tham gia. Cho đến nay, Meta, SpaceXAI và Google DeepMind vẫn chưa cam kết đưa các chuyên gia đánh giá bên thứ ba vào nội bộ, mặc dù CEO DeepMind Demis Hassabis đã đề xuất một cơ quan tiêu chuẩn ngành riêng biệt để kiểm tra độc lập các mô hình tiên phong. Google, OpenAI và Anthropic cũng đã thảo luận riêng về các kế hoạch an toàn AI trong nhiều tuần.

Một số đạo luật đã bắt đầu hình thành xoay quanh ý tưởng về các bên đánh giá độc lập. Dự luật SB 53 của California, được ký thành luật năm ngoái, yêu cầu các nhà phát triển AI tiên phong lớn phải công bố các khuôn trình an toàn và báo cáo các sự cố an toàn quan trọng. Một đạo luật mới, SB 813, được ký trong tháng này, tạo ra một khuôn khổ cho các “tổ chức xác minh độc lập” được tiểu bang công nhận có chuyên môn đánh giá rủi ro AI.

Tại châu Âu, Đạo luật AI của EU yêu cầu các nhà phát triển tiên phong thực hiện và tài liệu hóa việc đánh giá mô hình cũng như kiểm tra đối kháng, đồng thời báo cáo các sự cố nghiêm trọng. Văn phòng AI của EU cũng có thể tiến hành các đánh giá của riêng mình và chỉ định các chuyên gia độc lập.

Hiện tại, luật pháp vẫn ít rộng mở hơn so với những gì Amodei đang đề xuất, khiến các phòng thí nghiệm tiên phong phần lớn vẫn chịu trách nhiệm quyết định mức độ...


Cùng chuyên mục · AI & Dữ liệu
AI & Dữ liệu

Bộ phim Odyssey dài 2,5 tiếng hoàn toàn do AI tạo ra thực sự là một thảm họa

Bộ phim Odyssey do AI tạo ra mang tên 'Odysseus: The Fall' bị chỉ trích nặng nề vì nội dung nhàm chán, rời rạc và đầy…

The Verge · 6 phút đọc
AI & Dữ liệu

Claude Opus 5 bất ngờ xuất hiện trên tài khoản miễn phí nhưng chỉ giới hạn 3 tin nhắn

Anthropic vừa cho phép một số người dùng tài khoản miễn phí trải nghiệm Claude Opus 5 mà không cần nâng cấp. Tuy nhiên,…

Notebookcheck · 2 phút đọc
AI & Dữ liệu

Snap ra mắt công cụ Specs AI mới, hỗ trợ trên cả iOS và Mac

Snap vừa giới thiệu Specs Intelligence, một trợ lý AI thông minh có khả năng kết nối với các tài khoản kỹ thuật số để…

The Verge · 3 phút đọc