Toà án toán học chấn động: Giới toán gia sẽ mất nhiều năm để giải mã loạt kết quả AI mới từ OpenAI
OpenAI vừa bất ngờ tung ra gần 400 kết quả toán học do AI tạo ra nằm trong hơn 700 bản thảo, bao gồm nhiều lĩnh vực khác nhau. Sự kiện này khiến cộng đồng toán học toàn cầu vừa kinh ngạc, vừa lo lắng về chất lượng cũng như tác động của chúng đối với nền học thuật.

“Choáng ngợp.” “Áp đảo.” “Chưa từng có.” “Siêu thực.” “Điên rồ thực sự.”
Đó là một số mô tả mà hơn ba chục nhà toán học đã thốt lên trong các cuộc trò chuyện với tờ The Verge khi họ cố gắng tìm hiểu khối lượng kết quả toán học khổng lồ mà OpenAI vừa bất ngờ tung ra trong tuần này. Giữa sự kinh ngạc, phấn khích và không ít bấp bênh trước quy mô ngợp thở của đợt phát hành là nỗi lo lắng sâu sắc về ý nghĩa của tất cả những điều này – và điều gì sẽ diễn ra tiếp theo. Dù có những phản ứng khác nhau, các nhà nghiên cứu đều đồng tình rằng chỉ riêng việc hiểu được những gì OpenAI vừa công bố cũng có thể mất nhiều năm, chưa nói đến việc xác định vị trí của chính họ trong một lĩnh vực đang thay đổi từng ngày xung quanh họ. Nhiều người tỏ ra lo sợ rằng OpenAI sẽ không đợi lâu đến thế trước khi tiến xa hơn – hoặc phát hành nhiều hơn nữa.
Tính tổng cộng, OpenAI đã tung ra gần 400 kết quả do AI tạo ra. Chúng trải dài trên hơn 700 bản thảo và bao gồm nhiều chuyên ngành toán học đa dạng, bao gồm tổ hợp, một số nhánh hình học, lý thuyết số, khoa học máy tính lý thuyết, đại số, tô-pô, xác suất và cơ học thống kê, cùng vật lý toán học. Bộ sưu tập này khổng lồ đến mức OpenAI thấy cần phải xuất bản hướng dẫn về cách điều hướng kho lưu trữ GitHub vô tận này.
Chính khối lượng công việc khổng lồ này khiến ngay cả một đánh giá sơ bộ về những gì công ty vừa phát hành cũng trở nên khó khăn. Trong những giờ và ngày sau đợt phát hành, hầu hết các nhà toán học mà The Verge trao đổi đều cho biết họ vẫn đang chật vật để tiêu hóa mọi thứ; vài người chia sẻ rằng việc lướt qua mục lục và tóm tắt dài khoảng 40 trang cũng ngốn phần lớn thời gian của một tiếng đồng hồ. Álvaro Lozano-Robledo, giáo sư toán học tại Đại học Connecticut, cho biết: “Chỉ riêng việc xem qua toàn bộ danh sách tóm tắt đã là quá sức rồi.”
Ẩn giữa hàng trăm bản thảo là các hình thức chính thức hóa trong Lean, một ngôn ngữ lập trình và trợ lý chứng minh cho phép các kết quả được xác minh bằng máy tính. Những hình thức chính thức hóa này đã chứng minh được tính hữu ích trong việc đánh giá một số tuyên bố toán học trước đây của OpenAI, giúp các nhà nghiên cứu tin tưởng rằng một tuyên bố là chính xác về mặt logic ngay cả khi họ không hiểu hoàn toàn lập luận đằng sau nó.
“Nếu các AI biến mất ngay bây giờ, cứ như thể có người ngoài hành tinh đến Trái đất rồi rời đi, chúng ta vẫn sẽ nghiên cứu điều này trong 10 năm tới, cố gắng hiểu mọi thứ.”
Tuy nhiên, mức độ xác minh của từng kết quả lại khác nhau rất nhiều. Trên GitHub, OpenAI thừa nhận rằng các kết quả này “đang ở các giai đoạn xác minh khác nhau” và “nhiều, chứ không phải tất cả, các bản thảo đã được chính thức hóa.” Tính đến thời điểm viết bài, chưa đến một nửa số bản thảo trong bộ sưu tập dường như đã được mô tả chính thức. OpenAI cho biết chỉ có 300 kết quả hàng đầu trong tổng số 719 bản thảo đã được chính thức hóa, tương đương khoảng 42 phần trăm, và họ “sẽ cập nhật kho lưu trữ với nhiều hình thức chính thức hóa hơn khi chúng tôi thu thập được.”
Nhiều nhà toán học đã phàn nàn với The Verge về việc thiếu sự chính thức hóa, đặc biệt là khi xét đến số lượng kết quả khổng lồ, và nhấn mạnh rằng ngay cả khi mã Lean đi kèm với kết quả, việc đánh giá cũng không diễn ra tức thời. Các nhà nghiên cứu phải kiểm tra xem quá trình chính thức hóa có thực sự chứng minh được những gì kết quả tuyên bố hay không, đây lại là một quá trình tốn thời gian khác. Một số người lật giở các tài liệu cho biết ngay cả khi các bằng chứng có thể xác minh bằng máy tính được cung cấp, chất lượng lại không đồng đều và các phát biểu mà họ xác minh dường như không phải lúc nào cũng khớp gọn gàng với các tuyên bố trong các bản thảo đi kèm.
Kevin Buzzard, giáo sư toán học tại Imperial College London, cho biết ông đã xác định được nhiều định lý trong lĩnh vực công tác của mình – lý thuyết số đại số – mà chỉ có khoảng sáu định lý trong số đó là “nổi bật” ngay lập tức. Rất ít, nếu có, trong số đó dường như được xác minh chính thức bằng Lean. Buzzard chia sẻ: “Do đó, tôi hoặc phải đọc những thứ rác rưởi có thể không chính xác, hoặc đợi người khác làm điều tương tự, hoặc đợi ai đó chính thức hóa chúng trước khi tôi có thể chắc chắn rằng các kết quả đó có chính xác hay không.” Mối lo ngại của Buzzard cũng là tiếng lòng của nhiều nhà nghiên cứu khác.
Buzzard không hề đơn độc trong việc lo lắng về “rác AI” (AI slop). Thuật ngữ này là từ viết tắt chỉ tài liệu do AI tạo ra có chất lượng thấp, thường xuyên có sai sót, ngày càng xuất hiện nhiều trên mạng – và trong thế giới thực – bao gồm cả các bài báo học thuật. Giống như các lĩnh vực khác, các nhà toán học nói với The Verge rằng họ đã chứng kiến sự gia tăng đột biến các tài liệu như vậy được sản xuất bằng các công cụ như ChatGPT và Claude trong những năm gần đây. Phần lớn trong số đó khó hiểu, khó đọc và thể hiện rất ít sự hiểu biết về chủ đề; chúng đặc biệt cẩu thả khi ghi nhận công lao của các nhà nghiên cứu khác.
Các bài viết toán học trước đây của OpenAI từng bị các chuyên gia chỉ trích rộng rãi vì tính cẩu thả của chúng, đặc biệt là việc quy công kém hoặc không có. Trong các cuộc trò chuyện với The Verge trước khi phát hành, một số nhà nghiên cứu đã gọi dòng chảy bài báo sắp tới là “thảm họa rác” (slopocalypse), hoặc các biến thể tương tự về chủ đề này.
Liệu “thảm họa rác” đáng sợ có thực sự xảy ra hay không rất khó nói, phần lớn là do khối lượng tài liệu được phát hành quá lớn và gây hoang mang. Những dấu hiệu ban đầu cho thấy lần này OpenAI cẩn thận hơn với các bài báo, hoặc ít nhất là với một số bài. Một số nhà toán học nói với The Verge rằng ấn tượng đầu tiên của họ tốt hơn nhiều so với dự kiến, mặc dù theo thừa nhận của chính họ, đó khó lòng là một tiêu chuẩn cao khi xét đến các ấn phẩm cẩu thả trước đây của công ty.
“Đó là một mớ hỗn độn lớn. Nó có thể gây ra sự sụp đổ lớn trong văn hóa hàn lâm và làm sụp đổ phần lớn các khoa. Đây là một vấn đề xã hội và có vẻ như các phòng thí nghiệm AI đang hoàn toàn phớt lờ vấn đề này.”
Nhưng tốt hơn không có nghĩa là thực sự tốt, chứ chưa nói đến việc đạt được các tiêu chuẩn thường mong đợi đối với các công trình học thuật đưa ra những tuyên bố tầm cỡ này. Khi thiếu sự xác minh chính thức đối với nhiều tuyên bố của OpenAI, chất lượng của các bài báo đi kèm trở nên quan trọng đặc biệt; chúng là phương tiện chính để các nhà toán học xác nhận, tìm hiểu, xem xét kỹ lưỡng và đặt các kết quả vào bối cảnh.
Việc sản xuất ra các bài báo toán học có tính khắt khe là một công việc khó khăn ngay cả trong những điều kiện thuận lợi nhất. Làm điều đó ở quy mô này là một thử thách đáng sợ. Các mô hình của OpenAI đang sản xuất toán học với tốc độ chóng mặt và trên một loạt các chuyên ngành rộng lớn, vượt xa năng lực của nhân viên con người. Công ty đơn giản là không có đủ chiều rộng chuyên môn hoặc nguồn lực để xem xét kỹ lưỡng các phát hiện của mình ở lằn ranh giới của toán học hiện đại. Các nhà nghiên cứu nói với The Verge rằng điều đó thể hiện rõ qua các sản phẩm.
Nhiều người mô tả các bài báo rất khó, đôi khi gần như là không thể theo dõi. Brendan Hassett, giáo sư toán học tại Đại học Brown, nói với The Verge: “Bản viết lại của bài toán mà tôi rành nhất hầu như chẳng có chút ý nghĩa nào sau một thoáng đọc lướt. Nếu đây là do một con người viết ra, tôi sẽ không dành thêm thời gian để cố gắng hiểu nó nữa. Tất nhiên, điều này vẫn còn để lại 721 bản in thử khác!” (Hassett đưa ra nhận định này trước khi OpenAI gỡ bỏ ba bài báo).
Một số nhà nghiên cứu nói với The Verge rằng một vài bài báo mà họ hoặc đồng nghiệp chú ý dường như đã dẫm lên lối đi mà các nhà toán học khác đã đi qua, mặc dù họ tỏ ra thận trọng khi chưa muốn nói điều đó công khai trước khi có cơ hội đánh giá tài liệu một cách kỹ lưỡng. Những người khác chỉ ra sự ngắn gọn bất thường của công trình, với những kết quả mà họ thường mong đợi sẽ được triển khai qua hàng trăm trang nay lại được nén lại chỉ trong vài chục trang hoặc ít hơn thế.
Nalini Joshi, giáo sư toán học tại Đại học Sydney ở Australia, cho biết một tìm kiếm nhanh qua đợt phát hành cho thấy rất ít điểm chồng chéo với công việc của chính bà, nhưng lưu ý rằng một số bài báo bà đã kiểm tra “có phần thư mục tham khảo ngắn ngủi.” Xét đến những chỉ trích trước đây về các biện pháp quy công của OpenAI, bà cho biết bà “vẫn e ngại rằng việc ghi nhận tác giả trong các bài báo có thể thiếu đi toàn bộ câu chuyện.”
Nhưng vượt lên trên tất cả sự cẩu thả và bất định, sự đồng thuận chung là đợt phát hành này chứa đựng một số công trình thực sự ấn tượng.
Trong khi nhấn mạnh những khó khăn trong việc đánh giá khối lượng tài liệu – và sự cần thiết phải xác minh đúng đắn các kết quả – nhiều nhà nghiên cứu mà The Verge trao đổi cho biết công trình này dường như đạt chất lượng rất cao.
🌐 TOÀ ÁN TOÁN HỌC CHẤN ĐỘNG: GIỚI TOÁN GIA SẼ MẤT NHIỀU NĂM ĐỂ GIẢI MÃ LOẠT KẾT QUẢ AI MỚI TỪ OPENAI “Choáng ngợp.” “Áp đảo.” “Chưa từng có.” “Siêu thực.” “Điên rồ thực sự.” Đó là một số mô tả mà hơn ba chục nhà toán học đã thốt lên trong các cuộc trò chuyện với tờ The Verge khi họ cố gắng tìm hiểu khối lượng kết quả toán học khổng lồ mà OpenAI vừa bất ngờ tung ra trong tuần này. Giữa sự kinh ngạc, phấn khích và không ít bấp bênh trước quy mô ngợp thở của đợt phát hành là nỗi lo lắng sâu sắc về ý nghĩa của tất cả những điều này – và điều gì sẽ diễn ra tiếp theo. Dù có những phản ứng khác nhau, các nhà nghiên cứu đều đồng tình rằng chỉ riêng việc hiểu được những gì OpenAI vừa công bố cũng có thể mất nhiều năm, chưa nói đến việc xác định vị trí của chính họ trong một lĩnh vực đang thay đổi từng ngày xung quanh họ. Nhiều người tỏ ra lo sợ rằng OpenAI sẽ không đợi lâu đến thế trước khi tiến xa hơn – hoặc phát hành nhiều hơn nữa. Tính tổng cộng, OpenAI đã tung ra gần 400 kết quả do AI tạo ra. Chúng trải dài trên hơn 700 bản thảo và bao gồm nhiều chuyên ngành toán học đa dạng, bao gồm tổ hợp, một số nhánh hình học, lý thuyết số, khoa học máy tính lý thuyết, đại số, tô-pô, xác suất và cơ học thống kê, cùng vật lý toán học. Bộ sưu tập này khổng lồ đến mức OpenAI thấy cần phải xuất bản hướng dẫn về cách điều hướng kho lưu trữ GitHub vô tận này. Chính khối lượng công việc khổng lồ này khiến ngay cả một đánh giá sơ bộ về những gì công ty vừa phát hành cũng trở nên khó khăn. Trong những giờ và ngày sau đợt phát hành, hầu hết các nhà toán học mà The Verge trao đổi đều cho biết họ vẫn đang chật vật để tiêu hóa mọi thứ; vài người chia sẻ rằng việc lướt qua mục lục và tóm tắt dài khoảng 40 trang cũng ngốn phần lớn thời gian của một tiếng đồng hồ. Álvaro Lozano-Robledo, giáo sư toán học tại Đại học Connecticut, cho biết: “Chỉ riêng việc xem qua toàn bộ danh sách tóm tắt đã là quá sức rồi.” Ẩn giữa hàng trăm bản thảo là các hình thức chính thức hóa trong Lean, một ngôn ngữ lập trình và trợ lý chứng minh cho phép các kết quả được xác minh bằng máy tính. Những hình thức chính thức hóa này đã chứng minh được tính hữu ích trong việc đánh giá một số tuyên bố toán học trước đây của OpenAI, giúp các nhà nghiên cứu tin tưởng rằng một tuyên bố là chính xác về mặt logic ngay cả khi họ không hiểu hoàn toàn lập luận đằng sau nó. “Nếu các AI biến mất ngay bây giờ, cứ như thể có người ngoài hành tinh đến Trái đất rồi rời đi, chúng ta vẫn sẽ nghiên cứu điều này trong 10 năm tới, cố gắng hiểu mọi thứ.” Tuy nhiên, mức độ xác minh của từng kết quả lại khác nhau rất nhiều. Trên GitHub, OpenAI thừa nhận rằng các kết quả này “đang ở các giai đoạn xác minh khác nhau” và “nhiều, chứ không phải tất cả, các bản thảo đã được chính thức hóa.” Tính đến thời điểm viết bài, chưa đến một nửa số bản thảo trong bộ sưu tập dường như đã được mô tả chính thức. OpenAI cho biết chỉ có 300 kết quả hàng đầu trong tổng số 719 bản thảo đã được chính thức hóa, tương đương khoảng 42 phần trăm, và họ “sẽ cập nhật kho lưu trữ với nhiều hình thức chính thức hóa hơn khi chúng tôi thu thập được.” Nhiều nhà toán học đã phàn nàn với The Verge về việc thiếu sự chính thức hóa, đặc biệt là khi xét đến số lượng kết quả khổng lồ, và nhấn mạnh rằng ngay cả khi mã Lean đi kèm với kết quả, việc đánh giá cũng không diễn ra tức thời. Các nhà nghiên cứu phải kiểm tra xem quá trình chính thức hóa có thực sự chứng minh được những gì kết quả tuyên bố hay không, đây lại là một quá trình tốn thời gian khác. Một số người lật giở các tài liệu cho biết ngay cả khi các bằng chứng có thể xác minh bằng máy tính được cung cấp, chất lượng lại không đồng đều và các phát biểu mà họ xác minh dường như không phải lúc nào cũng khớp gọn gàng với các tuyên bố trong các bản thảo đi kèm. Kevin Buzzard, giáo sư toán học tại Imperial College London, cho biết ông đã xác định được nhiều định lý trong lĩnh vực công tác của mình – lý thuyết số đại số – mà chỉ có khoảng sáu định lý trong số đó là “nổi bật” ngay lập tức. Rất ít, nếu có, trong số đó dường như được xác minh chính thức bằng Lean. Buzzard chia sẻ: “Do đó, tôi hoặc phải đọc những thứ rác rưởi có thể không chính xác, hoặc đợi người khác làm điều tương tự, hoặc đợi ai đó chính thức hóa chúng trước khi tôi có thể chắc chắn rằng các kết quả đó có chính xác hay không.” Mối lo ngại của Buzzard cũng là tiếng lòng của nhiều nhà nghiên cứu khác. Buzzard không hề đơn độc trong việc lo lắng về “rác AI” (AI slop). Thuật ngữ này là từ viết tắt chỉ tài liệu do AI tạo ra có chất lượng thấp, thường xuyên có sai sót, ngày càng xuất hiện nhiều trên mạng – và trong thế giới thực – bao gồm cả các bài báo học thuật. Giống như các lĩnh vực khác, các nhà toán học nói với The Verge rằng họ đã chứng kiến sự gia tăng đột biến các tài liệu như vậy được sản xuất bằng các công cụ như ChatGPT và Claude trong những năm gần đây. Phần lớn trong số đó khó hiểu, khó đọc và thể hiện rất ít sự hiểu biết về chủ đề; chúng đặc biệt cẩu thả khi ghi nhận công lao của các nhà nghiên cứu khác. Các bài viết toán học trước đây của OpenAI từng bị các chuyên gia chỉ trích rộng rãi vì tính cẩu thả của chúng, đặc biệt là việc quy công kém hoặc không có. Trong các cuộc trò chuyện với The Verge trước khi phát hành, một số nhà nghiên cứu đã gọi dòng chảy bài báo sắp tới là “thảm họa rác” (slopocalypse), hoặc các biến thể tương tự về chủ đề này. Liệu “thảm họa rác” đáng sợ có thực sự xảy ra hay không rất khó nói, phần lớn là do khối lượng tài liệu được phát hành quá lớn và gây hoang mang. Những dấu hiệu ban đầu cho thấy lần này OpenAI cẩn thận hơn với các bài báo, hoặc ít nhất là với một số bài. Một số nhà toán học nói với The Verge rằng ấn tượng đầu tiên của họ tốt hơn nhiều so với dự kiến, mặc dù theo thừa nhận của chính họ, đó khó lòng là một tiêu chuẩn cao khi xét đến các ấn phẩm cẩu thả trước đây của công ty. “Đó là một mớ hỗn độn lớn. Nó có thể gây ra sự sụp đổ lớn trong văn hóa hàn lâm và làm sụp đổ phần lớn các khoa. Đây là một vấn đề xã hội và có vẻ như các phòng thí nghiệm AI đang hoàn toàn phớt lờ vấn đề này.” Nhưng tốt hơn không có nghĩa là thực sự tốt, chứ chưa nói đến việc đạt được các tiêu chuẩn thường mong đợi đối với các công trình học thuật đưa ra những tuyên bố tầm cỡ này. Khi thiếu sự xác minh chính thức đối với nhiều tuyên bố của OpenAI, chất lượng của các bài báo đi kèm trở nên quan trọng đặc biệt; chúng là phương tiện chính để các nhà toán học xác nhận, tìm hiểu, xem xét kỹ lưỡng và đặt các kết quả vào bối cảnh. Việc sản xuất ra các bài báo toán học có tính khắt khe là một công việc khó khăn ngay cả trong những điều kiện thuận lợi nhất. Làm điều đó ở quy mô này là một thử thách đáng sợ. Các mô hình của OpenAI đang sản xuất toán học với tốc độ chóng mặt và trên một loạt các chuyên ngành rộng lớn, vượt xa năng lực của nhân viên con người. Công ty đơn giản là không có đủ chiều rộng chuyên môn hoặc nguồn lực để xem xét kỹ lưỡng các phát hiện của mình ở lằn ranh giới của toán học hiện đại. Các nhà nghiên cứu nói với The Verge rằng điều đó thể hiện rõ qua các sản phẩm. Nhiều người mô tả các bài báo rất khó, đôi khi gần như là không thể theo dõi. Brendan Hassett, giáo sư toán học tại Đại học Brown, nói với The Verge: “Bản viết lại của bài toán mà tôi rành nhất hầu như chẳng có chút ý nghĩa nào sau một thoáng đọc lướt. Nếu đây là do một con người viết ra, tôi sẽ không dành thêm thời gian để cố gắng hiểu nó nữa. Tất nhiên, điều này vẫn còn để lại 721 bản in thử khác!” (Hassett đưa ra nhận định này trước khi OpenAI gỡ bỏ ba bài báo). Một số nhà nghiên cứu nói với The Verge rằng một vài bài báo mà họ hoặc đồng nghiệp chú ý dường như đã dẫm lên lối đi mà các nhà toán học khác đã đi qua, mặc dù họ tỏ ra thận trọng khi chưa muốn nói điều đó công khai trước khi có cơ hội đánh giá tài liệu một cách kỹ lưỡng. Những người khác chỉ ra sự ngắn gọn bất thường của công trình, với những kết quả mà họ thường mong đợi sẽ được triển khai qua hàng trăm trang nay lại được nén lại chỉ trong vài chục trang hoặc ít hơn thế. Nalini Joshi, giáo sư toán học tại Đại học Sydney ở Australia, cho biết một tìm kiếm nhanh qua đợt phát hành cho thấy rất ít điểm chồng chéo với công việc của chính bà, nhưng lưu ý rằng một số bài báo bà đã kiểm tra “có phần thư mục tham khảo ngắn ngủi.” Xét đến những chỉ trích trước đây về các biện pháp quy công của OpenAI, bà cho biết bà “vẫn e ngại rằng việc ghi nhận tác giả trong các bài báo có thể thiếu đi toàn bộ câu chuyện.” Nhưng vượt lên trên tất cả sự cẩu thả và bất định, sự đồng thuận chung là đợt phát hành này chứa đựng một số công trình thực sự ấn tượng. Trong khi nhấn mạnh những khó khăn trong việc đánh giá khối lượng tài liệu – và sự cần thiết phải xác minh đúng đắn các kết quả – nhiều nhà nghiên cứu mà The Verge trao đổi cho biết công trình này dường như đạt chất lượng rất cao. 🗞 Nguồn: The Verge #vgsnews #vgs #tintuc
Nguồn: The Verge