Nvidia chỉ ra rằng bộ khung bao quanh mới là yếu tố quyết định của AI, không phải mô hình
Nghiên cứu mới từ Nvidia cho thấy việc tối ưu hóa bộ khung (harness) xử lý bộ nhớ và bổ sung thành phần giám sát quan trọng hơn nhiều so với việc chọn lựa mô hình AI. Bằng cách này, các nhà nghiên cứu đã giúp Claude Opus 5 đạt điểm số tuyệt đối 100% trong bài kiểm tra lý luận ARC-AGI-3.
Vào thứ Sáu, Nvidia đã công bố một số nghiên cứu mới thú vị cho thấy bộ khung (harness), chứ không phải mô hình nền tảng, mới là yếu tố quan trọng hơn nhiều khi yêu cầu AI thực hiện các tác vụ dài hạn.
Tóm tắt nhanh: Chỉ bằng cách sử dụng một bộ khung tùy chỉnh được tinh chỉnh để xử lý bộ nhớ tốt và bao gồm một thành phần "giám sát" giống như sếp, các nhà nghiên cứu đã giúp Claude Opus 5 đạt điểm số 100% trong bài kiểm tra lý luận tương tác ARC-AGI-3. (Đây là một điểm chuẩn từng khiến đối thủ cạnh tranh OpenAI vô cùng đau đầu). Nếu không có bộ khung này, Opus 5 chỉ đạt 30%, vốn là kết quả cao nhất trong số tất cả các mô hình được thử nghiệm.
Nghiên cứu của Nvidia là một chỉ báo khác cho thấy, mặc dù việc lựa chọn mô hình đóng vai trò như bộ não của tác nhân (agent) là quan trọng, nhưng nó chỉ là một phần nhỏ hơn trong hệ thống tác nhân so với những gì nhiều người dùng AI nhận ra, đặc biệt đối với các tác vụ dài hạn. Bộ khung chính là thứ biến một mô hình thành một tác nhân thực thụ: nó xử lý bộ nhớ, ngữ cảnh và phản hồi.
Adel El Hallack, Phó Chủ tịch phụ trách sản phẩm tại đơn vị AI của Nvidia, chia sẻ với TechCrunch: "Nói chung, thế giới coi một tác nhân gần như chỉ là một API của mô hình". Nhưng thực tế, một tác nhân còn nhiều hơn thế. "Đó là mô hình. Đó là hệ thống giàn giáo xung quanh mô hình mà chúng tôi gọi là bộ khung, tức là tập hợp các công cụ mà nó sử dụng. Đó là thời gian chạy (runtime) và các kỹ năng cũng như thư viện liên kết mà chúng ta cho phép nó truy cập".
Các tác vụ dài hạn là những tác vụ đòi hỏi phải chuỗi hóa nhiều quyết định lại với nhau, đôi khi kéo dài trong nhiều ngày, để tạo ra một công việc hoàn thành. Điều này trái ngược với việc AI chỉ đơn thuần nhả ra câu trả lời cho một câu lệnh (prompt). Tìm ra cách làm sao để AI thực hiện các tác vụ dài hạn mà không bị xao lãng và đi chệch hướng là một trong những chén thánh trong nghiên cứu về tác nhân.
Ví dụ: Microsoft đã công bố nghiên cứu vào tháng 4 thử nghiệm 19 mô hình ngôn ngữ lớn (LLM) trên các tác vụ dài hạn liên quan đến chỉnh sửa tài liệu và phát hiện ra rằng tất cả các mô hình, kể cả các mô hình tiên tiến nhất, đều làm tài liệu ngập tràn lỗi. (Nếu con người làm việc như vậy, họ chắc chắn sẽ bị sa thải ngay lập tức).
Các mô hình tự chuỗi hóa quyết định cũng từng bị bắt quả tang tự ý xóa tệp của người dùng, thậm chí là toàn bộ cơ sở dữ liệu hoặc chuyển sang hành vi tội phạm để đạt được mục tiêu từ thông đồng đến hack hệ thống.
Quyết định sử dụng bài kiểm tra lý luận tương tác này của các nhà nghiên cứu Nvidia mang ý nghĩa đặc biệt, thậm chí có phần hài hước. Đây là một bài kiểm tra gồm một loạt các trò chơi 2D không có hướng dẫn. Mô hình phải tự tìm cách chơi và chiến thắng. Điểm số 100% có nghĩa là mô hình có thể vượt qua các trò chơi này giỏi như con người.
OpenAI đã vô cùng lúng túng trước điểm số thảm hại của các mô hình của mình (dưới 10%) trên ARC-AGI-3 đến mức họ đã tự tiến hành nghiên cứu vào tháng trước. Giống như Nvidia, OpenAI phát hiện ra rằng chỉ bằng cách tinh chỉnh hai cài đặt trên bộ khung, các mô hình của họ đã tăng gấp ba lần điểm số.
Nhưng không có mô hình nào đạt gần mức điểm 100% như các nhà nghiên cứu của Nvidia đã đạt được. Họ cho thấy bộ khung cần phải có một thành phần "giám sát" để thúc đẩy tác nhân đi đúng hướng nếu nó bị mắc kẹt.
El Hallack cho biết: "Phần thú vị hơn là giới thiệu một tác nhân giám sát bên cạnh tác nhân chính đang thực hiện công việc". Nó "hầu như đóng vai trò như một giám đốc điều hành (CEO) để thúc giục tác nhân khi nó đi chệch hướng hoặc bắt đầu khám phá một con đường có thể dẫn đến ngõ cụt, hoặc quay lại khám phá một con đường mà nó đã từng đi qua".
Mặc dù khái niệm về tác nhân giám sát không hẳn là mới, nhưng ngày nay hầu hết người dùng tác nhân chỉ dựa vào một lớp duy nhất cho bộ khung của họ, như Claude Code, Codex, Hermes, v.v. Các nhà nghiên cứu của Nvidia đã tạo ra một bộ khung nâng cấp của riêng họ gọi là Bộ toán tử biến thể tác nhân (Agentic Variation Operators - AVO). Lưu ý rằng đây không phải là một sản phẩm mới của Nvidia. Thay vào đó, Nvidia sản xuất rất nhiều công nghệ mở nhỏ lẻ để xây dựng các bộ khung dưới thương hiệu Nemo. Một phần công nghệ đó là thương mại, nhưng phần lớn có sẵn dưới dạng mã nguồn mở.
Dù vậy, kết quả của Nvidia một lần nữa củng cố bằng chứng cho thấy việc lựa chọn mô hình không phải là yếu tố duy nhất quyết định hiệu suất của tác nhân. Ví dụ, vào tháng 7, Databricks đã công bố một nghiên cứu ấn tượng cho thấy bộ khung, hơn là mô hình, tác động đáng kể đến chi phí AI.
CEO Databricks Ali Ghodsi nói với TechCrunch: "Bạn có thể chọn cùng một mô hình nhưng với các bộ khung khác nhau, và bạn sẽ tốn kém chi phí hơn rất nhiều nếu sử dụng sai bộ khung. Vì vậy, bạn nghĩ rằng, ồ, đây là một mô hình đắt tiền. Đây là một mô hình giá rẻ. Nhưng khoan đã, bạn đang sử dụng bộ khung nào? Bản thân điều đó có thể làm tăng gấp đôi chi phí của bạn".
Quan điểm lớn hơn của Nvidia là cho thấy các bộ khung mở, giống như các mô hình mở, trao quyền kiểm soát cho người dùng nhiều hơn họ nhận thực.
El Hallack chia sẻ: "Chúng tôi tin tưởng, và chúng tôi đang chứng minh cùng với hệ sinh thái, cách các bộ khung mở cho phép bạn vặn nhiều nút hơn nữa để đẩy độ chính xác lên cao". Điều này liên quan đến việc OpenAI đang làm chậm quá trình huấn luyện các mô hình của họ do các mô hình tạo ra các lỗ hổng bảo mật.
Ông bổ sung thêm: "Chúng tôi tin rằng việc sở hữu một ngăn xếp tác nhân mở — nơi bạn có quyền kiểm soát trên toàn bộ bộ khung, cơ sở hạ tầng, thời gian chạy — là những gì cần thiết để đưa hệ sinh thái tiến lên phía trước một cách an toàn".
🚀 NVIDIA CHỈ RA RẰNG BỘ KHUNG BAO QUANH MỚI LÀ YẾU TỐ QUYẾT ĐỊNH CỦA AI, KHÔNG PHẢI MÔ HÌNH Vào thứ Sáu, Nvidia đã công bố một số nghiên cứu mới thú vị cho thấy bộ khung (harness), chứ không phải mô hình nền tảng, mới là yếu tố quan trọng hơn nhiều khi yêu cầu AI thực hiện các tác vụ dài hạn. Tóm tắt nhanh: Chỉ bằng cách sử dụng một bộ khung tùy chỉnh được tinh chỉnh để xử lý bộ nhớ tốt và bao gồm một thành phần "giám sát" giống như sếp, các nhà nghiên cứu đã giúp Claude Opus 5 đạt điểm số 100% trong bài kiểm tra lý luận tương tác ARC-AGI-3. (Đây là một điểm chuẩn từng khiến đối thủ cạnh tranh OpenAI vô cùng đau đầu). Nếu không có bộ khung này, Opus 5 chỉ đạt 30%, vốn là kết quả cao nhất trong số tất cả các mô hình được thử nghiệm. Nghiên cứu của Nvidia là một chỉ báo khác cho thấy, mặc dù việc lựa chọn mô hình đóng vai trò như bộ não của tác nhân (agent) là quan trọng, nhưng nó chỉ là một phần nhỏ hơn trong hệ thống tác nhân so với những gì nhiều người dùng AI nhận ra, đặc biệt đối với các tác vụ dài hạn. Bộ khung chính là thứ biến một mô hình thành một tác nhân thực thụ: nó xử lý bộ nhớ, ngữ cảnh và phản hồi. Adel El Hallack, Phó Chủ tịch phụ trách sản phẩm tại đơn vị AI của Nvidia, chia sẻ với TechCrunch: "Nói chung, thế giới coi một tác nhân gần như chỉ là một API của mô hình". Nhưng thực tế, một tác nhân còn nhiều hơn thế. "Đó là mô hình. Đó là hệ thống giàn giáo xung quanh mô hình mà chúng tôi gọi là bộ khung, tức là tập hợp các công cụ mà nó sử dụng. Đó là thời gian chạy (runtime) và các kỹ năng cũng như thư viện liên kết mà chúng ta cho phép nó truy cập". Các tác vụ dài hạn là những tác vụ đòi hỏi phải chuỗi hóa nhiều quyết định lại với nhau, đôi khi kéo dài trong nhiều ngày, để tạo ra một công việc hoàn thành. Điều này trái ngược với việc AI chỉ đơn thuần nhả ra câu trả lời cho một câu lệnh (prompt). Tìm ra cách làm sao để AI thực hiện các tác vụ dài hạn mà không bị xao lãng và đi chệch hướng là một trong những chén thánh trong nghiên cứu về tác nhân. Ví dụ: Microsoft đã công bố nghiên cứu vào tháng 4 thử nghiệm 19 mô hình ngôn ngữ lớn (LLM) trên các tác vụ dài hạn liên quan đến chỉnh sửa tài liệu và phát hiện ra rằng tất cả các mô hình, kể cả các mô hình tiên tiến nhất, đều làm tài liệu ngập tràn lỗi. (Nếu con người làm việc như vậy, họ chắc chắn sẽ bị sa thải ngay lập tức). Các mô hình tự chuỗi hóa quyết định cũng từng bị bắt quả tang tự ý xóa tệp của người dùng, thậm chí là toàn bộ cơ sở dữ liệu hoặc chuyển sang hành vi tội phạm để đạt được mục tiêu từ thông đồng đến hack hệ thống. Quyết định sử dụng bài kiểm tra lý luận tương tác này của các nhà nghiên cứu Nvidia mang ý nghĩa đặc biệt, thậm chí có phần hài hước. Đây là một bài kiểm tra gồm một loạt các trò chơi 2D không có hướng dẫn. Mô hình phải tự tìm cách chơi và chiến thắng. Điểm số 100% có nghĩa là mô hình có thể vượt qua các trò chơi này giỏi như con người. OpenAI đã vô cùng lúng túng trước điểm số thảm hại của các mô hình của mình (dưới 10%) trên ARC-AGI-3 đến mức họ đã tự tiến hành nghiên cứu vào tháng trước. Giống như Nvidia, OpenAI phát hiện ra rằng chỉ bằng cách tinh chỉnh hai cài đặt trên bộ khung, các mô hình của họ đã tăng gấp ba lần điểm số. Nhưng không có mô hình nào đạt gần mức điểm 100% như các nhà nghiên cứu của Nvidia đã đạt được. Họ cho thấy bộ khung cần phải có một thành phần "giám sát" để thúc đẩy tác nhân đi đúng hướng nếu nó bị mắc kẹt. El Hallack cho biết: "Phần thú vị hơn là giới thiệu một tác nhân giám sát bên cạnh tác nhân chính đang thực hiện công việc". Nó "hầu như đóng vai trò như một giám đốc điều hành (CEO) để thúc giục tác nhân khi nó đi chệch hướng hoặc bắt đầu khám phá một con đường có thể dẫn đến ngõ cụt, hoặc quay lại khám phá một con đường mà nó đã từng đi qua". Mặc dù khái niệm về tác nhân giám sát không hẳn là mới, nhưng ngày nay hầu hết người dùng tác nhân chỉ dựa vào một lớp duy nhất cho bộ khung của họ, như Claude Code, Codex, Hermes, v.v. Các nhà nghiên cứu của Nvidia đã tạo ra một bộ khung nâng cấp của riêng họ gọi là Bộ toán tử biến thể tác nhân (Agentic Variation Operators - AVO). Lưu ý rằng đây không phải là một sản phẩm mới của Nvidia. Thay vào đó, Nvidia sản xuất rất nhiều công nghệ mở nhỏ lẻ để xây dựng các bộ khung dưới thương hiệu Nemo. Một phần công nghệ đó là thương mại, nhưng phần lớn có sẵn dưới dạng mã nguồn mở. Dù vậy, kết quả của Nvidia một lần nữa củng cố bằng chứng cho thấy việc lựa chọn mô hình không phải là yếu tố duy nhất quyết định hiệu suất của tác nhân. Ví dụ, vào tháng 7, Databricks đã công bố một nghiên cứu ấn tượng cho thấy bộ khung, hơn là mô hình, tác động đáng kể đến chi phí AI. CEO Databricks Ali Ghodsi nói với TechCrunch: "Bạn có thể chọn cùng một mô hình nhưng với các bộ khung khác nhau, và bạn sẽ tốn kém chi phí hơn rất nhiều nếu sử dụng sai bộ khung. Vì vậy, bạn nghĩ rằng, ồ, đây là một mô hình đắt tiền. Đây là một mô hình giá rẻ. Nhưng khoan đã, bạn đang sử dụng bộ khung nào? Bản thân điều đó có thể làm tăng gấp đôi chi phí của bạn". Quan điểm lớn hơn của Nvidia là cho thấy các bộ khung mở, giống như các mô hình mở, trao quyền kiểm soát cho người dùng nhiều hơn họ nhận thực. El Hallack chia sẻ: "Chúng tôi tin tưởng, và chúng tôi đang chứng minh cùng với hệ sinh thái, cách các bộ khung mở cho phép bạn vặn nhiều nút hơn nữa để đẩy độ chính xác lên cao". Điều này liên quan đến việc OpenAI đang làm chậm quá trình huấn luyện các mô hình của họ do các mô hình tạo ra các lỗ hổng bảo mật. Ông bổ sung thêm: "Chúng tôi tin rằng việc sở hữu một ngăn xếp tác nhân mở — nơi bạn có quyền kiểm soát trên toàn bộ bộ khung, cơ sở hạ tầng, thời gian chạy — là những gì cần thiết để đưa hệ sinh thái tiến lên phía trước một cách an toàn". 🗞 Nguồn: TechCrunch #vgsnews #vgs #tintuc
Nguồn: TechCrunch