Mô hình AI Beam từ Reflection: Dùng 10.500 GPU GB300, siêu hiệu quả và vượt trội
Startup Reflection được NVIDIA hậu thuẫn vừa ra mắt Beam, mô hình mã nguồn mở 501 tỷ tham số cực kỳ hiệu quả. Beam được huấn luyện trong 4 tuần sử dụng 10.500 GPU GB300 và 46,4 triệu sandbox mỗi ngày.

Các phòng thí nghiệm AI phương Tây cuối cùng cũng đang cố gắng cạnh tranh với DeepSeek và Zhipu (Z.ai) của Trung Quốc trong việc tạo ra các mô hình mã nguồn mở hiệu quả. Đơn cử như Beam của Reflection, một mô hình Mixture of Experts (MoE) thưa với 501 tỷ tham số mang lại hiệu quả cực kỳ cao.
Reflection tuyên bố Beam "hiệu quả hơn gấp 3-4 lần so với GLM 5.2 và hiệu quả hơn gấp 4 lần so với các mô hình mở hàng đầu của phương Tây".
Đối với những ai chưa biết, Beam của Reflection sở hữu 501 tỷ tham số, nhưng chỉ có 23 tỷ tham số được kích hoạt tại bất kỳ thời điểm nào. Để hiểu về MoE, hãy tưởng tượng một nhà bếp lớn có rất nhiều đầu bếp chuyên môn hóa (các chuyên gia định tuyến). Tuy nhiên, mô hình chỉ kích hoạt các đầu bếp chuyên môn khi cần thiết. Ví dụ, để chuẩn bị một món bánh soufflé, mô hình sẽ chỉ kích hoạt các chuyên gia làm bánh ngọt của mình, chứ không phải những người giỏi chế biến món ăn phương Đông.
Hơn nữa, một mô hình AI cơ bản bao gồm một loạt các khối transformer được tạo ra từ hai yếu tố chính:
Lớp Attention xem xét cách các từ trong một câu kết nối với nhau. Ví dụ, nếu bạn đưa cho mô hình một câu lệnh cho biết Paris là thủ đô của nước Pháp, lớp attention sẽ liên kết từ 'capital' với 'France' và xác định 'Paris' là câu trả lời. Dù vậy, lớp này không biết ý nghĩa của France hoặc Paris là gì, nhưng sẽ lưu các ghi chú này dưới dạng bộ đệm KV cache. Khi bối cảnh tăng lên, bộ đệm KV cache cũng tăng theo.
Mạng chuyển tiếp Feed-Forward Network (FFN) chứa tổng hợp kiến thức của mô hình dưới dạng các trọng số, và chính lớp này sử dụng các công thức toán học sâu sắc để khai thác ý nghĩa đằng sau mỗi từ. Ví dụ, nó sẽ nhìn vào France và kích hoạt bách khoa toàn thư quốc gia của nó, v.v.
Tuy nhiên, để ngăn bộ đệm KV cache phát triển quá lớn và thúc đẩy hiệu quả, Beam sử dụng một số thủ thuật:
Tận dụng chuyên gia đồng đều - Tất cả các chuyên gia/đầu bếp chuyên môn đều nhận được lượng công việc xấp xỉ nhau. Điều này có nghĩa là không có chuyên gia nào bị kiệt sức hoặc phải ngồi chơi quá lâu. Theo Reflection, chuyên gia bận rộn nhất của Beam chỉ bận gấp 1,04 lần mức trung bình, gần như hoàn toàn đồng đều.
Chia tỉ lệ phần dư dựa trên độ sâu và dòng phần dư được kiểm soát - Các mô hình thường xử lý token qua hàng chục lớp liên tiếp, nơi các kết quả toán học từ các tiểu lớp riêng lẻ (như attention và feed-forward network) liên tục tích lũy. Tuy nhiên, khi các mô hình trở nên rất lớn, việc bổ sung tích lũy này thường kích hoạt sự bùng nổ kích hoạt khổng lồ và các giá trị ngoại lai về mặt số học, gây ra hiện tượng méo tín hiệu hoặc không ổn định khi huấn luyện. Để chống lại điều này, Beam sử dụng các hệ số chia tỉ lệ giúp giảm dần độ lớn đầu ra của từng tiểu lớp khi token đi sâu hơn vào mạng, đảm bảo thông tin lưu chuyển một cách rõ ràng, có thể dự đoán trước.
SandwichNorm - Các mô hình thường chuẩn hóa token trước khi chúng đi vào tiểu lớp hoặc sau khi chúng thoát ra. Điều này đảm bảo rằng các giá trị token nằm trong một phạm vi nghiêm ngặt, có thể dự đoán trước. Tuy nhiên, Beam chuẩn hóa token ở cả điểm đầu vào và điểm đầu ra của mỗi tiểu lớp (kẹp bánh mì), đảm bảo rằng các hoạt hóa (biểu diễn toán học nội bộ do mô hình tạo ra khi các token được xử lý bởi nhiều lớp transformer, còn gọi là trạng thái ẩn) không bao giờ trôi dạt hoặc tạo ra các giá trị ngoại lai số cực đoan.
Cổng Attention (Attention gating) - Sau khi mô hình tính toán attention (tạo KV cache), có một "núm vặn âm lượng" nhỏ (một chiếc cổng) quyết định mức độ kết quả attention đó thực sự được sử dụng. Nó có thể tăng hoặc giảm tín hiệu cho các phần khác nhau, giúp mô hình có tính chọn lọc và ổn định hơn.
Mặt khác, tích lũy phần dư FP32 - Trong khi mô hình chạy với các con số có độ chính xác thấp hơn, rẻ hơn để tiết kiệm tốc độ và bộ nhớ, thì các phép bổ sung phần dư (skip-connection) quan trọng vẫn được thực hiện bằng các con số 32-bit độ chính xác cao đầy đủ. Điều này ngăn chặn các lỗi làm tròn nhỏ tích tụ và làm hỏng quá trình huấn luyện.
Bây giờ chúng ta đã xem xét các yếu tố làm cho Beam của Reflection khá hiệu quả, hãy cùng tìm hiểu về quá trình huấn luyện của nó. Sau khi một mô hình trải qua quá trình huấn luyện trước (pre-train), các phòng thí nghiệm AI thường thực hiện một quá trình gọi là Học tăng cường (Reinforcement Learning - RL), nơi mô hình được kết nối với vô số tác nhân trong các sandbox của riêng chúng để dạy nó các kỹ năng thực tế như lập trình.
Reflection lưu ý trong blog chuyên dụng của họ:
"Chúng tôi đã huấn luyện Beam với hình phạt độ dài có thể điều khiển được, thưởng cho các giải pháp thành công đồng thời ngăn cản các token không cần thiết. Vào đầu giai đoạn RL, hiệu suất được cải thiện ngay cả khi độ dài hoàn thành giảm xuống: mô hình đã học cách giải quyết các nhiệm vụ hiệu quả hơn với ít lý luận hơn. Sau đó, khi Beam phát triển các khả năng tác nhân mạnh mẽ hơn, độ dài hoàn thành lại tăng lên, nhưng các token bổ sung đó đã hỗ trợ thêm cho việc đạt hiệu suất cao hơn."
Đáng chú ý, Reflection tuyên bố rằng họ đã huấn luyện Beam trong khoảng thời gian 4 tuần (28 ngày) và sử dụng 1,3 tỷ sandbox, được triển khai trên hơn 10.500 GPU NVIDIA GB300. Con số này tương đương với 46,4 triệu sandbox mỗi ngày. Giai đoạn RL kéo dài qua 1 triệu môi trường lập trình, tác nhân và STEM, liên quan đến 100 triệu lần triển khai (kết quả và các phần thưởng đi kèm được tạo ra khi một tác nhân tương tác với một môi trường nhất định).
Lưu ý rằng đơn vị DSec độc quyền của DeepSeek xử lý 3 triệu sandbox. Để đạt được sự ngang bằng với quy mô của Reflection, DeepSeek sẽ phải chạy khoảng 16 đơn vị DSec, trải dài trên 656 GPU GB300 cho mỗi đơn vị (tổng cộng khoảng 10.500 GPU).
Trở lại vấn đề, thông thường trong Học tăng cường, quá trình huấn luyện phải tạm dừng khi trọng số của mô hình được cập nhật với các kết quả đã học từ các phiên trước đó. Tuy nhiên, Reflection đã tách rời đường ống (pipeline):
Các tác nhân triển khai (Rollout Workers) liên tục tạo ra phản hồi token.
Các công cụ học tập (Learner Engines) liên tục cập nhật trọng số của mô hình bằng cách sử dụng các phản hồi đó.
Vì các công cụ học tập cập nhật mô hình trong khi các công cụ triển khai vẫn đang tạo văn bản, dữ liệu sẽ trở nên không đồng bộ (gradient chính sách không đồng bộ), dẫn đến hiện tượng gọi là độ lệch chính sách (policy staleness). Sau đó, Beam chống lại tiếng ショ ồn và sự không khớp về số học kết quả thông qua nhóm ổn định cốt lõi của nó: SandwichNorm, cổng attention và chia tỉ lệ phần dư dựa trên độ sâu (tất cả đã được giải thích trước đó). Bằng cách sử dụng tất cả các thủ thuật khéo léo này, Reflection đã có thể tăng tốc đáng kể quá trình huấn luyện của Beam.
Kết quả là, hiệu suất của Beam phần lớn tương ơng với GLM-5.2, trong khi yêu cầu lượng tính toán liên quan đến suy luận ít hơn khoảng 3-4 lần. Tất nhiên, Beam vẫn xếp sau Qwen 3.8 Max, nhưng mô hình này vẫn cực kỳ mạnh mẽ so với kích thước của nó.
⚡ MÔ HÌNH AI BEAM TỪ REFLECTION: DÙNG 10.500 GPU GB300, SIÊU HIỆU QUẢ VÀ VƯỢT TRỘI Các phòng thí nghiệm AI phương Tây cuối cùng cũng đang cố gắng cạnh tranh với DeepSeek và Zhipu (Z.ai) của Trung Quốc trong việc tạo ra các mô hình mã nguồn mở hiệu quả. Đơn cử như Beam của Reflection, một mô hình Mixture of Experts (MoE) thưa với 501 tỷ tham số mang lại hiệu quả cực kỳ cao. Reflection tuyên bố Beam "hiệu quả hơn gấp 3-4 lần so với GLM 5.2 và hiệu quả hơn gấp 4 lần so với các mô hình mở hàng đầu của phương Tây". Đối với những ai chưa biết, Beam của Reflection sở hữu 501 tỷ tham số, nhưng chỉ có 23 tỷ tham số được kích hoạt tại bất kỳ thời điểm nào. Để hiểu về MoE, hãy tưởng tượng một nhà bếp lớn có rất nhiều đầu bếp chuyên môn hóa (các chuyên gia định tuyến). Tuy nhiên, mô hình chỉ kích hoạt các đầu bếp chuyên môn khi cần thiết. Ví dụ, để chuẩn bị một món bánh soufflé, mô hình sẽ chỉ kích hoạt các chuyên gia làm bánh ngọt của mình, chứ không phải những người giỏi chế biến món ăn phương Đông. Hơn nữa, một mô hình AI cơ bản bao gồm một loạt các khối transformer được tạo ra từ hai yếu tố chính: Lớp Attention xem xét cách các từ trong một câu kết nối với nhau. Ví dụ, nếu bạn đưa cho mô hình một câu lệnh cho biết Paris là thủ đô của nước Pháp, lớp attention sẽ liên kết từ 'capital' với 'France' và xác định 'Paris' là câu trả lời. Dù vậy, lớp này không biết ý nghĩa của France hoặc Paris là gì, nhưng sẽ lưu các ghi chú này dưới dạng bộ đệm KV cache. Khi bối cảnh tăng lên, bộ đệm KV cache cũng tăng theo. Mạng chuyển tiếp Feed-Forward Network (FFN) chứa tổng hợp kiến thức của mô hình dưới dạng các trọng số, và chính lớp này sử dụng các công thức toán học sâu sắc để khai thác ý nghĩa đằng sau mỗi từ. Ví dụ, nó sẽ nhìn vào France và kích hoạt bách khoa toàn thư quốc gia của nó, v.v. Tuy nhiên, để ngăn bộ đệm KV cache phát triển quá lớn và thúc đẩy hiệu quả, Beam sử dụng một số thủ thuật: Tận dụng chuyên gia đồng đều - Tất cả các chuyên gia/đầu bếp chuyên môn đều nhận được lượng công việc xấp xỉ nhau. Điều này có nghĩa là không có chuyên gia nào bị kiệt sức hoặc phải ngồi chơi quá lâu. Theo Reflection, chuyên gia bận rộn nhất của Beam chỉ bận gấp 1,04 lần mức trung bình, gần như hoàn toàn đồng đều. Chia tỉ lệ phần dư dựa trên độ sâu và dòng phần dư được kiểm soát - Các mô hình thường xử lý token qua hàng chục lớp liên tiếp, nơi các kết quả toán học từ các tiểu lớp riêng lẻ (như attention và feed-forward network) liên tục tích lũy. Tuy nhiên, khi các mô hình trở nên rất lớn, việc bổ sung tích lũy này thường kích hoạt sự bùng nổ kích hoạt khổng lồ và các giá trị ngoại lai về mặt số học, gây ra hiện tượng méo tín hiệu hoặc không ổn định khi huấn luyện. Để chống lại điều này, Beam sử dụng các hệ số chia tỉ lệ giúp giảm dần độ lớn đầu ra của từng tiểu lớp khi token đi sâu hơn vào mạng, đảm bảo thông tin lưu chuyển một cách rõ ràng, có thể dự đoán trước. SandwichNorm - Các mô hình thường chuẩn hóa token trước khi chúng đi vào tiểu lớp hoặc sau khi chúng thoát ra. Điều này đảm bảo rằng các giá trị token nằm trong một phạm vi nghiêm ngặt, có thể dự đoán trước. Tuy nhiên, Beam chuẩn hóa token ở cả điểm đầu vào và điểm đầu ra của mỗi tiểu lớp (kẹp bánh mì), đảm bảo rằng các hoạt hóa (biểu diễn toán học nội bộ do mô hình tạo ra khi các token được xử lý bởi nhiều lớp transformer, còn gọi là trạng thái ẩn) không bao giờ trôi dạt hoặc tạo ra các giá trị ngoại lai số cực đoan. Cổng Attention (Attention gating) - Sau khi mô hình tính toán attention (tạo KV cache), có một "núm vặn âm lượng" nhỏ (một chiếc cổng) quyết định mức độ kết quả attention đó thực sự được sử dụng. Nó có thể tăng hoặc giảm tín hiệu cho các phần khác nhau, giúp mô hình có tính chọn lọc và ổn định hơn. Mặt khác, tích lũy phần dư FP32 - Trong khi mô hình chạy với các con số có độ chính xác thấp hơn, rẻ hơn để tiết kiệm tốc độ và bộ nhớ, thì các phép bổ sung phần dư (skip-connection) quan trọng vẫn được thực hiện bằng các con số 32-bit độ chính xác cao đầy đủ. Điều này ngăn chặn các lỗi làm tròn nhỏ tích tụ và làm hỏng quá trình huấn luyện. Bây giờ chúng ta đã xem xét các yếu tố làm cho Beam của Reflection khá hiệu quả, hãy cùng tìm hiểu về quá trình huấn luyện của nó. Sau khi một mô hình trải qua quá trình huấn luyện trước (pre-train), các phòng thí nghiệm AI thường thực hiện một quá trình gọi là Học tăng cường (Reinforcement Learning - RL), nơi mô hình được kết nối với vô số tác nhân trong các sandbox của riêng chúng để dạy nó các kỹ năng thực tế như lập trình. Reflection lưu ý trong blog chuyên dụng của họ: "Chúng tôi đã huấn luyện Beam với hình phạt độ dài có thể điều khiển được, thưởng cho các giải pháp thành công đồng thời ngăn cản các token không cần thiết. Vào đầu giai đoạn RL, hiệu suất được cải thiện ngay cả khi độ dài hoàn thành giảm xuống: mô hình đã học cách giải quyết các nhiệm vụ hiệu quả hơn với ít lý luận hơn. Sau đó, khi Beam phát triển các khả năng tác nhân mạnh mẽ hơn, độ dài hoàn thành lại tăng lên, nhưng các token bổ sung đó đã hỗ trợ thêm cho việc đạt hiệu suất cao hơn." Đáng chú ý, Reflection tuyên bố rằng họ đã huấn luyện Beam trong khoảng thời gian 4 tuần (28 ngày) và sử dụng 1,3 tỷ sandbox, được triển khai trên hơn 10.500 GPU NVIDIA GB300. Con số này tương đương với 46,4 triệu sandbox mỗi ngày. Giai đoạn RL kéo dài qua 1 triệu môi trường lập trình, tác nhân và STEM, liên quan đến 100 triệu lần triển khai (kết quả và các phần thưởng đi kèm được tạo ra khi một tác nhân tương tác với một môi trường nhất định). Lưu ý rằng đơn vị DSec độc quyền của DeepSeek xử lý 3 triệu sandbox. Để đạt được sự ngang bằng với quy mô của Reflection, DeepSeek sẽ phải chạy khoảng 16 đơn vị DSec, trải dài trên 656 GPU GB300 cho mỗi đơn vị (tổng cộng khoảng 10.500 GPU). Trở lại vấn đề, thông thường trong Học tăng cường, quá trình huấn luyện phải tạm dừng khi trọng số của mô hình được cập nhật với các kết quả đã học từ các phiên trước đó. Tuy nhiên, Reflection đã tách rời đường ống (pipeline): Các tác nhân triển khai (Rollout Workers) liên tục tạo ra phản hồi token. Các công cụ học tập (Learner Engines) liên tục cập nhật trọng số của mô hình bằng cách sử dụng các phản hồi đó. Vì các công cụ học tập cập nhật mô hình trong khi các công cụ triển khai vẫn đang tạo văn bản, dữ liệu sẽ trở nên không đồng bộ (gradient chính sách không đồng bộ), dẫn đến hiện tượng gọi là độ lệch chính sách (policy staleness). Sau đó, Beam chống lại tiếng ショ ồn và sự không khớp về số học kết quả thông qua nhóm ổn định cốt lõi của nó: SandwichNorm, cổng attention và chia tỉ lệ phần dư dựa trên độ sâu (tất cả đã được giải thích trước đó). Bằng cách sử dụng tất cả các thủ thuật khéo léo này, Reflection đã có thể tăng tốc đáng kể quá trình huấn luyện của Beam. Kết quả là, hiệu suất của Beam phần lớn tương ơng với GLM-5.2, trong khi yêu cầu lượng tính toán liên quan đến suy luận ít hơn khoảng 3-4 lần. Tất nhiên, Beam vẫn xếp sau Qwen 3.8 Max, nhưng mô hình này vẫn cực kỳ mạnh mẽ so với kích thước của nó. 🗞 Nguồn: Wccftech #vgsnews #vgs #tintuc