Mô hình DeepSeek V4.1-Flash 552B đạt tốc độ 494 token/giây trên dàn máy gia đình
Chuyên gia công nghệ Patrick Moorhead vừa thử nghiệm chạy mô hình 552 tỷ tham số DeepSeek V4.1-Flash trên hệ thống gồm 4 thiết bị NVIDIA DGX Spark tại nhà. Cấu hình này đạt tốc độ xử lý đỉnh cao lên tới gần 500 token mỗi giây mà không cần dùng đến switch mạng đắt đỏ.

Nếu bạn muốn đảm bảo tính bảo mật cho dữ liệu độc quyền của mình với độ chính xác gần như tuyệt đối, việc lưu trữ một mô hình mã nguồn mở có năng lực trên thiết lập của riêng bạn vẫn là phương án tối ưu nhất. Các thiết lập được tối ưu hóa mang lại thông lượng chưa từng có ngay cả đối với các mô hình tương đối lớn. Trên thực tế, mô hình DeepSeek V4.1-Flash với 552 tỷ tham số gần đây đã có thể đạt được thông lượng suy luận đẳng cấp như Cerebras khi được lưu trữ trên một giàn máy tại nhà bao gồm 4 thiết bị NVIDIA DGX Spark.
Cụm 4 nút NVIDIA DGX Spark, không cần bộ định tuyến quang học hay switch Ethernet, đã có thể mang lại hiệu suất đầu ra đạt đỉnh gần 500 token mỗi giây.
Patrick Moorhead, chuyên gia công nghệ và kỳ cựu trong lĩnh vực AMD, vừa tiết lộ thiết lập AI tại nhà của ông. Thiết lập này bao gồm 4 thiết bị NVIDIA DGX Spark - cung cấp bộ nhớ thống nhất gộp lại khoảng 512 GB - được xếp chồng bên trong một tủ rack nhỏ gọn "tec MOJO" với các quạt tản nhiệt bổ sung bên dưới.
Để bạn đọc dễ hình dung, mỗi hệ thống NVIDIA DGX Spark được sử dụng ở đây bao gồm:
- Một CPU Arm 20 nhân (10 nhân hiệu năng cao Cortex-X925 + 10 nhân tiết kiệm điện Cortex-A725, mỗi nhân có bộ nhớ đệm L2 riêng và bộ nhớ đệm L3 16 MB cho mỗi cụm, tổng cộng là 32 MB).
- GPU tích hợp GB10 trang bị Tensor Cores thế hệ thứ năm hỗ trợ DLSS 4 và các nhân RTX Ray Tracing, mang lại hiệu suất tính toán lên tới 31 TFLOPs cho FP32 và 1000 TOPS cho NVFP4 (FP4) đối với các tác vụ AI.
- Bộ nhớ hệ thống LPDDR5X thống nhất mạch lạc 128 GB (chia sẻ giữa CPU và GPU) với băng thông khoảng 273 GB/s (giao diện bộ nhớ 256-bit).
- SmartNIC ConnectX-7 với hai cổng QSFP 200 Gb/s dành cho kết nối cụm tốc độ cao, cùng với 10 GbE, Wi-Fi 7, Bluetooth, HDMI 2.1a và nhiều cổng USB-C.
- Dung lượng lưu trữ tiêu chuẩn từ 1–4 TB NVMe SSD.
- Mức tiêu thụ điện năng trong khoảng 140–240 W với bộ đổi nguồn đi kèm.
- NVIDIA DGX OS (dựa trên Ubuntu) với toàn bộ ngăn xếp phần mềm CUDA AI.
Một điểm quan trọng cần lưu ý là cả bốn thiết bị NVIDIA DGX Spark đều được kết nối với nhau thông qua cấu trúc vòng không dùng switch (switchless ring topology) bằng cáp QSFP:
- Spark 1 kết nối với Spark 2 và Spark 4
- Spark 2 kết nối với Spark 1 và Spark 3
- Spark 3 kết nối với Spark 2 và Spark 4
- Spark 4 kết nối với Spark 3 và Spark 1
Lưu ý rằng NVIDIA khuyên dùng switch 200 GbE (cấu trúc hình sao - star topology) để kết nối 4 thiết bị DGX Spark. Dĩ nhiên, switch sẽ làm tăng tổng chi phí của giàn máy.
Trong khi đó, một quyết định thông minh là Moorhead đã chọn lưu trữ mô hình DeepSeek V4.1-Flash cực kỳ hiệu quả trên tủ rack 4 nút NVIDIA DGX Spark của mình. Như chúng tôi đã trình bày chi tiết trong một bài viết riêng gần đây, mô hình này có 552 tỷ tham số, chỉ với 8 tỷ tham số hoạt động ở giai đoạn tiền điền (prefill) và 16 tỷ ở giai đoạn giải mã (decode). Ngoài ra, mô hình có 1 chuyên gia chia sẻ và 384 chuyên gia định tuyến (6 hoạt động). Hơn nữa, mô hình mới nhất của DeepSeek tích hợp một số yếu tố kiến trúc - bao gồm Causal Encoder-Decoder (CED), Compressed Sparse Attention 2 (CSA2), lượng tử hóa FP4 và SWA Bounded Replay - giúp giảm bộ nhớ đệm KV tổng thể xuống chỉ còn 890 byte cho mỗi token!
Với việc ghép nối giàn máy NVIDIA DGX Spark 4 nút cùng mô hình V4.1-Flash của DeepSeek, kết quả đạt được rất ấn tượng:
- Hiệu suất đầu ra đạt đỉnh: 494 tok/s (lập trình, 32 yêu cầu đồng thời).
- Hiệu suất văn bản đỉnh: 280 tok/s (32 yêu cầu đồng thời).
- Yêu cầu đơn: khoảng 58 tok/s văn bản, khoảng 96 tok/s lập trình.
- Xử lý câu lệnh nhắc (prompt): khoảng 4.764 tok/s.
- Token đầu tiên: khoảng 0,2 giây (khi rảnh rỗi).
- Dung lượng bộ nhớ chiếm dụng: 476 GB.
Về chi phí của thiết lập này, mỗi thiết bị NVIDIA DGX Spark 128 GB hiện có giá bán lẻ từ 5.500 USD đến hơn 9.000 USD tùy thuộc vào dung lượng lưu trữ và tình trạng sẵn có. Do đó, chi phí của giàn máy bao gồm:
- Bốn thiết bị 128 GB, thường từ 22.000 USD đến 36.000 USD.
- Cáp trực tiếp QSFP cho cấu trúc vòng: vài trăm đô la.
- Tủ rack/kệ, quạt bổ sung, thiết bị phân phối nguồn và các chi phí linh tinh khác: thêm vài trăm đô la.
Điều này có nghĩa là tổng chi phí của giàn máy sẽ rơi vào khoảng từ 25.000 USD đến 40.000 USD. Mặc dù khá đắt đỏ, bạn có thể chạy thiết lập này 24/7 với chi phí tiền điện tối thiểu (mỗi thiết bị tiêu thụ khoảng 400–600 W khi chịu tải), đồng thời không phải chịu chi phí API và giới hạn lưu lượng như khi sử dụng các gói thuê bao từ OpenAI hay Anthropic.
⚡ MÔ HÌNH DEEPSEEK V4.1-FLASH 552B ĐẠT TỐC ĐỘ 494 TOKEN/GIÂY TRÊN DÀN MÁY GIA ĐÌNH Nếu bạn muốn đảm bảo tính bảo mật cho dữ liệu độc quyền của mình với độ chính xác gần như tuyệt đối, việc lưu trữ một mô hình mã nguồn mở có năng lực trên thiết lập của riêng bạn vẫn là phương án tối ưu nhất. Các thiết lập được tối ưu hóa mang lại thông lượng chưa từng có ngay cả đối với các mô hình tương đối lớn. Trên thực tế, mô hình DeepSeek V4.1-Flash với 552 tỷ tham số gần đây đã có thể đạt được thông lượng suy luận đẳng cấp như Cerebras khi được lưu trữ trên một giàn máy tại nhà bao gồm 4 thiết bị NVIDIA DGX Spark. Cụm 4 nút NVIDIA DGX Spark, không cần bộ định tuyến quang học hay switch Ethernet, đã có thể mang lại hiệu suất đầu ra đạt đỉnh gần 500 token mỗi giây. Patrick Moorhead, chuyên gia công nghệ và kỳ cựu trong lĩnh vực AMD, vừa tiết lộ thiết lập AI tại nhà của ông. Thiết lập này bao gồm 4 thiết bị NVIDIA DGX Spark - cung cấp bộ nhớ thống nhất gộp lại khoảng 512 GB - được xếp chồng bên trong một tủ rack nhỏ gọn "tec MOJO" với các quạt tản nhiệt bổ sung bên dưới. Để bạn đọc dễ hình dung, mỗi hệ thống NVIDIA DGX Spark được sử dụng ở đây bao gồm: • Một CPU Arm 20 nhân (10 nhân hiệu năng cao Cortex-X925 + 10 nhân tiết kiệm điện Cortex-A725, mỗi nhân có bộ nhớ đệm L2 riêng và bộ nhớ đệm L3 16 MB cho mỗi cụm, tổng cộng là 32 MB). • GPU tích hợp GB10 trang bị Tensor Cores thế hệ thứ năm hỗ trợ DLSS 4 và các nhân RTX Ray Tracing, mang lại hiệu suất tính toán lên tới 31 TFLOPs cho FP32 và 1000 TOPS cho NVFP4 (FP4) đối với các tác vụ AI. • Bộ nhớ hệ thống LPDDR5X thống nhất mạch lạc 128 GB (chia sẻ giữa CPU và GPU) với băng thông khoảng 273 GB/s (giao diện bộ nhớ 256-bit). • SmartNIC ConnectX-7 với hai cổng QSFP 200 Gb/s dành cho kết nối cụm tốc độ cao, cùng với 10 GbE, Wi-Fi 7, Bluetooth, HDMI 2.1a và nhiều cổng USB-C. • Dung lượng lưu trữ tiêu chuẩn từ 1–4 TB NVMe SSD. • Mức tiêu thụ điện năng trong khoảng 140–240 W với bộ đổi nguồn đi kèm. • NVIDIA DGX OS (dựa trên Ubuntu) với toàn bộ ngăn xếp phần mềm CUDA AI. Một điểm quan trọng cần lưu ý là cả bốn thiết bị NVIDIA DGX Spark đều được kết nối với nhau thông qua cấu trúc vòng không dùng switch (switchless ring topology) bằng cáp QSFP: • Spark 1 kết nối với Spark 2 và Spark 4 • Spark 2 kết nối với Spark 1 và Spark 3 • Spark 3 kết nối với Spark 2 và Spark 4 • Spark 4 kết nối với Spark 3 và Spark 1 Lưu ý rằng NVIDIA khuyên dùng switch 200 GbE (cấu trúc hình sao - star topology) để kết nối 4 thiết bị DGX Spark. Dĩ nhiên, switch sẽ làm tăng tổng chi phí của giàn máy. Trong khi đó, một quyết định thông minh là Moorhead đã chọn lưu trữ mô hình DeepSeek V4.1-Flash cực kỳ hiệu quả trên tủ rack 4 nút NVIDIA DGX Spark của mình. Như chúng tôi đã trình bày chi tiết trong một bài viết riêng gần đây, mô hình này có 552 tỷ tham số, chỉ với 8 tỷ tham số hoạt động ở giai đoạn tiền điền (prefill) và 16 tỷ ở giai đoạn giải mã (decode). Ngoài ra, mô hình có 1 chuyên gia chia sẻ và 384 chuyên gia định tuyến (6 hoạt động). Hơn nữa, mô hình mới nhất của DeepSeek tích hợp một số yếu tố kiến trúc - bao gồm Causal Encoder-Decoder (CED), Compressed Sparse Attention 2 (CSA2), lượng tử hóa FP4 và SWA Bounded Replay - giúp giảm bộ nhớ đệm KV tổng thể xuống chỉ còn 890 byte cho mỗi token! Với việc ghép nối giàn máy NVIDIA DGX Spark 4 nút cùng mô hình V4.1-Flash của DeepSeek, kết quả đạt được rất ấn tượng: • Hiệu suất đầu ra đạt đỉnh: 494 tok/s (lập trình, 32 yêu cầu đồng thời). • Hiệu suất văn bản đỉnh: 280 tok/s (32 yêu cầu đồng thời). • Yêu cầu đơn: khoảng 58 tok/s văn bản, khoảng 96 tok/s lập trình. • Xử lý câu lệnh nhắc (prompt): khoảng 4.764 tok/s. • Token đầu tiên: khoảng 0,2 giây (khi rảnh rỗi). • Dung lượng bộ nhớ chiếm dụng: 476 GB. Về chi phí của thiết lập này, mỗi thiết bị NVIDIA DGX Spark 128 GB hiện có giá bán lẻ từ 5.500 USD đến hơn 9.000 USD tùy thuộc vào dung lượng lưu trữ và tình trạng sẵn có. Do đó, chi phí của giàn máy bao gồm: • Bốn thiết bị 128 GB, thường từ 22.000 USD đến 36.000 USD. • Cáp trực tiếp QSFP cho cấu trúc vòng: vài trăm đô la. • Tủ rack/kệ, quạt bổ sung, thiết bị phân phối nguồn và các chi phí linh tinh khác: thêm vài trăm đô la. Điều này có nghĩa là tổng chi phí của giàn máy sẽ rơi vào khoảng từ 25.000 USD đến 40.000 USD. Mặc dù khá đắt đỏ, bạn có thể chạy thiết lập này 24/7 với chi phí tiền điện tối thiểu (mỗi thiết bị tiêu thụ khoảng 400–600 W khi chịu tải), đồng thời không phải chịu chi phí API và giới hạn lưu lượng như khi sử dụng các gói thuê bao từ OpenAI hay Anthropic. 🗞 Nguồn: Wccftech #vgsnews #vgs #tintuc
Nguồn: Wccftech