Bản tin công nghệ quốc tế · dịch tiếng Việt 08.09.2026 RSS
Phần cứng · Tom's Hardware

Đánh giá Qwen 3.8 27B trên RTX 5090: VRAM lớn chưa đủ nếu thiếu phần mềm tối ưu

Mô hình AI Qwen 3.8 27B đang thu hút sự chú ý lớn từ cộng đồng nhờ khả năng ấn tượng. Tuy nhiên, các bài kiểm tra thực tế cho thấy dung lượng VRAM lớn của RTX 5090 hay RTX 4090 vẫn chưa đủ để khai thác tối đa mô hình nếu thiếu các công cụ suy luận và phần mềm phù hợp.

Tom's Hardware08.09.20266 phút đọc2 lượt đọc
Ảnh: Tom's Hardware

Mô hình AI trọng số mở Qwen 3.8 27B của Alibaba ra mắt cách đây vài tuần và ngay lập tức tạo ra làn sóng phấn khích trong cộng đồng AI nhờ kết quả benchmark thông minh ấn tượng đối với một mô hình có kích thước và năng lực như vậy.

Với tổng dung lượng khoảng 17GB cho các trọng số lượng tử hóa 4-bit cùng khả năng đa phương thức tích hợp bên cạnh năng lực tổng quát, Qwen 3.8 27B ngay lập tức thu hút sự chú ý của bất kỳ ai sở hữu RTX 5090, RTX 4090 hoặc RTX 3090 (cùng với Radeon RX 7900 XTX, Radeon AI Pro R9700, hoặc Arc Pro B70).

Liệu chúng ta có đang đứng trước ngưỡng cửa của trí tuệ cấp độ biên từ một mô hình lượng tử hóa 4-bit chạy trên một card đồ họa duy nhất? Liệu mọi người với thiết lập AI cục bộ đủ mạnh có thể hủy đăng ký Claude hoặc ChatGPT của họ không?

Tất nhiên, câu trả lời cũng giống như mọi chu kỳ hào hứng về mô hình AI trọng số mở khác, phức tạp hơn nhiều so với việc chỉ nhìn vào kích thước trọng số mô hình và so sánh với dung lượng VRAM có sẵn của bạn. Liệu card hoặc hệ thống bạn đang dùng để lưu trữ mô hình có đủ VRAM dư để cung cấp không gian hữu ích cho ngữ cảnh của mô hình khi mọi thứ đang chạy? Hệ thống chủ và công cụ suy luận LLM của bạn có mang lại thời gian đến token đầu tiên (time-to-first-token) chấp nhận được, cũng như thông lượng cao vượt qua việc chỉ chạy thử từ cửa sổ ngữ cảnh trống không?

Mọi chuyện sẽ khác nếu bạn chỉ muốn trò chuyện với mô hình và xem điều gì xảy ra; nhưng sẽ hoàn toàn khác nếu bạn muốn đưa nó vào công việc thực tế.

Chúng tôi muốn xem phần cứng và phần mềm nào thực sự cần thiết để Qwen 3.8 27B mang lại hiệu suất vững chắc, vì vậy chúng tôi đã chạy nó trên các hệ thống từ PC để bàn trang bị GPU rời cho đến các hệ thống có kiến trúc bộ nhớ thống nhất như DGX Spark, Mac Studio và Ryzen AI Halo.

Hiệu năng của RTX 5090

Chúng tôi bắt đầu với RTX 5090, với 32GB GDDR7 và băng thông bộ nhớ 1.8 TB/s, đây dường như là lựa chọn không cần phải nghĩ bàn để đạt hiệu suất suy luận cục bộ tốt nhất với mô hình dày đặc này.

Là một dạng cơ sở, chúng tôi làm theo phương pháp benchmark AI thông thường: lấy bản build mới nhất của llama.cpp từ GitHub, biên dịch nó, lấy bản lượng tử hóa Unsloth của mô hình từ Hugging Face và chạy nó. Nhưng thử nghiệm của chúng tôi nhanh chóng vấp phải vật cản.

Mặc dù llama.cpp sẽ cấp phát vui vẻ toàn bộ độ dài ngữ cảnh 262K với mô hình này trên RTX 5090, tốc độ xử lý của nó ở các ngữ cảnh dài trên chiếc card này lại rất tồi tệ.

Thời gian phản hồi token đầu tiên với một chiếc 5090 đơn kéo dài tới khoảng 30 phút, cho thấy có điều gì đó không ổn ở đây. Và thông lượng token trên giây giảm xuống thấp hơn rất nhiều so với những gì bạn mong đợi khi sở hữu một trong những card đồ họa nhanh nhất thế giới. Dù nhìn nhận theo cách nào đi nữa, llama.cpp không phải là trình chạy mô hình phù hợp cho phần cứng này vào lúc này.

Tiếp theo, chúng tôi thử vLLM, một công cụ suy luận cấp độ sản xuất thường phù hợp hơn với trung tâm dữ liệu thay vì máy tính để bàn. Ngay cả với 64GB bộ nhớ chính trong dàn máy thử nghiệm, chúng tôi vẫn phải cấp phát thêm 64GB swap chỉ để vLLM tải thành công Qwen 3.8 27B lần đầu tiên.

Các nhà phát triển vLLM cung cấp bản lượng tử hóa NVFP4 của Qwen 3.8 27B và các công thức triển khai cho cả một và hai card RTX 5090. Chúng tôi tình cờ có hai card RTX 5090 trong phòng thí nghiệm TH, vì vậy chúng tôi có thể thử cả hai cấu hình.

Chạy Qwen 3.8 27B trên một chiếc 5090 với vLLM chắc chắn hoạt động trong trường hợp khẩn cấp, nhưng nó không lý tưởng cho suy luận ngữ cảnh dài vì công thức cơ bản giới hạn bạn ở mức ngữ cảnh 32K. Để có được toàn bộ ngữ cảnh 262K, bạn thực sự muốn một card đơn có nhiều bộ nhớ hơn hoặc hai card 5090.

Và một card đơn không đủ bộ nhớ để bật khả năng dự đoán đa token (MTP) tích hợp của Qwen 3.8 27B. Tốc độ 20 token mỗi giây trên toàn bảng mà không có MTP không phải là một kết quả ấn tượng đối với một card phân khúc này.

Tuy nhiên, khi đưa hai chiếc 5090 vào, tốc độ giải mã của vLLM tăng vọt. 70-80 token mỗi giây qua các mức độ sâu ngữ cảnh là một kết quả tuyệt vời cho thiết lập cục bộ. Nhưng chúng ta còn có thể chạy nhanh hơn nữa.

Bật MTP với vLLM giúp chúng ta đạt tới 100-110 token mỗi giây ở phía giải mã mà chỉ bị ảnh hưởng nhỏ về tốc độ xử lý prompt. Thiết lập này mang lại hiệu suất nhất quán, dù nền tảng dual RTX 5090 ở đây hiện có giá trị lên tới hơn 13.000 USD.

Chúng tôi cũng thử công cụ suy luận SGLang trên RTX 5090 với các cấu hình tương tự như vLLM.

SGLang nhanh hơn đáng kể trên một card 5090 duy nhất – nhanh gấp gần 3 lần so với công thức một card của vLLM – và cũng đạt được ngữ cảnh lớn hơn một chút (37.740) so với vLLM. Nhưng nếu bạn muốn đạt toàn bộ 262K mà mô hình hỗ trợ nguyên bản, bạn vẫn cần card thứ hai hoặc card khác có nhiều VRAM hơn.

Hiệu năng của RTX 3090 và RTX 4090

Sau khi đánh giá xong RTX 5090, chúng tôi chuyển sang các dòng card tiêu dùng cũ hơn để xem chúng xử lý Qwen 3.8 27B ra sao. Các dòng RTX 4090 và 3090 với 24GB VRAM là những cái tên được yêu thích lâu năm nhờ dung lượng VRAM tương đối lớn và giá cả phải chăng trên thị trường đồ cũ.

Những chiếc card này có thể vừa vặn với bản GGUF Q4_K_M của Qwen 3.8 27B bằng llama.cpp, nhưng chúng yêu cầu sử dụng lượng tử hóa Q8_0 của bộ nhớ đệm KV để vừa với các pool VRAM nhỏ hơn, đồng thời đòi hỏi giới hạn độ sâu ngữ cảnh thấp hơn nhiều so với giới hạn nguyên bản 262K của mô hình. Chúng tôi nhận thấy chiều dài ngữ cảnh khoảng 112K token là mức tối đa có thể đạt được trước khi cạn kiệt VRAM.


Cùng chuyên mục · Phần cứng
Phần cứng

Sạc dự phòng bỏ túi tích hợp cáp sạc giảm giá còn 30 USD

Sạc dự phòng Baseus Picogo AC22 siêu nhỏ gọn với dung lượng 10.000mAh đang được giảm giá xuống còn 30 USD. Thiết bị sở…

PCWorld · 2 phút đọc
Phần cứng

Lenovo ra mắt sớm mini-PC ThinkCentre mới với RAM lên tới 64 GB

Lenovo vừa bất ngờ phát hành sớm mẫu mini-PC ThinkCentre M75q Gen 6 với dung tích chỉ 1 lít. Thiết bị sở hữu khả năng…

Notebookcheck · 1 phút đọc
Phần cứng

Đánh giá GMKtec NucBox K17: Máy tính mini chip Lunar Lake có mức giá cực hời

GMKtec NucBox K17 mang công nghệ Lunar Lake của Intel xuống phân khúc dưới 619 USD với hiệu năng đồ họa ấn tượng và kết…

PCWorld · 7 phút đọc