Bản tin công nghệ quốc tế · dịch tiếng Việt 02.09.2026 RSS
Phần cứng · Wccftech

Laptop RTX 5090 vượt trội M5 Max trong xử lý AI, nhưng vẫn thua khi gặp mô hình LLM lớn

Laptop trang bị RTX 5090 với 24GB VRAM thể hiện hiệu suất ấn tượng, nhanh hơn tới 133% so với Apple M5 Max trong nhiều tác vụ AI. Tuy nhiên, khi đối mặt với các mô hình LLM lớn hơn cùng độ dài ngữ cảnh cao, kiến trúc bộ nhớ hợp nhất của M5 Max lại chiếm ưu thế tuyệt đối.

Wccftech21.08.20263 phút đọc1 lượt đọc
Ảnh: Wccftech

Card đồ họa RTX 5090 phiên bản laptop của NVIDIA sở hữu dung lượng VRAM dư dả để cân mọi thiết lập đồ họa cao nhất trong các tựa game AAA nặng đô nhất. Tuy nhiên, khi chạy các tác vụ AI, 24GB VRAM của GPU này lại bước sang một sân chơi hoàn toàn mới. Dù vậy, một loạt thử nghiệm cho thấy nó vẫn hoàn toàn tự tin đối đầu với M5 Max của Apple khi đánh bại đối thủ trong nhiều bài kiểm tra LLM, cho đến khi các bài benchmark chuyển sang các mô hình AI nặng hơn kết hợp với độ dài ngữ cảnh (Context Length) lớn hơn.

Kiến trúc bộ nhớ hợp nhất của M5 Max đã giải cứu tình thế, vượt trội đáng kể so với RTX 5090 về tốc độ tạo token ngay khi độ dài ngữ cảnh được tăng lên.

Chiếc Razer Blade 18 nâng cấp đã đọ sức với mẫu MacBook Pro 16 inch cao cấp nhất của Apple, khi Alex Ziskind so sánh mọi loại benchmark, bao gồm cả các tác vụ AI. Bắt đầu với mô hình Qwen3 4B chạy ở mức định lượng 4-bit và độ dài ngữ cảnh 262.144, rõ ràng sức mạnh đồ họa thô của RTX 5090 là chưa đủ ở đây, bởi vì gần như toàn bộ 24GB VRAM của nó đã bị chiếm dụng, dẫn đến tốc độ tạo token đạt 25.28 token/giây.

So với đó, M5 Max đạt tới 181.40 token/giây. Tuy nhiên, ngay khi độ dài ngữ cảnh giảm xuống 68.014, một lượng lớn VRAM được giải phóng cho RTX 5090, giúp GPU này đạt tốc độ 160.36 token/giây. Về lý do tại sao chip đồ họa này vẫn chậm hơn M5 Max, nhiều khả năng là do sự khác biệt về phần mềm sử dụng. Trên Windows, LM Studio được chạy trong khi MLX được tận dụng cho Apple Silicon.

May mắn thay, RTX 5090 chưa phải đã hết thời khi YouTuber này chạy một loạt các mô hình LLM như Gemma 4 12B, Qwen3.5 27B và Qwen3.6 35B A3B bằng llama.cpp. Trong cả quá trình xử lý câu lệnh (prompt processing) và tạo token, RTX 5090 đã có tiếng cười chiến thắng khi so sánh với M5 Max. Dù vậy, bạn cần nhớ rằng GPU nhanh nhất của NVIDIA dànhfor laptop sẽ luôn là ông vua của đồi cát chừng nào nó chưa bị lấp đầy 24GB VRAM.

Đáng tiếc là nếu bạn định chạy các mô hình cực kỳ dày đặc như Qwen3.5 122B, hoàn toàn không có cơ hội nào để RTX 5090 vượt qua bài kiểm tra này một cách nguyên vẹn. Đối với M5 Max và 128GB bộ nhớ hợp nhất của nó, máy đạt tốc độ xử lý câu lệnh 139 token/giây và tạo token là 47.4, trong khi tiêu thụ 94GB RAM. Nếu bạn đang tự hỏi tại sao NVIDIA lại sốم sắng ra mắt RTX Spark, việc chạy các mô hình AI nặng hơn chắc chắn là một lý do.

Để có cái nhìn sâu hơn về các thử nghiệm, bạn có thể xem video của Alex Ziskind ở phía trên.


Cùng chuyên mục · Phần cứng
Phần cứng

NVIDIA công bố DLSS 5 với công nghệ 3D-Guided Neural Rendering, ra mắt cùng NBA 2K27

NVIDIA vừa thông báo công nghệ DLSS 5 tích hợp 3D-Guided Neural Rendering sẽ chính thức ra mắt vào ngày 3 tháng 9 trên…

TechPowerUp · 7 phút đọc
Phần cứng

Astell & Kern ra mắt máy nghe nhạc PD5: Thiết bị 'Walkman' trang bị 8 DAC dành cho tín đồ âm thanh hi-res

Astell & Kern vừa công bố máy nghe nhạc số PD5 với hệ thống 8 chip DAC Cirrus Logic, hỗ trợ âm thanh độ phân giải cao…

Notebookcheck · 2 phút đọc
Phần cứng

Lenovo ra mắt ThinkPad tháo rời mới tại Mỹ với chip Intel Core Ultra 7 và màn hình 120Hz

Lenovo chính thức phân phối dòng máy tính bảng ThinkPad X13 Detachable tại thị trường Bắc Mỹ với chip Intel Core Ultra…

Notebookcheck · 2 phút đọc