Mô hình AI 35B bị nghi làm 'nướng' thanh RAM DDR4 chỉ sau 90 phút chạy tác vụ
Một người dùng Reddit gặp sự cố hỏng thanh RAM DDR4 ECC sau khi chạy mô hình ngôn ngữ lớn 35B cho các tác vụ cơ sở dữ liệu phức tạp. Dù khẳng định không phải do nhiệt độ, sự cố này cho thấy việc ép RAM cũ gánh tải AI nặng liên tục có thể gây hậu quả nghiêm trọng.

Một mô hình AI 20B chạy trên card đồ họa RTX 5070 Ti với 16GB VRAM GDDR7 vốn không gặp vấn đề gì, nhưng một người dùng lại cảm thấy mô hình này quá hạn chế đối với quy trình làm việc hằng ngày của anh ấy. Thay vào đó, anh quyết định chuyển sang mô hình 35B và để giảm tải cho hệ thống mà không gặp tình trạng giảm hiệu năng, anh đã tận dụng 128GB bộ nhớ DDR4 ECC từ một máy trạm. Thật không may, chỉ sau 90 phút, một thanh RAM DDR4 đã chết một cách bí ẩn, trong khi người dùng khẳng định rằng nhiệt độ không phải là nguyên nhân làm hỏng thanh RAM.
Đáng ngạc nhiên là người dùng này chỉ đề cập đến nhiệt độ của CPU và GPU, trong khi một thanh RAM DDR4 thứ hai bắt đầu xuất hiện lỗi sau 8-9 ngày chạy mô hình 35B.
Trước khi khởi chạy Ornith-1.5-35B-A3B, thành viên Reddit Future_Fuel_8425 có thể dễ dàng chạy một LLM 20B vừa vặn với bộ đệm khung hình video của RTX 5070 Ti. Tuy nhiên, khi chuyển sang các tác vụ cơ sở dữ liệu phức tạp, rõ ràng việc chạy một mô hình AI có mật độ lớn hơn là con đường duy nhất. Thiết lập phần cứng cần thiết với 128GB bộ nhớ DDR4 ECC gồm các thanh 8GB, người dùng bắt đầu chạy LLM 35B và sau khi trở về nhà 90 phút sau đó, anh phát hiện hệ thống đã bị treo.
Sau khi kiểm tra, anh phát hiện ra một trong các thanh RAM DDR4 8GB đã bị hỏng, liền tháo nó ra và tiếp tục chạy Ornith-1.5-35B-A3B một lần nữa. Về lý do tại sao người dùng Reddit này thích chạy mô hình AI này, anh cho biết anh đánh giá cao chất lượng mà nó mang lại, đồng thời tốc độ xử lý token sẽ không bị suy giảm sau khi dung lượng VRAM của RTX 5070 Ti đã cạn và bộ nhớ hệ thống bắt đầu lấp đầy khoảng trống. Anh từng cho rằng mình chỉ gặp một thanh RAM bị lỗi đơn thuần, điều này vẫn hay xảy ra.
Thật không may, sau khi chạy LLM trong khoảng 8-9 ngày, anh kiểm tra nhật ký lỗi và nhận ra mình sắp mất thêm một thanh RAM nữa, cho thấy việc sử dụng RAM DDR4 đời cũ không phải là lựa chọn tốt nhất cho một tác vụ nặng nề như vậy. Mặc dù người dùng cho biết nhiệt độ không phải là vấn đề, anh chỉ đề cập đến nhiệt độ của CPU và GPU, vốn chưa bao giờ vượt quá 80°C. Ngoài tuổi đời của các thanh RAM này, bộ nhớ thông thường vốn không được thiết kế cho các thao tác đọc tuần tự, liên tục trong thời gian dài.
Chắc chắn bạn có thể thử chạy các mô hình AI có mật độ lớn hơn trên RAM DDR5, vì loại RAM này có khả năng chịu nhiệt và chịu đọc tốt hơn, nhưng cảm tính của chúng tôi cho rằng nhiệt độ cao đã làm chết thanh RAM DDR4 ECC 8GB đơn lẻ và làm suy giảm nhanh chóng thanh thứ hai. Giả sử trường hợp này không xảy ra, tại sao người dùng Reddit lại không hiển thị bất kỳ chỉ số đọc nhiệt độ bộ nhớ nào? Sự kết hợp giữa tuổi tác, áp lực kéo dài và luồng không khí không đủ có thể là thủ phạm chính phá hủy các thanh RAM DDR4, nhưng nếu không có bức tranh toàn cảnh, chúng ta sẽ không bao giờ biết chắc chắn.
⚡ MÔ HÌNH AI 35B BỊ NGHI LÀM 'NƯỚNG' THANH RAM DDR4 CHỈ SAU 90 PHÚT CHẠY TÁC VỤ Một mô hình AI 20B chạy trên card đồ họa RTX 5070 Ti với 16GB VRAM GDDR7 vốn không gặp vấn đề gì, nhưng một người dùng lại cảm thấy mô hình này quá hạn chế đối với quy trình làm việc hằng ngày của anh ấy. Thay vào đó, anh quyết định chuyển sang mô hình 35B và để giảm tải cho hệ thống mà không gặp tình trạng giảm hiệu năng, anh đã tận dụng 128GB bộ nhớ DDR4 ECC từ một máy trạm. Thật không may, chỉ sau 90 phút, một thanh RAM DDR4 đã chết một cách bí ẩn, trong khi người dùng khẳng định rằng nhiệt độ không phải là nguyên nhân làm hỏng thanh RAM. Đáng ngạc nhiên là người dùng này chỉ đề cập đến nhiệt độ của CPU và GPU, trong khi một thanh RAM DDR4 thứ hai bắt đầu xuất hiện lỗi sau 8-9 ngày chạy mô hình 35B. Trước khi khởi chạy Ornith-1.5-35B-A3B, thành viên Reddit Future_Fuel_8425 có thể dễ dàng chạy một LLM 20B vừa vặn với bộ đệm khung hình video của RTX 5070 Ti. Tuy nhiên, khi chuyển sang các tác vụ cơ sở dữ liệu phức tạp, rõ ràng việc chạy một mô hình AI có mật độ lớn hơn là con đường duy nhất. Thiết lập phần cứng cần thiết với 128GB bộ nhớ DDR4 ECC gồm các thanh 8GB, người dùng bắt đầu chạy LLM 35B và sau khi trở về nhà 90 phút sau đó, anh phát hiện hệ thống đã bị treo. Sau khi kiểm tra, anh phát hiện ra một trong các thanh RAM DDR4 8GB đã bị hỏng, liền tháo nó ra và tiếp tục chạy Ornith-1.5-35B-A3B một lần nữa. Về lý do tại sao người dùng Reddit này thích chạy mô hình AI này, anh cho biết anh đánh giá cao chất lượng mà nó mang lại, đồng thời tốc độ xử lý token sẽ không bị suy giảm sau khi dung lượng VRAM của RTX 5070 Ti đã cạn và bộ nhớ hệ thống bắt đầu lấp đầy khoảng trống. Anh từng cho rằng mình chỉ gặp một thanh RAM bị lỗi đơn thuần, điều này vẫn hay xảy ra. Thật không may, sau khi chạy LLM trong khoảng 8-9 ngày, anh kiểm tra nhật ký lỗi và nhận ra mình sắp mất thêm một thanh RAM nữa, cho thấy việc sử dụng RAM DDR4 đời cũ không phải là lựa chọn tốt nhất cho một tác vụ nặng nề như vậy. Mặc dù người dùng cho biết nhiệt độ không phải là vấn đề, anh chỉ đề cập đến nhiệt độ của CPU và GPU, vốn chưa bao giờ vượt quá 80°C. Ngoài tuổi đời của các thanh RAM này, bộ nhớ thông thường vốn không được thiết kế cho các thao tác đọc tuần tự, liên tục trong thời gian dài. Chắc chắn bạn có thể thử chạy các mô hình AI có mật độ lớn hơn trên RAM DDR5, vì loại RAM này có khả năng chịu nhiệt và chịu đọc tốt hơn, nhưng cảm tính của chúng tôi cho rằng nhiệt độ cao đã làm chết thanh RAM DDR4 ECC 8GB đơn lẻ và làm suy giảm nhanh chóng thanh thứ hai. Giả sử trường hợp này không xảy ra, tại sao người dùng Reddit lại không hiển thị bất kỳ chỉ số đọc nhiệt độ bộ nhớ nào? Sự kết hợp giữa tuổi tác, áp lực kéo dài và luồng không khí không đủ có thể là thủ phạm chính phá hủy các thanh RAM DDR4, nhưng nếu không có bức tranh toàn cảnh, chúng ta sẽ không bao giờ biết chắc chắn. 🗞 Nguồn: Wccftech #vgsnews #vgs #tintuc
Nguồn: Wccftech