Bản tin công nghệ quốc tế · dịch tiếng Việt 02.10.2026 RSS
AI & Dữ liệu · Wccftech

Mẫu AI 27B lượng tử hóa gây bất ngờ khi đánh bại các mô hình hàng đầu trong một bài kiểm tra lập trình

Một mô hình AI nội bộ kích thước 27B đã vượt qua các mô hình đám mây cao cấp trong một tác vụ đơn lẻ thuộc bộ benchmark lập trình. Dù chỉ là kết quả thử nghiệm nhỏ, điều này cho thấy các mô hình cỡ trung chạy trên phần cứng phổ thông đang ngày càng mạnh mẽ.

Wccftech02.10.20264 phút đọc0 lượt đọc
Ảnh: Wccftech

Đó chắc chắn là một tuyên bố táo bạo khi nói về một mô hình AI 27B cục bộ vượt trội hơn một mô hình tiên tiến, nhưng một người dùng đã so sánh cả hai LLM và phát hiện ra rằng, trong một tác vụ từ bài kiểm tra lập trình, mô hình nhỏ hơn cuối cùng đã giành chiến thắng. Thật không may, điều này không nên làm giảm đi tiêu chuẩn hàng đầu mà các mô hình tiên tiến đã thiết lập, và bạn sẽ tìm hiểu lý do tại sao.

Mẫu 27B lượng tử hóa 4-bit hoàn toàn có khả năng chạy trên phần cứng hiện đại hoặc một chuỗi sản phẩm.

Thật khó tưởng tượng những mô hình đắt tiền đó lại có thể bị đánh bại bởi Qwen3.8-27B, nhưng thành viên Reddit "Distinct-Pie2389" đề cập rằng anh ấy đã kiểm tra phiên bản nén 4-bit của LLM trên một tác vụ đơn lẻ từ một bài kiểm tra lập trình gọi là DeepSWE. Mô hình đã vượt qua 98 phần trăm các bài kiểm tra, đồng thời đạt điểm tuyệt đối 12 trên 12 trong một tác vụ đánh giá mã nguồn. Theo kết quả được công bố của bài kiểm tra, các mô hình đám mây cao cấp đạt trung bình 96,6 phần trăm khi chạy cùng một tác vụ.

Trước khi độc giả gạt bỏ tuyên bố này là quá xa vời, có một số ngữ cảnh hữu ích cần suy ngẫm. Ngay cả các mô hình đám mây hàng đầu cũng chỉ đạt được kết quả hoàn hảo trong tác vụ nói trên khoảng hai trên ba lần, vì vậy việc bỏ lỡ nó được coi là bình thường. Trên tổng số 113 tác vụ của bài kiểm tra, các mô hình đám mây tốt nhất chỉ đạt khoảng 70-74 phần trăm. Tổng hợp lại, toàn bộ lập luận là trên một vấn đề này, mô hình cục bộ đã hoạt động tốt tương đương với các LLM dày đặc hơn, và chúng thất bại thường xuyên hơn so với danh tiếng của chúng.

Phần tuyệt vời nhất khi chạy Qwen3.8-27B là kích thước của phiên bản 4-bit có thể dao động từ 13GB đến 18GB, có nghĩa là nếu bạn có GPU 16GB, với một số điều chỉnh được thực hiện đối với Cửa sổ ngữ cảnh (Context Window), bạn sẽ có thể chạy nó một cách hoàn hảo. Trên RTX 4090 với 24GB VRAM của nó, Qwen3.8-27B có thể chạy ở tốc độ 115 token mỗi giây, đủ nhanh để cảm thấy nhanh nhạy và nằm trong bộ nhớ video khả dụng của thẻ.

Điều làm cho bài đăng đáng tin cậy hơn hầu hết là sự trung thực của người dùng Reddit. Một ghi chú gần phía dưới cho biết kết quả đến từ việc chạy chỉ một tác vụ, không phải là mức trung bình, và một bản chỉnh sửa bổ sung rằng mọi người đang đọc nó là "cục bộ khớp với biên giới", điều mà cá nhân nói không phải là tuyên bố. Tuy nhiên, chúng tôi cảm thấy rằng một số điều xứng đáng được xem xét kỹ hơn. Ví dụ, mô hình đã vượt qua 40 trong số 43 bài kiểm tra ẩn và dòng điểm của chính bài đăng cho biết kết quả nhị phân là 0, nghĩa là nó chưa giải quyết hoàn toàn tác vụ.

Con số 98 phần trăm dường như cũng hòa lẫn với 109 bài kiểm tra hiện có mà nó liên tục vượt qua. Vì một tác vụ từ toàn bộ bài kiểm tra chỉ là một mẫu nhỏ, tất cả những gì cần thiết là một lần chạy may mắn hoặc không may mắn để thay đổi toàn bộ bức tranh. Một lần nữa, các LLM cỡ trung chạy trên phần cứng tiêu dùng đã chứng minh là đặc biệt khi giải quyết các vấn đề lập trình trong thế giới thực. Chỉ là các mô hình tiên tiến đã tạo ra một vị trí độc ân cho chính chúng, đó là lý do tại sao chúng được thiết kế đặc biệt để chạy trên phần cứng cao cấp.


Cùng chuyên mục · AI & Dữ liệu
🚀 VGSNews
AI & Dữ liệu

ChatGPT ra mắt tính năng thử quần áo ảo và lưu sản phẩm yêu thích

OpenAI vừa chính thức phát hành toàn cầu hai tính năng mua sắm mới trên ChatGPT, bao gồm khả năng thử quần áo và phụ…

TechCrunch · 3 phút đọc
AI & Dữ liệu

Tính năng Guided Vision mới của Google giúp bạn đọc chữ nhỏ dễ dàng hơn

Google vừa ra mắt tính năng Guided Vision trong Gemini Live trên các thiết bị Android tương thích, mang đến khả năng mô…

The Verge · 2 phút đọc
🚀 VGSNews
AI & Dữ liệu

Amazon ra mắt mô hình ra quyết định mã nguồn mở Strands Decider 2B

Amazon Web Services vừa phát hành Strands Decider 2B, một mô hình ra quyết định mã nguồn mở tốc độ cao và chi phí thấp…

TechCrunch · 4 phút đọc