Bản tin công nghệ quốc tế · dịch tiếng Việt 18.09.2026 RSS
Phần cứng · TechCrunch

Startup PrismML ra mắt mô hình AI siêu nhỏ, kỳ vọng thay đổi cách chúng ta dùng trí tuệ nhân tạo

PrismML vừa phát hành mô hình Bonsai 2 27B, nén từ mô hình nguồn mở Qwen xuống chỉ còn 5.9 GB nhưng vẫn giữ nguyên 98% hiệu năng. Công nghệ nén này cho phép các mô hình ngôn ngữ lớn chạy trực tiếp trên PC và smartphone một cách riêng tư, miễn phí.

TechCrunch18.09.20265 phút đọc0 lượt đọc

Nếu phòng nghiên cứu AI PrismML chưa nằm trong tầm ngắm của bạn, thì đã đến lúc bạn nên chú ý — không phải vì họ huy động được số tiền khổng lồ (họ chưa làm vậy, mới chỉ gọi vốn vòng hạt giống 22,25 triệu USD), mà vì những bộ óc kỹ thuật đằng sau và công nghệ có tiềm năng thay đổi ngành mà họ đang phát triển.

PrismML đang đặt cược rằng các mô hình ngôn ngữ lớn có khả năng lập luận mạnh mẽ, hiệu suất cao trên thực tế không nhất thiết phải có kích thước lớn.

Họ đang tạo ra các mô hình lập luận nhỏ đến mức có thể vừa vặn trên máy tính cá nhân và điện thoại thông minh. (Thậm chí có tin đồn cho rằng họ đang đàm phán với Apple, mặc dù CEO Babak Hassibi từ chối bình luận về điều đó với TechCrunch.)

Vào thứ Năm, PrismML đã phát hành Bonsai 2 27B, mô hình mới nhất trong dòng sản phẩm của họ, nén Qwen3.8 27B, một mô hình mã nguồn mở được sử dụng rộng rãi từ Alibaba, xuống còn 5.9 GB. Kích thước này đủ nhỏ để chạy trên PC và có thể là cả điện thoại thông minh cao cấp. Đây là mức giảm bộ nhớ từ 9 đến 10 lần so với phiên bản gốc.

PrismML được thành lập bởi một nhóm các nhà nghiên cứu từ Caltech và do Hassibi dẫn dắt, ông là giáo sư tại Caltech kiêm chuyên gia về công nghệ nén. Startup này cũng có Ion Stoica làm cố vấn. Stoica là đồng sáng lập của Databricks (và các công ty khác) đồng thời là giám đốc Phòng thí nghiệm Sky Computing nổi tiếng của Berkeley, nơi đã khai sinh ra nhiều công nghệ và startup, từ Letta đến SGLang.

PrismML cũng được hậu thuẫn bởi các nhà đầu tư Khosla Ventures, Cerberus Capital và Caltech.

Startup này chắc chắn không phải là công ty duy nhất đang làm việc về công nghệ nén LLM. Multiverse Computing, được thành lập bởi một giáo sư nổi tiếng từ Trung tâm Vật lý Quốc tế Donostia của Tây Ban Nha, là một cái tên khác. (Và Multiverse Computing đã huy động được rất nhiều tiền.)

Nhưng Hassibi cho biết công nghệ nén của PrismML là độc nhất vì các LLM của họ hầu như không bị suy giảm hiệu suất so với các bản gốc. Bonsai 2 đạt được 98% tổng điểm chuẩn (benchmark) của Qwen. Con số này tăng từ mức 95% của phiên bản Bonsai đầu tiên được phát hành vài tháng trước vào tháng Ba. Mô hình ban đầu đó đã đạt hơn 11 triệu lượt tải xuống, và các mô hình thậm chí còn nhỏ hơn của PrismML đã đạt thêm 2,6 triệu lượt tải xuống, theo công ty.

Điều này cho thấy kết quả nén của PrismML đã được cải thiện qua từng lần phát hành. Việc liệu họ có bao giờ đạt được mức độ tương đương 100% hiệu suất chuẩn hay không vẫn là một câu hỏi còn bỏ ngỏ. Quá trình nén có lẽ sẽ luôn có một số tác động nhất định, Hassibi chia sẻ.

Mặc dù vậy, sự tương đương điểm chuẩn hoàn hảo cũng mang tính hàn lâm là chính. Các LLM vốn dĩ đã không quá chính xác ở dạng chưa nén, và các bài kiểm tra chuẩn cũng không phản ánh hoàn toàn chính xác các tác vụ thực tế, do đó sự sụt giảm 2% có thể sẽ không ảnh hưởng đáng kể đến cách một mô hình hoạt động trong sử dụng thực tế. (Thêm vào đó, phần mềm xung quanh — khung mà mô hình chạy bên trong — cũng rất quan trọng đối với độ chính xác.)

PrismML cho biết họ đạt được điều này bằng cách thu gọn các “trọng số” (weights) cấu thành nên mô hình — trọng số thực chất là thông tin mà mô hình học và lưu trữ trong quá trình huấn luyện. Thông thường, mỗi trọng số đòi hỏi 16 bit. Phương pháp của PrismML, gọi là trọng số “tam phân” (ternary), đơn giản hóa con số đó xuống còn ba giá trị: +1, −1 hoặc 0. Với các giá trị cần lưu trữ cho mỗi trọng số nhỏ hơn rất nhiều, mô hình chiếm ít không gian hơn đáng kể. (Để tìm hiểu sâu hơn về kỹ thuật nén này, bạn có thể xem trang GitHub của dự án.)

Mục tiêu tiếp theo của startup là áp dụng kỹ thuật nén này cho các mô hình lớn hơn nữa. “Các mô hình tiếp theo mà chúng tôi sẽ phát hành, hy vọng là trong vài tháng tới, sẽ nằm trong phạm vi hàng trăm tỷ tham số, và tôi kỳ vọng việc giữ lại trí thông minh ở đó sẽ dễ dàng hơn,” Hassibi nói với TechCrunch.

Khi kích thước mô hình tăng lên, ông bổ sung thêm, “Có nhiều dư địa hơn để có thể nén chúng mà không làm mất đi trí thông minh. Vì vậy, tôi chỉ muốn nói rằng theo xu hướng chung, đối với các mô hình lớn hơn, việc đạt được 100% sẽ dễ dàng hơn.”

Stoica chia sẻ rằng ông rất phấn khích với công nghệ này vì nó giúp các mô hình tiên tiến có thể chạy trên thiết bị của người dùng. “Bạn sẽ có trí thông minh trong tầm tay, và nó sẽ hoàn toàn miễn phí vì nó chạy trên thiết bị bạn đã mua. Nó cũng sẽ mang tính riêng tư cao, bởi vì bạn không phải gửi dữ liệu lên đám mây.”

🔗 Bài gốc (tiếng Anh): PrismML hopes its tiny LLM will change how we all use AI
Nguồn: TechCrunch

Cùng chuyên mục · Phần cứng
Phần cứng

Pulsar giới thiệu X5: Chuột chơi game công thái học kích thước lớn, nặng 62g

Tại Tokyo Game Show, Pulsar đã hé lộ mẫu chuột chơi game X5 trọng lượng nhẹ dành cho người tay to. Sản phẩm sở hữu…

TechPowerUp · 2 phút đọc
Phần cứng

Chip Xring O3 của Xiaomi bổ sung tính năng quan trọng cho giả lập game Windows mà chip Dimensity còn thiếu

Chip tự phát triển Xring O3 của Xiaomi hỗ trợ đầy đủ định dạng nén kết cấu BCn (BC1 đến BC7), một tính năng đồ họa quan…

Notebookcheck · 3 phút đọc
Phần cứng

G-Wolves công bố chuột chơi game Lupine II siêu nhẹ chỉ nặng 22,7 gram

G-Wolves vừa chính thức giới thiệu mẫu chuột gaming siêu nhẹ Lupine II thiết kế bất đối xứng dành cho kiểu cầm ngón tay…

TechPowerUp · 2 phút đọc