Startup PrismML ra mắt mô hình AI siêu nhỏ, kỳ vọng thay đổi cách chúng ta dùng trí tuệ nhân tạo
PrismML vừa phát hành mô hình Bonsai 2 27B, nén từ mô hình nguồn mở Qwen xuống chỉ còn 5.9 GB nhưng vẫn giữ nguyên 98% hiệu năng. Công nghệ nén này cho phép các mô hình ngôn ngữ lớn chạy trực tiếp trên PC và smartphone một cách riêng tư, miễn phí.
Nếu phòng nghiên cứu AI PrismML chưa nằm trong tầm ngắm của bạn, thì đã đến lúc bạn nên chú ý — không phải vì họ huy động được số tiền khổng lồ (họ chưa làm vậy, mới chỉ gọi vốn vòng hạt giống 22,25 triệu USD), mà vì những bộ óc kỹ thuật đằng sau và công nghệ có tiềm năng thay đổi ngành mà họ đang phát triển.
PrismML đang đặt cược rằng các mô hình ngôn ngữ lớn có khả năng lập luận mạnh mẽ, hiệu suất cao trên thực tế không nhất thiết phải có kích thước lớn.
Họ đang tạo ra các mô hình lập luận nhỏ đến mức có thể vừa vặn trên máy tính cá nhân và điện thoại thông minh. (Thậm chí có tin đồn cho rằng họ đang đàm phán với Apple, mặc dù CEO Babak Hassibi từ chối bình luận về điều đó với TechCrunch.)
Vào thứ Năm, PrismML đã phát hành Bonsai 2 27B, mô hình mới nhất trong dòng sản phẩm của họ, nén Qwen3.8 27B, một mô hình mã nguồn mở được sử dụng rộng rãi từ Alibaba, xuống còn 5.9 GB. Kích thước này đủ nhỏ để chạy trên PC và có thể là cả điện thoại thông minh cao cấp. Đây là mức giảm bộ nhớ từ 9 đến 10 lần so với phiên bản gốc.
PrismML được thành lập bởi một nhóm các nhà nghiên cứu từ Caltech và do Hassibi dẫn dắt, ông là giáo sư tại Caltech kiêm chuyên gia về công nghệ nén. Startup này cũng có Ion Stoica làm cố vấn. Stoica là đồng sáng lập của Databricks (và các công ty khác) đồng thời là giám đốc Phòng thí nghiệm Sky Computing nổi tiếng của Berkeley, nơi đã khai sinh ra nhiều công nghệ và startup, từ Letta đến SGLang.
PrismML cũng được hậu thuẫn bởi các nhà đầu tư Khosla Ventures, Cerberus Capital và Caltech.
Startup này chắc chắn không phải là công ty duy nhất đang làm việc về công nghệ nén LLM. Multiverse Computing, được thành lập bởi một giáo sư nổi tiếng từ Trung tâm Vật lý Quốc tế Donostia của Tây Ban Nha, là một cái tên khác. (Và Multiverse Computing đã huy động được rất nhiều tiền.)
Nhưng Hassibi cho biết công nghệ nén của PrismML là độc nhất vì các LLM của họ hầu như không bị suy giảm hiệu suất so với các bản gốc. Bonsai 2 đạt được 98% tổng điểm chuẩn (benchmark) của Qwen. Con số này tăng từ mức 95% của phiên bản Bonsai đầu tiên được phát hành vài tháng trước vào tháng Ba. Mô hình ban đầu đó đã đạt hơn 11 triệu lượt tải xuống, và các mô hình thậm chí còn nhỏ hơn của PrismML đã đạt thêm 2,6 triệu lượt tải xuống, theo công ty.
Điều này cho thấy kết quả nén của PrismML đã được cải thiện qua từng lần phát hành. Việc liệu họ có bao giờ đạt được mức độ tương đương 100% hiệu suất chuẩn hay không vẫn là một câu hỏi còn bỏ ngỏ. Quá trình nén có lẽ sẽ luôn có một số tác động nhất định, Hassibi chia sẻ.
Mặc dù vậy, sự tương đương điểm chuẩn hoàn hảo cũng mang tính hàn lâm là chính. Các LLM vốn dĩ đã không quá chính xác ở dạng chưa nén, và các bài kiểm tra chuẩn cũng không phản ánh hoàn toàn chính xác các tác vụ thực tế, do đó sự sụt giảm 2% có thể sẽ không ảnh hưởng đáng kể đến cách một mô hình hoạt động trong sử dụng thực tế. (Thêm vào đó, phần mềm xung quanh — khung mà mô hình chạy bên trong — cũng rất quan trọng đối với độ chính xác.)
PrismML cho biết họ đạt được điều này bằng cách thu gọn các “trọng số” (weights) cấu thành nên mô hình — trọng số thực chất là thông tin mà mô hình học và lưu trữ trong quá trình huấn luyện. Thông thường, mỗi trọng số đòi hỏi 16 bit. Phương pháp của PrismML, gọi là trọng số “tam phân” (ternary), đơn giản hóa con số đó xuống còn ba giá trị: +1, −1 hoặc 0. Với các giá trị cần lưu trữ cho mỗi trọng số nhỏ hơn rất nhiều, mô hình chiếm ít không gian hơn đáng kể. (Để tìm hiểu sâu hơn về kỹ thuật nén này, bạn có thể xem trang GitHub của dự án.)
Mục tiêu tiếp theo của startup là áp dụng kỹ thuật nén này cho các mô hình lớn hơn nữa. “Các mô hình tiếp theo mà chúng tôi sẽ phát hành, hy vọng là trong vài tháng tới, sẽ nằm trong phạm vi hàng trăm tỷ tham số, và tôi kỳ vọng việc giữ lại trí thông minh ở đó sẽ dễ dàng hơn,” Hassibi nói với TechCrunch.
Khi kích thước mô hình tăng lên, ông bổ sung thêm, “Có nhiều dư địa hơn để có thể nén chúng mà không làm mất đi trí thông minh. Vì vậy, tôi chỉ muốn nói rằng theo xu hướng chung, đối với các mô hình lớn hơn, việc đạt được 100% sẽ dễ dàng hơn.”
Stoica chia sẻ rằng ông rất phấn khích với công nghệ này vì nó giúp các mô hình tiên tiến có thể chạy trên thiết bị của người dùng. “Bạn sẽ có trí thông minh trong tầm tay, và nó sẽ hoàn toàn miễn phí vì nó chạy trên thiết bị bạn đã mua. Nó cũng sẽ mang tính riêng tư cao, bởi vì bạn không phải gửi dữ liệu lên đám mây.”
🚀 STARTUP PRISMML RA MẮT MÔ HÌNH AI SIÊU NHỎ, KỲ VỌNG THAY ĐỔI CÁCH CHÚNG TA DÙNG TRÍ TUỆ NHÂN TẠO Nếu phòng nghiên cứu AI PrismML chưa nằm trong tầm ngắm của bạn, thì đã đến lúc bạn nên chú ý — không phải vì họ huy động được số tiền khổng lồ (họ chưa làm vậy, mới chỉ gọi vốn vòng hạt giống 22,25 triệu USD), mà vì những bộ óc kỹ thuật đằng sau và công nghệ có tiềm năng thay đổi ngành mà họ đang phát triển. PrismML đang đặt cược rằng các mô hình ngôn ngữ lớn có khả năng lập luận mạnh mẽ, hiệu suất cao trên thực tế không nhất thiết phải có kích thước lớn. Họ đang tạo ra các mô hình lập luận nhỏ đến mức có thể vừa vặn trên máy tính cá nhân và điện thoại thông minh. (Thậm chí có tin đồn cho rằng họ đang đàm phán với Apple, mặc dù CEO Babak Hassibi từ chối bình luận về điều đó với TechCrunch.) Vào thứ Năm, PrismML đã phát hành Bonsai 2 27B, mô hình mới nhất trong dòng sản phẩm của họ, nén Qwen3.8 27B, một mô hình mã nguồn mở được sử dụng rộng rãi từ Alibaba, xuống còn 5.9 GB. Kích thước này đủ nhỏ để chạy trên PC và có thể là cả điện thoại thông minh cao cấp. Đây là mức giảm bộ nhớ từ 9 đến 10 lần so với phiên bản gốc. PrismML được thành lập bởi một nhóm các nhà nghiên cứu từ Caltech và do Hassibi dẫn dắt, ông là giáo sư tại Caltech kiêm chuyên gia về công nghệ nén. Startup này cũng có Ion Stoica làm cố vấn. Stoica là đồng sáng lập của Databricks (và các công ty khác) đồng thời là giám đốc Phòng thí nghiệm Sky Computing nổi tiếng của Berkeley, nơi đã khai sinh ra nhiều công nghệ và startup, từ Letta đến SGLang. PrismML cũng được hậu thuẫn bởi các nhà đầu tư Khosla Ventures, Cerberus Capital và Caltech. Startup này chắc chắn không phải là công ty duy nhất đang làm việc về công nghệ nén LLM. Multiverse Computing, được thành lập bởi một giáo sư nổi tiếng từ Trung tâm Vật lý Quốc tế Donostia của Tây Ban Nha, là một cái tên khác. (Và Multiverse Computing đã huy động được rất nhiều tiền.) Nhưng Hassibi cho biết công nghệ nén của PrismML là độc nhất vì các LLM của họ hầu như không bị suy giảm hiệu suất so với các bản gốc. Bonsai 2 đạt được 98% tổng điểm chuẩn (benchmark) của Qwen. Con số này tăng từ mức 95% của phiên bản Bonsai đầu tiên được phát hành vài tháng trước vào tháng Ba. Mô hình ban đầu đó đã đạt hơn 11 triệu lượt tải xuống, và các mô hình thậm chí còn nhỏ hơn của PrismML đã đạt thêm 2,6 triệu lượt tải xuống, theo công ty. Điều này cho thấy kết quả nén của PrismML đã được cải thiện qua từng lần phát hành. Việc liệu họ có bao giờ đạt được mức độ tương đương 100% hiệu suất chuẩn hay không vẫn là một câu hỏi còn bỏ ngỏ. Quá trình nén có lẽ sẽ luôn có một số tác động nhất định, Hassibi chia sẻ. Mặc dù vậy, sự tương đương điểm chuẩn hoàn hảo cũng mang tính hàn lâm là chính. Các LLM vốn dĩ đã không quá chính xác ở dạng chưa nén, và các bài kiểm tra chuẩn cũng không phản ánh hoàn toàn chính xác các tác vụ thực tế, do đó sự sụt giảm 2% có thể sẽ không ảnh hưởng đáng kể đến cách một mô hình hoạt động trong sử dụng thực tế. (Thêm vào đó, phần mềm xung quanh — khung mà mô hình chạy bên trong — cũng rất quan trọng đối với độ chính xác.) PrismML cho biết họ đạt được điều này bằng cách thu gọn các “trọng số” (weights) cấu thành nên mô hình — trọng số thực chất là thông tin mà mô hình học và lưu trữ trong quá trình huấn luyện. Thông thường, mỗi trọng số đòi hỏi 16 bit. Phương pháp của PrismML, gọi là trọng số “tam phân” (ternary), đơn giản hóa con số đó xuống còn ba giá trị: +1, −1 hoặc 0. Với các giá trị cần lưu trữ cho mỗi trọng số nhỏ hơn rất nhiều, mô hình chiếm ít không gian hơn đáng kể. (Để tìm hiểu sâu hơn về kỹ thuật nén này, bạn có thể xem trang GitHub của dự án.) Mục tiêu tiếp theo của startup là áp dụng kỹ thuật nén này cho các mô hình lớn hơn nữa. “Các mô hình tiếp theo mà chúng tôi sẽ phát hành, hy vọng là trong vài tháng tới, sẽ nằm trong phạm vi hàng trăm tỷ tham số, và tôi kỳ vọng việc giữ lại trí thông minh ở đó sẽ dễ dàng hơn,” Hassibi nói với TechCrunch. Khi kích thước mô hình tăng lên, ông bổ sung thêm, “Có nhiều dư địa hơn để có thể nén chúng mà không làm mất đi trí thông minh. Vì vậy, tôi chỉ muốn nói rằng theo xu hướng chung, đối với các mô hình lớn hơn, việc đạt được 100% sẽ dễ dàng hơn.” Stoica chia sẻ rằng ông rất phấn khích với công nghệ này vì nó giúp các mô hình tiên tiến có thể chạy trên thiết bị của người dùng. “Bạn sẽ có trí thông minh trong tầm tay, và nó sẽ hoàn toàn miễn phí vì nó chạy trên thiết bị bạn đã mua. Nó cũng sẽ mang tính riêng tư cao, bởi vì bạn không phải gửi dữ liệu lên đám mây.” 🗞 Nguồn: TechCrunch #vgsnews #vgs #tintuc
Nguồn: TechCrunch