Mô hình AI hoàn toàn mới từ cựu nhà sáng chế ChatGPT đang khiến các lập trình viên phấn khích
Cựu nhà nghiên cứu OpenAI Diogo Almeida vừa ra mắt Jev, một loại mô hình AI dựa trên transformer mới không xuất ra văn bản mà tạo ra xác suất và quyết định đã hiệu chuẩn. Mô hình này giúp tự động hóa phần mềm nhanh hơn, rẻ hơn đáng kể và hoàn toàn không bịa đặt thông tin (hallucination).
ChatGPT đã làm tan vỡ trái tim của Diogo Almeida. Almeida từng là nhà nghiên cứu tại OpenAI, người đã giúp xây dựng chatbot này và phát minh ra kỹ thuật huấn luyện mô hình tăng cường học từ phản hồi của con người (RLHF) - phương pháp có lẽ đóng vai trò lớn nhất tạo nên kỷ nguyên AI hiện tại của chúng ta. Tuy nhiên, bất chấp những khả năng của nó, anh vẫn cảm thấy thất vọng. Chúng ta đang nắm giữ thứ sức mạnh tuyệt vời nhưng lại chưa thực sự hữu ích, Almeida chia sẻ với TechCrunch. Tôi đã vật lộn với vấn đề đó kể từ đó. Tôi mất một thời gian để đi đến kết luận: vấn đề là chúng ta đang tối ưu hóa cho ngôn ngữ con người... Chúng ta đã rất giỏi về ngôn ngữ con người trong bốn năm qua, nhưng nó không hữu ích cho tự động hóa vì máy tính nói một ngôn ngữ khác. Hai năm trước, Almeida đã rời OpenAI để thành lập TypeSafe AI, một startup cố gắng giải quyết vấn đề đó. Tuần này, công ty đã phát hành một mô hình dựa trên transformer mới mang tên Jev, không phải là một mô hình ngôn ngữ lớn (LLM). Nó không xuất ra văn bản, mà thay vào đó tạo ra các xác suất, hoặc thứ mà công ty gọi là các quyết định được hiệu chuẩn. Việc né tránh ngôn ngữ mang lại một số lợi ích: Nó giúp mô hình cực kỳ rẻ và nhanh, và vì người dùng xác định trước các đầu ra nên nó không thể bịa đặt thông tin (hallucination). Các token đầu ra của nó hoàn toàn miễn phí, và các token đầu vào được tính phí theo tỷ giá trên mỗi tỷ token, thay vì trên mỗi triệu token. Các lập trình viên đang dành sự quan tâm lớn cho sản phẩm này; công ty đã từng tạm thời mất khả năng phục vụ người dùng từ API vì nhu cầu quá cao. Jev tỏ ra hữu ích nhất đối với việc tự động hóa phần mềm. Cho đến nay, các nhà phát triển phần mềm coi đây là một cách rẻ hơn và mạnh mẽ hơn để tích hợp trí thông minh vào mã nguồn của họ. Ví dụ, Pranit Sharma, một kỹ sư phần mềm tại Vercel (công ty chuyên tạo cơ sở hạ tầng tác nhân), cho biết công ty của anh đã sử dụng ChatGPT Luna 5.6 của OpenAI để chạy một bộ phân loại nhằm xem xét tính an toàn của các câu lệnh. Khi Vercel thay thế Luna của OpenAI bằng Jev, họ nhận được kết quả nhanh hơn từ 5 đến 18 lần và có độ chính xác cao hơn. Một lập trình viên khác là Nikhil Mudholkar, Giám đốc Công nghệ (CTO) của Bryo AI, đã thử nghiệm Jev so với Gemini trong việc phân loại email kinh doanh. Trong bài kiểm tra của anh, Gemini chính xác hơn một chút nhưng đắt hơn từ 10 đến 20 lần. Điều khiến Mudholkar hứng thú hơn là điểm số tin cậy của Jev - đây là mô hình duy nhất trả về một xác suất thực sự, khiến nó trở nên lý tưởng để tự động hóa các luồng công việc! Bên cạnh việc thay thế các LLM trong một số trường hợp sử dụng nhất định, mô hình mới này cũng có thể bổ sung cho chúng, đóng vai trò như một cơ chế kiểm tra thông minh đối với các hành vi sai lệch. Việc sử dụng các tác nhân để giám sát các tác nhân khác có thể nhanh chóng trở nên tốn kém, nhưng Almeida lập luận rằng việc dùng Jev để làm việc đó là hoàn toàn hợp lý. Anh thấy người dùng đang triển khai Jev để theo dõi các dấu vết của tác nhân LLM và ngăn chặn các hành vi vượt rào (jailbreak). Cuối cùng, nó chuyển một phần vấn đề bịa đặt thông tin sang cho người dùng, Armin Ronacher, Giám đốc Công nghệ của Earendil (đơn vị xây dựng bộ công cụ mô hình nguồn mở Pi) giải thích. Người dùng phải tự đánh giá rằng nếu kết quả trả về chỉ có xác suất 50%, thì có lẽ nó giống như việc tung đồng xu và tôi sẽ bỏ qua nó. Nhưng nếu là 95%, thì chắc chắn tôi có thể làm gì đó với nó. Một ứng dụng tiềm năng khác của Jev là định tuyến mô hình, theo Ronacher. Việc dự đoán xem một khối lượng công việc cụ thể có cần một mô hình chuyên biệt hay không sẽ rất hữu ích, nhưng việc sử dụng một LLM cho công việc đó sẽ rất tốn kém. Chi phí thấp và tốc độ cao của Jev giúp hiện thực hóa việc phân loại theo thời gian thực như vậy. Và đó chính là kỳ vọng của Almeida. Mô hình được đặt theo tên của William Stanley Jevons, nhà kinh tế học thế kỷ 19 với nghịch lý mang tên ông mô tả cách chi phí giảm xuống của một hàng hóa có thể khiến nó được sử dụng ngày càng nhiều. Trong trường hợp này, chi phí trí thông minh giảm xuống sẽ dẫn đến việc triển khai nó rộng rãi. Chúng tôi nghĩ rằng sẽ có phần mềm thông minh xuất hiện ở khắp mọi nơi theo một cách thức nổi bật và phân tán... giống thời kỳ đầu của internet hơn là những siêu ứng dụng mà mọi người đang cố gắng xây dựng ngay lúc này, Almeida nói. Almeida giữ kín về kiến trúc của mô hình, mà những nhà quan sát bên ngoài nghi ngờ được xây dựng dựa trên một LLM mở (open-weight LLM). Công ty gọi Jev là một mô hình Hệ thống Một (System One model), tập trung vào trực giác thay vì lý luận, và hướng cụ thể vào đúng nhiệm vụ. Almeida cho biết Jev được huấn luyện độc quyền trên dữ liệu tổng hợp bằng cách sử dụng một kỹ thuật mà anh gọi là học tăng cường từ các quyết định được hiệu chuẩn. Chúng tôi đã đặt cược từ sớm rằng chúng tôi sẽ tự tạo ra toàn bộ dữ liệu của mình, và đó là một trong những canh bạc tuyệt vời nhất trong đời tôi - theo tôi là tốt hơn cả thời điểm ra mắt của chúng tôi, tốt hơn cả RLHF, anh chia sẻ với TechCrunch. Một nửa công ty là một phòng thí nghiệm về cơ bản sở hữu toàn bộ lĩnh vực con này về dữ liệu tổng hợp được hiểu rõ về mặt thống kê, và đó giờ đây là niềm vui trong cuộc sống của tôi. Hiện tại, Jev đứng một mình như một loại mô hình độc đáo, nhưng Ronacher kỳ vọng rằng các đối thủ cạnh tranh sẽ xuất hiện khi tiện ích của nó đã rõ ràng. Chúng tôi đáng lẽ ra phải nhận ra điều này sớm hơn ở nhiều khía cạnh, nhưng có lẽ vì các LLM quá rẻ và được trợ giá nên bạn thường chưa cần phải sáng tạo, ông nói. Bản thân TypeSafe sẽ tiếp tục xây dựng thêm nhiều phiên bản mới của mô hình với các dạng thức (modalities) mới. Khi được hỏi liệu TypeSafe có phải là một phòng thí nghiệm tiên phong hay không, Almeida trả lời rằng sản phẩm chính của các phòng thí nghiệm tiên phong là sự sợ hãi hoặc sự thổi phồng. Tôi muốn sản phẩm chính của chúng tôi là trí thông minh... nhưng chúng tôi không phải là một phòng thí nghiệm theo kiểu đặt cược vào sự giàu có vô tận, hay một tôn giáo, hay xây dựng Chúa trong một trung tâm dữ liệu, hay bất cứ điều gì đang là mốt hiện nay.
🚀 MÔ HÌNH AI HOÀN TOÀN MỚI TỪ CỰU NHÀ SÁNG CHẾ CHATGPT ĐANG KHIẾN CÁC LẬP TRÌNH VIÊN PHẤN KHÍCH ChatGPT đã làm tan vỡ trái tim của Diogo Almeida. Almeida từng là nhà nghiên cứu tại OpenAI, người đã giúp xây dựng chatbot này và phát minh ra kỹ thuật huấn luyện mô hình tăng cường học từ phản hồi của con người (RLHF) - phương pháp có lẽ đóng vai trò lớn nhất tạo nên kỷ nguyên AI hiện tại của chúng ta. Tuy nhiên, bất chấp những khả năng của nó, anh vẫn cảm thấy thất vọng. Chúng ta đang nắm giữ thứ sức mạnh tuyệt vời nhưng lại chưa thực sự hữu ích, Almeida chia sẻ với TechCrunch. Tôi đã vật lộn với vấn đề đó kể từ đó. Tôi mất một thời gian để đi đến kết luận: vấn đề là chúng ta đang tối ưu hóa cho ngôn ngữ con người... Chúng ta đã rất giỏi về ngôn ngữ con người trong bốn năm qua, nhưng nó không hữu ích cho tự động hóa vì máy tính nói một ngôn ngữ khác. Hai năm trước, Almeida đã rời OpenAI để thành lập TypeSafe AI, một startup cố gắng giải quyết vấn đề đó. Tuần này, công ty đã phát hành một mô hình dựa trên transformer mới mang tên Jev, không phải là một mô hình ngôn ngữ lớn (LLM). Nó không xuất ra văn bản, mà thay vào đó tạo ra các xác suất, hoặc thứ mà công ty gọi là các quyết định được hiệu chuẩn. Việc né tránh ngôn ngữ mang lại một số lợi ích: Nó giúp mô hình cực kỳ rẻ và nhanh, và vì người dùng xác định trước các đầu ra nên nó không thể bịa đặt thông tin (hallucination). Các token đầu ra của nó hoàn toàn miễn phí, và các token đầu vào được tính phí theo tỷ giá trên mỗi tỷ token, thay vì trên mỗi triệu token. Các lập trình viên đang dành sự quan tâm lớn cho sản phẩm này; công ty đã từng tạm thời mất khả năng phục vụ người dùng từ API vì nhu cầu quá cao. Jev tỏ ra hữu ích nhất đối với việc tự động hóa phần mềm. Cho đến nay, các nhà phát triển phần mềm coi đây là một cách rẻ hơn và mạnh mẽ hơn để tích hợp trí thông minh vào mã nguồn của họ. Ví dụ, Pranit Sharma, một kỹ sư phần mềm tại Vercel (công ty chuyên tạo cơ sở hạ tầng tác nhân), cho biết công ty của anh đã sử dụng ChatGPT Luna 5.6 của OpenAI để chạy một bộ phân loại nhằm xem xét tính an toàn của các câu lệnh. Khi Vercel thay thế Luna của OpenAI bằng Jev, họ nhận được kết quả nhanh hơn từ 5 đến 18 lần và có độ chính xác cao hơn. Một lập trình viên khác là Nikhil Mudholkar, Giám đốc Công nghệ (CTO) của Bryo AI, đã thử nghiệm Jev so với Gemini trong việc phân loại email kinh doanh. Trong bài kiểm tra của anh, Gemini chính xác hơn một chút nhưng đắt hơn từ 10 đến 20 lần. Điều khiến Mudholkar hứng thú hơn là điểm số tin cậy của Jev - đây là mô hình duy nhất trả về một xác suất thực sự, khiến nó trở nên lý tưởng để tự động hóa các luồng công việc! Bên cạnh việc thay thế các LLM trong một số trường hợp sử dụng nhất định, mô hình mới này cũng có thể bổ sung cho chúng, đóng vai trò như một cơ chế kiểm tra thông minh đối với các hành vi sai lệch. Việc sử dụng các tác nhân để giám sát các tác nhân khác có thể nhanh chóng trở nên tốn kém, nhưng Almeida lập luận rằng việc dùng Jev để làm việc đó là hoàn toàn hợp lý. Anh thấy người dùng đang triển khai Jev để theo dõi các dấu vết của tác nhân LLM và ngăn chặn các hành vi vượt rào (jailbreak). Cuối cùng, nó chuyển một phần vấn đề bịa đặt thông tin sang cho người dùng, Armin Ronacher, Giám đốc Công nghệ của Earendil (đơn vị xây dựng bộ công cụ mô hình nguồn mở Pi) giải thích. Người dùng phải tự đánh giá rằng nếu kết quả trả về chỉ có xác suất 50%, thì có lẽ nó giống như việc tung đồng xu và tôi sẽ bỏ qua nó. Nhưng nếu là 95%, thì chắc chắn tôi có thể làm gì đó với nó. Một ứng dụng tiềm năng khác của Jev là định tuyến mô hình, theo Ronacher. Việc dự đoán xem một khối lượng công việc cụ thể có cần một mô hình chuyên biệt hay không sẽ rất hữu ích, nhưng việc sử dụng một LLM cho công việc đó sẽ rất tốn kém. Chi phí thấp và tốc độ cao của Jev giúp hiện thực hóa việc phân loại theo thời gian thực như vậy. Và đó chính là kỳ vọng của Almeida. Mô hình được đặt theo tên của William Stanley Jevons, nhà kinh tế học thế kỷ 19 với nghịch lý mang tên ông mô tả cách chi phí giảm xuống của một hàng hóa có thể khiến nó được sử dụng ngày càng nhiều. Trong trường hợp này, chi phí trí thông minh giảm xuống sẽ dẫn đến việc triển khai nó rộng rãi. Chúng tôi nghĩ rằng sẽ có phần mềm thông minh xuất hiện ở khắp mọi nơi theo một cách thức nổi bật và phân tán... giống thời kỳ đầu của internet hơn là những siêu ứng dụng mà mọi người đang cố gắng xây dựng ngay lúc này, Almeida nói. Almeida giữ kín về kiến trúc của mô hình, mà những nhà quan sát bên ngoài nghi ngờ được xây dựng dựa trên một LLM mở (open-weight LLM). Công ty gọi Jev là một mô hình Hệ thống Một (System One model), tập trung vào trực giác thay vì lý luận, và hướng cụ thể vào đúng nhiệm vụ. Almeida cho biết Jev được huấn luyện độc quyền trên dữ liệu tổng hợp bằng cách sử dụng một kỹ thuật mà anh gọi là học tăng cường từ các quyết định được hiệu chuẩn. Chúng tôi đã đặt cược từ sớm rằng chúng tôi sẽ tự tạo ra toàn bộ dữ liệu của mình, và đó là một trong những canh bạc tuyệt vời nhất trong đời tôi - theo tôi là tốt hơn cả thời điểm ra mắt của chúng tôi, tốt hơn cả RLHF, anh chia sẻ với TechCrunch. Một nửa công ty là một phòng thí nghiệm về cơ bản sở hữu toàn bộ lĩnh vực con này về dữ liệu tổng hợp được hiểu rõ về mặt thống kê, và đó giờ đây là niềm vui trong cuộc sống của tôi. Hiện tại, Jev đứng một mình như một loại mô hình độc đáo, nhưng Ronacher kỳ vọng rằng các đối thủ cạnh tranh sẽ xuất hiện khi tiện ích của nó đã rõ ràng. Chúng tôi đáng lẽ ra phải nhận ra điều này sớm hơn ở nhiều khía cạnh, nhưng có lẽ vì các LLM quá rẻ và được trợ giá nên bạn thường chưa cần phải sáng tạo, ông nói. Bản thân TypeSafe sẽ tiếp tục xây dựng thêm nhiều phiên bản mới của mô hình với các dạng thức (modalities) mới. Khi được hỏi liệu TypeSafe có phải là một phòng thí nghiệm tiên phong hay không, Almeida trả lời rằng sản phẩm chính của các phòng thí nghiệm tiên phong là sự sợ hãi hoặc sự thổi phồng. Tôi muốn sản phẩm chính của chúng tôi là trí thông minh... nhưng chúng tôi không phải là một phòng thí nghiệm theo kiểu đặt cược vào sự giàu có vô tận, hay một tôn giáo, hay xây dựng Chúa trong một trung tâm dữ liệu, hay bất cứ điều gì đang là mốt hiện nay. 🗞 Nguồn: TechCrunch #vgsnews #vgs #tintuc
Nguồn: TechCrunch