Bản tin công nghệ quốc tế · dịch tiếng Việt 19.09.2026 RSS
AI & Dữ liệu · TechCrunch

Vals: Startup được Andreessen Horowitz hậu thuẫn muốn định hình lại tiêu chuẩn đánh giá AI

Startup Vals đang thu hút sự chú ý trong ngành công nghệ khi huy động thành công 40 triệu USD trong vòng Series A do Andreessen Horowitz dẫn dắt. Công ty này đặt mục tiêu tạo ra các hệ thống đánh giá năng lực AI thực tế và bảo mật hơn để thay thế các phương pháp đo lường truyền thống đang dần lỗi thời.

TechCrunch19.09.20266 phút đọc1 lượt đọc

Việc chấm điểm chuẩn (benchmarking) đã trở thành tiêu chuẩn chung trong ngành để các công ty AI xác thực năng lực của mô hình, và khi các số liệu có lợi cho họ, họ có thể nổi bật hơn đối thủ và quảng bá sự ưu việt của mình. Nói cách khác, các bài kiểm tra chuẩn tốt hầu như luôn đồng nghĩa với PR tốt.

Đáng tiếc là các công ty cũng đã tìm ra cách đánh lừa các hệ thống đánh giá cũ — phần lớn trong số đó đã cũ và không được xây dựng để đo lường năng lực của các mô hình hiện đại.

Vals, một startup thành lập năm 2024, cho biết họ đang thực hiện sứ mệnh khắc phục hệ thống còn nhiều điểm bất cập này. Trong khoảng thời gian chưa đầy hai năm, công ty đã tạo dựng được chỗ đứng đáng chú ý trong ngành công nghệ và năm ngoái, họ đã thành công kêu gọi một vòng hạt giống (seed round) do 8VC và Bloomberg Beta dẫn dắt. Sau đó, vào tháng trước, sau một giai đoạn tăng trưởng nhanh chóng, họ đã huy động được 40 triệu USD trong vòng Series A do Andreessen Horowitz dẫn dắt.

Rayan Krishnan, nhà đồng sáng lập 25 tuổi của công ty, trước đây từng thực tập tại Palantir, và khi còn là sinh viên đại học tại Stanford, từng làm việc cho Microsoft và phòng thí nghiệm trí tuệ nhân tạo nổi tiếng của trường. Krishnan cho biết Vals ra đời từ những quan sát của chính anh về việc các hệ thống đánh giá đang bị tụt lại phía sau so với sự tiến bộ của ngành mà chúng được thiết kế để đo lường.

"Chúng tôi thấy một loạt mô hình mới, rất có năng lực gia nhập thị trường một cách nhanh chóng, và các bài kiểm tra mang tính học thuật đã không theo kịp tốc độ tiến bộ ở biên giới đó," Krishnan chia sẻ. Với việc AI đang được tích hợp vào mọi khía cạnh của xã hội, các bài đánh giá thực sự nên tồn tại để xác minh rằng các mô hình có thể làm được những gì mà các công ty quảng cáo là chúng làm được, Krishnan cho biết.

Tuần trước, nhà sáng lập trẻ tuổi đã dẫn tôi đi tham quan văn phòng hai tầng của công ty nằm trên đường Folsom, San Francisco — một tòa nhà gạch cổ mà một thế kỷ trước từng là địa điểm của một nhà máy bia lớn. Thay vì sản xuất bia mang tính công nghiệp, cấu trúc lịch sử này nay là nơi ở của một số startup khác nhau đang tìm cách định hình tương lai của ngành công nghệ.

"Về mặt lịch sử, tôi nghĩ việc đánh giá thường được thực hiện để đánh giá trí tuệ theo một cách rất trừu tượng," Krishnan nói với tôi. "Ví dụ như, các mô hình có biết đủ thông tin để vượt qua một bài kiểm tra kiểu thi luật sư hay không?"

Tại đây, Vals tìm cách tạo sự khác biệt. Trong khi nhiều hệ thống đánh giá cung cấp các bài kiểm tra có sẵn công khai (điều này có thể cho phép một công ty huấn luyện mô hình của họ dựa trên các bài kiểm tra đó, qua đó có thể coi là gian lận trong kỳ thi), Vals không công khai tiết lộ tài liệu kiểm tra cụ thể của mình. Thay vì đo lường kiến thức chung của mô hình AI, Vals còn đánh giá các mô hình dựa trên khả năng hoàn thành các tác vụ phức tạp liên quan đến các ngành cụ thể như luật pháp, tài chính và lập trình.

"Những gì chúng tôi đang làm thực sự là xem xét tác động thực tế của các mô hình," Krishnan nói. "Liệu chúng có thể làm công việc tạo ra sản phẩm có chất lượng tương đương con người trong mọi lĩnh vực không?"

Ý tưởng là kiểm tra không chỉ các kết quả tích cực mà cả các kết quả tiêu cực, anh cho biết. Hy vọng là phân tích cách thức mà "nếu những mô hình này hoạt động tự do ngoài đời thực, những hệ quả tiêu cực sẽ là gì."

Các năng lực mà Vals đang đo lường ngày càng mở rộng. Ngoài các ngành truyền thống hơn, startup này tiếp tục dấn thân vào những địa hạt độc đáo hơn. "Chúng tôi có một bài kiểm tra về khả năng tự cải thiện đệ quy. Chúng tôi đang thực hiện một số công việc về sức khỏe tâm thần, an ninh mạng, an toàn sinh học, và thậm chí cả luật xung đột vũ trang để các mô hình hiểu cách áp dụng Công ước Geneva," Krishnan chia sẻ.

Các công ty trả tiền cho Vals để kiểm tra mô hình của họ, đây có thể là một khái niệm kỳ lạ để tiếp nhận. Tại sao một công ty lại trả tiền để biết rằng mô hình của mình hoạt động không tốt? Nhưng việc có một công cụ đo lường hiệu quả giúp các công ty khắc phục sự cố và cải thiện theo thời gian. Krishnan so sánh mô hình doanh thu của họ với cách một học sinh có thể trả tiền cho College Board để thi SAT.

Ngược lại, các đánh giá này đang trở thành yếu tố quyết định quan trọng đối với các công ty đang muốn áp dụng các mô hình AI mới.

Startup này gần đây tiết lộ rằng doanh thu hiện tại của họ cao gấp tám lần so với năm ngoái. Đội ngũ nhân sự của họ cũng đang tăng lên. Vals, khởi đầu năm với chỉ 8 người, nay đã tăng gấp ba lần lên đội ngũ 25 người. Krishnan cho biết khi startup phát triển, kế hoạch là chuyển đến một văn phòng lớn hơn đáng kể, cũng như bổ sung thêm từ 10 đến 15 nhân sự. Công ty cũng gần đây đã ra mắt một chương trình tập trung vào việc cung cấp các đánh giá mô hình cho các cơ quan liên bang.

Krishnan coi hệ thống đánh giá của công ty mình là tương lai cho cách các công ty AI suy nghĩ về việc phát triển kinh doanh và thiết lập lòng tin công chúng.

"Các công ty AI đang bắt đầu lên sàn chứng khoán. SpaceX đã lên sàn. Anthropic dự kiến diễn ra vào cuối năm nay. Tôi nghi ngờ OpenAI cũng sẽ sớm lên sàn. Tôi nghĩ khi các mô hình AI trở thành cốt lõi của nền kinh tế và được phổ biến rộng rãi hơn, các loại bài kiểm tra và đánh giá mà chúng tôi thực hiện sẽ thúc đẩy việc sử dụng chúng và trở thành phần trung tâm trong cách các công ty này nộp hồ sơ công khai hoặc nói về các khoản đầu tư tương lai mà họ sẽ rót vào AI," anh chia sẻ.


Cùng chuyên mục · AI & Dữ liệu
AI & Dữ liệu

Cựu quan chức chống độc quyền DOJ nhận định về việc các hãng AI xin miễn trừ chống độc quyền

Jonathan Kanter, cựu lãnh đạo bộ phận chống độc quyền của DOJ, cho rằng các công ty AI không cần phải phối hợp hay xin…

The Verge · 9 phút đọc
AI & Dữ liệu

Benchmark mới so sánh người viết với 24 LLM: Chỉ các mô hình tiên tiến mới vừa vách vượt qua nghiệp dư

Một bộ tiêu chuẩn đánh giá sáng tạo nội dung mới từ Vulsar AI cho thấy các mô hình AI hàng đầu chỉ mới nhỉnh hơn người…

Wccftech · 3 phút đọc
AI & Dữ liệu

Disney bổ nhiệm Giám đốc Công nghệ đầu tiên trong lịch sử công ty

Disney vừa chiêu mộ Karandeep Anand, cựu CEO của startup chatbot Character.AI, làm Giám đốc Công nghệ (CTO) đầu tiên…

The Verge · 1 phút đọc