Benchmark mới so sánh người viết với 24 LLM: Chỉ các mô hình tiên tiến mới vừa vách vượt qua nghiệp dư
Một bộ tiêu chuẩn đánh giá sáng tạo nội dung mới từ Vulsar AI cho thấy các mô hình AI hàng đầu chỉ mới nhỉnh hơn người viết nghiệp dư một chút. Trong khi đó, khoảng cách kỹ năng giữa người viết nghiệp dư và chuyên nghiệp vẫn còn rất lớn, đồng thời các mô hình AI nhỏ hơn tỏ ra kém hiệu quả rõ rệt.

Một bộ tiêu chuẩn đánh giá Viết sáng tạo (Creative Writing benchmark) vừa được Vulsar AI công bố, đánh giá hiệu suất của các mô hình ngôn ngữ lớn (LLM) khác nhau so với cả người viết nghiệp dư lẫn chuyên nghiệp. Với sự bùng nổ của AI, nhiều báo cáo từng đề cập rằng các nghề nghiệp liên quan đến viết lách đang có nguy cơ bị thay thế bởi các mô hình trí tuệ nhân tạo vượt trội. Tuy nhiên, dựa trên 475 câu lệnh (prompt), bộ tiêu chuẩn mới cho thấy chỉ có các mô hình tiên tiến mới có thể vượt qua con người, và đó cũng chỉ là những người viết nghiệp dư chứ không phải chuyên nghiệp.
GPT 6 Astra dẫn đầu bảng xếp hạng "Tổng thể", vượt nhẹ qua người viết nghiệp dư
Bài kiểm tra do Vulsar AI thực hiện đánh giá vị trí của các LLM khi thử nghiệm khả năng tạo văn bản dài. Bài nộp sử dụng một mô hình phần thưởng (reward model) được tinh chỉnh dựa trên dữ liệu sở thích của con người để dự đoán mức độ yêu thích chung của độc giả. Theo các bảng xếp hạng trong ảnh chụp màn hình bên dưới, GPT 6 Astra dẫn đầu với tỷ lệ chiến thắng dự đoán là 87,8%, vượt qua người viết nghiệp dư đạt tỷ lệ chiến thắng dự đoán là 86,6%. Dù vậy, khoảng cách kỹ năng giữa người viết nghiệp dư và người viết chuyên nghiệp vẫn là vô cùng lớn.
Trong khi bài kiểm tra cho thấy các mô hình tiên tiến như GPT 6 Astra đã vượt qua người viết nghiệp dư, các cá nhân chuyên nghiệp vẫn đạt điểm số cao hơn đáng kể khi được đánh giá riêng biệt. Về vị trí thứ ba, GPT 5.6 Sol của OpenAI đạt tỷ lệ chiến thắng dự đoán 77,6%, trong khi Claude Fable 5.1 của Anthropic đạt 70,3%. Tuy nhiên, có một sự sụt giảm lớn về điểm số khi rời xa các mô hình AI có quy mô hàng nghìn tỷ tham số.
Chẳng hạn, Claude Opus 5, Kimi K3, Grok 4.6 và các mô hình khác rơi vào khoảng 50–65%, cho thấy những hạn chế thực sự của các mô hình nổi tiếng này so với chuẩn cơ sở của con người. Các mô hình ít tham số hơn thậm chí mang lại kết quả tồi tệ hơn, với các LLM phổ biến như Qwen3.8-27B đạt 23,2%, DeepSeek V4.1 Flash ghi nhận 19,8% và Gemma 4 26B ở vị trí bét bảng với số điểm chỉ 10,9%.
Xét về khả năng tạo token, người viết là con người tạo ra sản lượng cao nhất trên mỗi câu lệnh ở mức 2.592 token, theo sau là các mô hình như GPT 6 Astra với 1.537 token và Claude Fable 5.1 ở mức 2.114 token. Các cuộc thảo luận trên Reddit tiết lộ một hạn chế đáng tiếc của các mô hình nhỏ hơn; chúng có xu hướng mất tính mạch lạc trong các câu lệnh nhiều chương, đưa ra các cụm từ lặp đi lặp lại, đó là lý do tại sao người viết là con người được coi là vượt trội về mặt này.
Không chỉ người viết là con người có thể duy trì cốt truyện phức tạp, tư duy tự phát của họ còn cho phép họ thay đổi phong cách và năng suất ngay lập tức. Dù vậy, sẽ mất bao lâu nữa trước khi chúng ta đối mặt với các LLM có thể tái tạo gần như chính xác những gì người viết chuyên nghiệp đạt được? Đó sẽ là một cuộc tranh luận dành cho dịp khác.
⚡ BENCHMARK MỚI SO SÁNH NGƯỜI VIẾT VỚI 24 LLM: CHỈ CÁC MÔ HÌNH TIÊN TIẾN MỚI VỪA VÁCH VƯỢT QUA NGHIỆP DƯ Một bộ tiêu chuẩn đánh giá Viết sáng tạo (Creative Writing benchmark) vừa được Vulsar AI công bố, đánh giá hiệu suất của các mô hình ngôn ngữ lớn (LLM) khác nhau so với cả người viết nghiệp dư lẫn chuyên nghiệp. Với sự bùng nổ của AI, nhiều báo cáo từng đề cập rằng các nghề nghiệp liên quan đến viết lách đang có nguy cơ bị thay thế bởi các mô hình trí tuệ nhân tạo vượt trội. Tuy nhiên, dựa trên 475 câu lệnh (prompt), bộ tiêu chuẩn mới cho thấy chỉ có các mô hình tiên tiến mới có thể vượt qua con người, và đó cũng chỉ là những người viết nghiệp dư chứ không phải chuyên nghiệp. GPT 6 Astra dẫn đầu bảng xếp hạng "Tổng thể", vượt nhẹ qua người viết nghiệp dư Bài kiểm tra do Vulsar AI thực hiện đánh giá vị trí của các LLM khi thử nghiệm khả năng tạo văn bản dài. Bài nộp sử dụng một mô hình phần thưởng (reward model) được tinh chỉnh dựa trên dữ liệu sở thích của con người để dự đoán mức độ yêu thích chung của độc giả. Theo các bảng xếp hạng trong ảnh chụp màn hình bên dưới, GPT 6 Astra dẫn đầu với tỷ lệ chiến thắng dự đoán là 87,8%, vượt qua người viết nghiệp dư đạt tỷ lệ chiến thắng dự đoán là 86,6%. Dù vậy, khoảng cách kỹ năng giữa người viết nghiệp dư và người viết chuyên nghiệp vẫn là vô cùng lớn. Trong khi bài kiểm tra cho thấy các mô hình tiên tiến như GPT 6 Astra đã vượt qua người viết nghiệp dư, các cá nhân chuyên nghiệp vẫn đạt điểm số cao hơn đáng kể khi được đánh giá riêng biệt. Về vị trí thứ ba, GPT 5.6 Sol của OpenAI đạt tỷ lệ chiến thắng dự đoán 77,6%, trong khi Claude Fable 5.1 của Anthropic đạt 70,3%. Tuy nhiên, có một sự sụt giảm lớn về điểm số khi rời xa các mô hình AI có quy mô hàng nghìn tỷ tham số. Chẳng hạn, Claude Opus 5, Kimi K3, Grok 4.6 và các mô hình khác rơi vào khoảng 50–65%, cho thấy những hạn chế thực sự của các mô hình nổi tiếng này so với chuẩn cơ sở của con người. Các mô hình ít tham số hơn thậm chí mang lại kết quả tồi tệ hơn, với các LLM phổ biến như Qwen3.8-27B đạt 23,2%, DeepSeek V4.1 Flash ghi nhận 19,8% và Gemma 4 26B ở vị trí bét bảng với số điểm chỉ 10,9%. Xét về khả năng tạo token, người viết là con người tạo ra sản lượng cao nhất trên mỗi câu lệnh ở mức 2.592 token, theo sau là các mô hình như GPT 6 Astra với 1.537 token và Claude Fable 5.1 ở mức 2.114 token. Các cuộc thảo luận trên Reddit tiết lộ một hạn chế đáng tiếc của các mô hình nhỏ hơn; chúng có xu hướng mất tính mạch lạc trong các câu lệnh nhiều chương, đưa ra các cụm từ lặp đi lặp lại, đó là lý do tại sao người viết là con người được coi là vượt trội về mặt này. Không chỉ người viết là con người có thể duy trì cốt truyện phức tạp, tư duy tự phát của họ còn cho phép họ thay đổi phong cách và năng suất ngay lập tức. Dù vậy, sẽ mất bao lâu nữa trước khi chúng ta đối mặt với các LLM có thể tái tạo gần như chính xác những gì người viết chuyên nghiệp đạt được? Đó sẽ là một cuộc tranh luận dành cho dịp khác. 🗞 Nguồn: Wccftech #vgsnews #vgs #tintuc