Bản tin công nghệ quốc tế · dịch tiếng Việt 19.09.2026 RSS
AI & Dữ liệu · Wccftech

Benchmark mới so sánh người viết với 24 LLM: Chỉ các mô hình tiên tiến mới vừa vách vượt qua nghiệp dư

Một bộ tiêu chuẩn đánh giá sáng tạo nội dung mới từ Vulsar AI cho thấy các mô hình AI hàng đầu chỉ mới nhỉnh hơn người viết nghiệp dư một chút. Trong khi đó, khoảng cách kỹ năng giữa người viết nghiệp dư và chuyên nghiệp vẫn còn rất lớn, đồng thời các mô hình AI nhỏ hơn tỏ ra kém hiệu quả rõ rệt.

Wccftech19.09.20263 phút đọc1 lượt đọc
Ảnh: Wccftech

Một bộ tiêu chuẩn đánh giá Viết sáng tạo (Creative Writing benchmark) vừa được Vulsar AI công bố, đánh giá hiệu suất của các mô hình ngôn ngữ lớn (LLM) khác nhau so với cả người viết nghiệp dư lẫn chuyên nghiệp. Với sự bùng nổ của AI, nhiều báo cáo từng đề cập rằng các nghề nghiệp liên quan đến viết lách đang có nguy cơ bị thay thế bởi các mô hình trí tuệ nhân tạo vượt trội. Tuy nhiên, dựa trên 475 câu lệnh (prompt), bộ tiêu chuẩn mới cho thấy chỉ có các mô hình tiên tiến mới có thể vượt qua con người, và đó cũng chỉ là những người viết nghiệp dư chứ không phải chuyên nghiệp.

GPT 6 Astra dẫn đầu bảng xếp hạng "Tổng thể", vượt nhẹ qua người viết nghiệp dư

Bài kiểm tra do Vulsar AI thực hiện đánh giá vị trí của các LLM khi thử nghiệm khả năng tạo văn bản dài. Bài nộp sử dụng một mô hình phần thưởng (reward model) được tinh chỉnh dựa trên dữ liệu sở thích của con người để dự đoán mức độ yêu thích chung của độc giả. Theo các bảng xếp hạng trong ảnh chụp màn hình bên dưới, GPT 6 Astra dẫn đầu với tỷ lệ chiến thắng dự đoán là 87,8%, vượt qua người viết nghiệp dư đạt tỷ lệ chiến thắng dự đoán là 86,6%. Dù vậy, khoảng cách kỹ năng giữa người viết nghiệp dư và người viết chuyên nghiệp vẫn là vô cùng lớn.

Trong khi bài kiểm tra cho thấy các mô hình tiên tiến như GPT 6 Astra đã vượt qua người viết nghiệp dư, các cá nhân chuyên nghiệp vẫn đạt điểm số cao hơn đáng kể khi được đánh giá riêng biệt. Về vị trí thứ ba, GPT 5.6 Sol của OpenAI đạt tỷ lệ chiến thắng dự đoán 77,6%, trong khi Claude Fable 5.1 của Anthropic đạt 70,3%. Tuy nhiên, có một sự sụt giảm lớn về điểm số khi rời xa các mô hình AI có quy mô hàng nghìn tỷ tham số.

Chẳng hạn, Claude Opus 5, Kimi K3, Grok 4.6 và các mô hình khác rơi vào khoảng 50–65%, cho thấy những hạn chế thực sự của các mô hình nổi tiếng này so với chuẩn cơ sở của con người. Các mô hình ít tham số hơn thậm chí mang lại kết quả tồi tệ hơn, với các LLM phổ biến như Qwen3.8-27B đạt 23,2%, DeepSeek V4.1 Flash ghi nhận 19,8% và Gemma 4 26B ở vị trí bét bảng với số điểm chỉ 10,9%.

Xét về khả năng tạo token, người viết là con người tạo ra sản lượng cao nhất trên mỗi câu lệnh ở mức 2.592 token, theo sau là các mô hình như GPT 6 Astra với 1.537 token và Claude Fable 5.1 ở mức 2.114 token. Các cuộc thảo luận trên Reddit tiết lộ một hạn chế đáng tiếc của các mô hình nhỏ hơn; chúng có xu hướng mất tính mạch lạc trong các câu lệnh nhiều chương, đưa ra các cụm từ lặp đi lặp lại, đó là lý do tại sao người viết là con người được coi là vượt trội về mặt này.

Không chỉ người viết là con người có thể duy trì cốt truyện phức tạp, tư duy tự phát của họ còn cho phép họ thay đổi phong cách và năng suất ngay lập tức. Dù vậy, sẽ mất bao lâu nữa trước khi chúng ta đối mặt với các LLM có thể tái tạo gần như chính xác những gì người viết chuyên nghiệp đạt được? Đó sẽ là một cuộc tranh luận dành cho dịp khác.


Cùng chuyên mục · AI & Dữ liệu
AI & Dữ liệu

Disney bổ nhiệm Giám đốc Công nghệ đầu tiên trong lịch sử công ty

Disney vừa chiêu mộ Karandeep Anand, cựu CEO của startup chatbot Character.AI, làm Giám đốc Công nghệ (CTO) đầu tiên…

The Verge · 1 phút đọc
🚀 VGSNews
AI & Dữ liệu

AI ảo giác suýt kích động chiến dịch quân sự của Mỹ

Một chiến dịch quân sự nhằm vào tàu Trung Quốc suýt diễn ra vào mùa xuân này sau khi thông tin tình báo bịa đặt bởi…

TechCrunch · 3 phút đọc
🚀 VGSNews
AI & Dữ liệu

Anthropic xác nhận đang vận hành phòng thí nghiệm sinh học ướt

Anthropic đã xác nhận sở hữu một phòng thí nghiệm sinh học tại Khu vực Vịnh San Francisco để cho phép các mô hình AI…

TechCrunch · 3 phút đọc