Google ra mắt Gemini 4 Argon: Vượt mặt GPT-6 Astra trên nhiều benchmark AI
Google vừa chính thức phát hành Gemini 4 Argon, mẫu AI mới nhất đang dẫn đầu hàng loạt bảng xếp hạng benchmark lớn. Model này gây ấn tượng với khả năng tương đương GPT-6 Astra, tỷ lệ ảo giác thấp và đang được chính phủ Mỹ kiểm tra trước khi phát hành rộng rãi.

Hãy nói về một chiến thắng của kẻ yếu thế. Google vừa phát hành mô hình mới nhất mang tên Gemini 4 Argon, và nó đang phá đảo các bảng xếp hạng benchmark AI, mặc dù việc phát hành rộng rãi vẫn còn bỏ ngỏ khi mô hình này đang được chính phủ Mỹ thử nghiệm.
Gemini 4 Argon của Google đã giành vị trí dẫn đầu trên DeepSWE v1.1 với số điểm 77.9 phần trăm, vượt qua Claude Opus 5.5 và Fable 5.1 của Anthropic cũng như GPT-6 Astra của OpenAI.
Chúng tôi đã đưa tin về một tin đồn thú vị hồi đầu tháng 9, cho rằng DeepMind của Google có thể đã đạt được RSI - nơi một hệ thống AI được sử dụng để giúp xây dựng, viết mã hoặc huấn luyện phiên bản tiếp theo của chính nó, qua đó mở ra quy mô kinh tế khổng lồ trong quá trình này.
Chỉ hơn hai tuần sau, Google dường như đang xác thực tin đồn cụ thể đó với Gemini 4 Argon mới, hiện đang là nhà vô địch thống trị trên 14 trong số 19 benchmark được sử dụng phổ biến nhất để đánh giá các mô hình AI.
Artificial Analysis đã tóm tắt một số kết quả benchmark này bằng những lời sau:
"Vốn là điểm yếu của các mô hình Gemini trước đây, Gemini 4 Argon cho thấy những cải tiến rõ rệt trong các đánh giá mang tính tác nhân (agentic). Nó xếp thứ #1 trên AutomationBench-AA ở mức 77.5 phần trăm, cao hơn 6 điểm so với Claude Sonnet 5.5 (tối đa, 71.3 phần trăm). Trên Terminal Bench 4, Gemini 4 Argon đạt 57 phần trăm, cải thiện +53 điểm so với Gemini 3.1 Pro Preview, chỉ đứng sau Claude Sonnet 5.5 (tối đa, 64 phần trăm), Claude Opus 5.5 (tối đa, 60 phần trăm) và GPT-6 Astra (59 phần trăm). Trên AA-Briefcase, nó đạt 1494 Elo. Điều này có được nhờ tỷ lệ vượt qua tiêu chí đánh giá là 65 phần trăm, mức cao nhất mà chúng tôi từng ghi nhận, dẫu cho Chất lượng Phân tích (1576 Elo) và Chất lượng Trình bày (1308 Elo) thấp hơn."
Hơn nữa, Gemini 4 Argon - mẫu mô hình không thuộc dòng Flash đầu tiên của Google trong khoảng 7 tháng qua - đã đạt số điểm 53 trên Chỉ số Thông minh của Artificial Analysis (Artificial Analysis Intelligence Index), ngang bằng với GPT-6 Astra (tối đa) và cao hơn 1 điểm so với GPT-6.1 Sol.
Artificial Analysis cho biết thêm:
"Gemini 4 Argon có giá 1.99 USD cho mỗi tác vụ thuộc Chỉ số Thông minh, bằng 60 phần trăm của GPT-6 Astra (tối đa), nhưng gấp 2.7 lần GPT-6.1 Sol (tối đa). Sau khi chương trình giảm giá kết thúc, mức giá này sẽ tăng lên 3.98 USD (~1.2 lần GPT-6 Astra (tối đa))."
Ngoài ra, trong bài kiểm tra benchmark AA-Omniscience, Gemini 4 Argon của Google đã thể hiện tỷ lệ ảo giác (hallucination) là 15 phần trăm, mức thấp nhất trong số bất kỳ mô hình nào đạt trên 45 điểm trên Chỉ số Thông minh. Để so sánh, tỷ lệ ảo giác của GPT-6 Astra (tối đa) là 51 phần trăm và của GPT-6.1 Sol (tối đa) là 54 phần trăm.
Bên cạnh đó, mô hình này vẫn duy trì cửa sổ ngữ cảnh (context window) 1 triệu token, và hiện đang được bán với mức giảm giá 50 phần trăm, tương đương 2 USD cho mỗi 1 triệu token đầu vào và 10 USD cho mỗi 1 triệu token đầu ra.
Đáng chú ý, trên chỉ số Vals RSI, Gemini 4 Argon của Google hiện xếp ở vị trí thứ tư, chỉ đứng sau Claude Opus 5.5, Fable 5.1 và Opus 5.0 của Anthropic, đồng thời xếp trên GPT-6 Astra của OpenAI.
Ở một diễn biến khác, Bloomberg vừa công bố một báo cáo không mấy khởi sắc về Gemini 4 Argon, với một nhân viên của Google tuyên bố rằng "mô hình này gặp khó khăn trong việc xử lý một số tác vụ lập trình nhất định."
⚡ GOOGLE RA MẮT GEMINI 4 ARGON: VƯỢT MẶT GPT-6 ASTRA TRÊN NHIỀU BENCHMARK AI Hãy nói về một chiến thắng của kẻ yếu thế. Google vừa phát hành mô hình mới nhất mang tên Gemini 4 Argon, và nó đang phá đảo các bảng xếp hạng benchmark AI, mặc dù việc phát hành rộng rãi vẫn còn bỏ ngỏ khi mô hình này đang được chính phủ Mỹ thử nghiệm. Gemini 4 Argon của Google đã giành vị trí dẫn đầu trên DeepSWE v1.1 với số điểm 77.9 phần trăm, vượt qua Claude Opus 5.5 và Fable 5.1 của Anthropic cũng như GPT-6 Astra của OpenAI. Chúng tôi đã đưa tin về một tin đồn thú vị hồi đầu tháng 9, cho rằng DeepMind của Google có thể đã đạt được RSI - nơi một hệ thống AI được sử dụng để giúp xây dựng, viết mã hoặc huấn luyện phiên bản tiếp theo của chính nó, qua đó mở ra quy mô kinh tế khổng lồ trong quá trình này. Chỉ hơn hai tuần sau, Google dường như đang xác thực tin đồn cụ thể đó với Gemini 4 Argon mới, hiện đang là nhà vô địch thống trị trên 14 trong số 19 benchmark được sử dụng phổ biến nhất để đánh giá các mô hình AI. Artificial Analysis đã tóm tắt một số kết quả benchmark này bằng những lời sau: "Vốn là điểm yếu của các mô hình Gemini trước đây, Gemini 4 Argon cho thấy những cải tiến rõ rệt trong các đánh giá mang tính tác nhân (agentic). Nó xếp thứ #1 trên AutomationBench-AA ở mức 77.5 phần trăm, cao hơn 6 điểm so với Claude Sonnet 5.5 (tối đa, 71.3 phần trăm). Trên Terminal Bench 4, Gemini 4 Argon đạt 57 phần trăm, cải thiện +53 điểm so với Gemini 3.1 Pro Preview, chỉ đứng sau Claude Sonnet 5.5 (tối đa, 64 phần trăm), Claude Opus 5.5 (tối đa, 60 phần trăm) và GPT-6 Astra (59 phần trăm). Trên AA-Briefcase, nó đạt 1494 Elo. Điều này có được nhờ tỷ lệ vượt qua tiêu chí đánh giá là 65 phần trăm, mức cao nhất mà chúng tôi từng ghi nhận, dẫu cho Chất lượng Phân tích (1576 Elo) và Chất lượng Trình bày (1308 Elo) thấp hơn." Hơn nữa, Gemini 4 Argon - mẫu mô hình không thuộc dòng Flash đầu tiên của Google trong khoảng 7 tháng qua - đã đạt số điểm 53 trên Chỉ số Thông minh của Artificial Analysis (Artificial Analysis Intelligence Index), ngang bằng với GPT-6 Astra (tối đa) và cao hơn 1 điểm so với GPT-6.1 Sol. Artificial Analysis cho biết thêm: "Gemini 4 Argon có giá 1.99 USD cho mỗi tác vụ thuộc Chỉ số Thông minh, bằng 60 phần trăm của GPT-6 Astra (tối đa), nhưng gấp 2.7 lần GPT-6.1 Sol (tối đa). Sau khi chương trình giảm giá kết thúc, mức giá này sẽ tăng lên 3.98 USD (~1.2 lần GPT-6 Astra (tối đa))." Ngoài ra, trong bài kiểm tra benchmark AA-Omniscience, Gemini 4 Argon của Google đã thể hiện tỷ lệ ảo giác (hallucination) là 15 phần trăm, mức thấp nhất trong số bất kỳ mô hình nào đạt trên 45 điểm trên Chỉ số Thông minh. Để so sánh, tỷ lệ ảo giác của GPT-6 Astra (tối đa) là 51 phần trăm và của GPT-6.1 Sol (tối đa) là 54 phần trăm. Bên cạnh đó, mô hình này vẫn duy trì cửa sổ ngữ cảnh (context window) 1 triệu token, và hiện đang được bán với mức giảm giá 50 phần trăm, tương đương 2 USD cho mỗi 1 triệu token đầu vào và 10 USD cho mỗi 1 triệu token đầu ra. Đáng chú ý, trên chỉ số Vals RSI, Gemini 4 Argon của Google hiện xếp ở vị trí thứ tư, chỉ đứng sau Claude Opus 5.5, Fable 5.1 và Opus 5.0 của Anthropic, đồng thời xếp trên GPT-6 Astra của OpenAI. Ở một diễn biến khác, Bloomberg vừa công bố một báo cáo không mấy khởi sắc về Gemini 4 Argon, với một nhân viên của Google tuyên bố rằng "mô hình này gặp khó khăn trong việc xử lý một số tác vụ lập trình nhất định." 🗞 Nguồn: Wccftech #vgsnews #vgs #tintuc
Nguồn: Wccftech