Derpy✔
Intern Writer
Sau nửa năm im hơi lặng tiếng, để GPT-6 và Claude 5 thống trị cuộc đua AI, Google chính thức trở lại với mô hình mới Gemini 4 Argon. Đây là mô hình độc quyền ngoài dòng Flash đầu tiên của hãng sau 7 tháng, và nhanh chóng vươn lên vị trí số một trên bảng xếp hạng Text Arena với 1.533 điểm, vượt qua Claude Opus 5.5. Theo chỉ số thông minh của Artificial Analysis, Argon đạt 53 điểm, ngang bằng GPT-6 Astra và vượt GPT-6.1 Sol.
Cuộc chiến giá cả
Điểm gây chú ý nhất là mức giá Google đưa ra, chỉ 1,99 USD cho mỗi tác vụ, bằng khoảng 60% chi phí của GPT-6 Astra. Cụ thể, phí xử lý 1 triệu token đầu vào là 2 USD, token đầu ra là 10 USD, cùng mức chiết khấu tới 95% cho dữ liệu trong bộ nhớ đệm. So sánh chi phí trung bình cho một tác vụ theo chỉ số thông minh, GPT-6.1 Sol ở mức 0,72 USD, Gemini 4 Argon 1,99 USD, GPT-6 Astra 3,26 USD, Claude Opus 5.5 5,98 USD và Claude Fable 5.1 7,63 USD. Với năng lực tương đương GPT-6 Astra nhưng giá chỉ bằng 60%, giới quan sát cho rằng Google đang tận dụng lợi thế hạ tầng TPU khổng lồ để phát động cuộc chiến giá, gây sức ép buộc OpenAI và Anthropic phải điều chỉnh giá bán.
Giới hạn đầu ra mở rộng, điểm benchmark cao
Argon nâng giới hạn đầu ra từ 64 nghìn token lên tới 1 triệu token mỗi lượt, mức cao chưa từng có, giúp mô hình có không gian xử lý đủ lớn để suy luận sâu và giải quyết các bài toán phức tạp trong một lần chạy duy nhất. Nhờ đó, Argon đạt kết quả cao trong nhiều bài kiểm tra chuẩn, như 77,9% trên DeepSWE v1.1 về năng lực kỹ thuật phần mềm, dẫn đầu Vals Index với 68,9%, dẫn đầu AutomationBench với 51,3%, đạt 91,7% trên LVBench về hiểu video dài, và đứng đầu Blueprint-Bench 2 về hiểu dữ liệu 3D.

Những ứng dụng nội bộ đáng chú ý tại Google
Trước khi phát hành rộng rãi, hàng nghìn nhân viên Google đã sử dụng Argon trong công việc hằng ngày và ghi nhận ba thành tựu đáng chú ý. Thứ nhất, các tác nhân AI do Argon vận hành đã tự động phát hiện và đề xuất tối ưu hóa, giúp giải phóng hơn 300 TiB bộ nhớ hệ thống, dự kiến có thể đạt từ 500 TiB đến 1 PiB, tiết kiệm hàng chục triệu USD tiền điện và máy chủ. Thứ hai, Argon đã hỗ trợ viết lại hơn 800.000 dòng mã kernel hệ thống lõi, bao gồm cả kernel Fuchsia Zircon, chuyển từ C/C++ sang ngôn ngữ Rust an toàn bộ nhớ hơn, dưới sự kiểm tra và rà soát nghiêm ngặt của con người. Thứ ba, Argon viết lại thành công đoạn mã xử lý video cấp thấp dài 32.000 dòng trong dự án mã nguồn mở libgav1, giúp tăng tốc độ giải mã video lên 2,7 lần mà vẫn giữ nguyên chất lượng hình ảnh.
Năng lực an ninh mạng và cách triển khai thận trọng
Argon cũng được giới thiệu như một công cụ phát hiện và vá lỗ hổng bảo mật tự động, đạt 68% điểm trong bài đánh giá CWE-bench v1, đồng hạng nhất ngành. Trong một thử nghiệm với công ty bảo mật đám mây Wiz, Argon đã phát hiện một lỗ hổng nghiêm trọng trong phần mềm y tế dùng tại nhiều bệnh viện, điều mà các mô hình thế hệ trước bỏ sót.
Nhận thức được rủi ro từ năng lực này, Google áp dụng chiến lược phát hành theo từng lớp, gồm phiên bản không giới hạn chỉ cấp cho một số tổ chức an ninh mạng tin cậy qua chương trình nội bộ Fairwind, phiên bản API hạn chế đang được chính phủ Mỹ xem xét tự nguyện trước khi phát hành, và phiên bản công khai sẽ mở rộng dần cho nhà phát triển trả phí cùng người dùng gói AI Ultra. Google cũng áp dụng các biện pháp giám sát như cách ly môi trường huấn luyện rủi ro cao và theo dõi chuỗi suy luận của mô hình theo thời gian thực để kịp thời ngắt nếu phát hiện dấu hiệu đi chệch mục đích sử dụng.
Áp lực nội bộ trước khi Argon ra đời
Theo Bloomberg, quá trình phát triển Argon trải qua giai đoạn khó khăn kéo dài nhiều tháng tại Google. Dự án Gemini 3.5 Pro, từng được giới thiệu tại hội nghị I/O hồi tháng 5, đã bị hủy bỏ dù chi phí huấn luyện ước tính lên tới 400 triệu USD. Nội bộ công ty cũng tồn tại tranh cãi về chất lượng mô hình, khi một số nhân viên cho rằng khả năng lập trình của Argon chưa đồng đều, đặc biệt yếu ở mảng thiết kế giao diện người dùng. Chuyên gia AI Edwin Chen nhận định đây là biểu hiện của hiện tượng chạy đua điểm chuẩn, khi các kỹ sư tập trung tối ưu điểm số thay vì phát triển ứng dụng thực tế hữu ích.
Giai đoạn này cũng chứng kiến làn sóng nhân sự cấp cao rời đi, gồm Jeff Dean, nhà khoa học đoạt giải Nobel John Jumper và nhà phát minh Noam Shazeer. Tháng 8 vừa qua, Demis Hassabis được thăng chức Chủ tịch, giao quyền điều hành DeepMind cho cấp phó Koray Kavukcuoglu, người sau đó đã lên tiếng trấn an đội ngũ về năng lực cạnh tranh của công ty.
Cục diện ba bên trong ngành AI
Sự ra mắt của Gemini 4 Argon chưa đủ để Google vượt trội hoàn toàn so với đối thủ, nhưng đã giúp hãng trở lại nhóm dẫn đầu, tạo thế cân bằng giữa ba công ty. Google được đánh giá mạnh về xử lý ngữ cảnh siêu dài, an ninh mạng và đa phương tiện. OpenAI với GPT-6 Astra vẫn giữ vị trí dẫn đầu ở các tác vụ khoa học, toán học và lập trình tác nhân. Trong khi đó, dòng Claude của Anthropic tiếp tục được giới lập trình viên ưa chuộng, với Claude Fable 5.1 dẫn đầu trong bài kiểm tra Terminal-Bench 4.0 dành cho tác nhân lập trình.
Nhìn chung, hiện chưa có công ty nào chiếm ưu thế tuyệt đối trong cuộc đua AI, chỉ có sự thay đổi vị trí dẫn đầu theo từng giai đoạn, trong khi chiến lược giá của Google nhiều khả năng sẽ tiếp tục gây sức ép lên các đối thủ trong thời gian tới.
Cuộc chiến giá cả
Điểm gây chú ý nhất là mức giá Google đưa ra, chỉ 1,99 USD cho mỗi tác vụ, bằng khoảng 60% chi phí của GPT-6 Astra. Cụ thể, phí xử lý 1 triệu token đầu vào là 2 USD, token đầu ra là 10 USD, cùng mức chiết khấu tới 95% cho dữ liệu trong bộ nhớ đệm. So sánh chi phí trung bình cho một tác vụ theo chỉ số thông minh, GPT-6.1 Sol ở mức 0,72 USD, Gemini 4 Argon 1,99 USD, GPT-6 Astra 3,26 USD, Claude Opus 5.5 5,98 USD và Claude Fable 5.1 7,63 USD. Với năng lực tương đương GPT-6 Astra nhưng giá chỉ bằng 60%, giới quan sát cho rằng Google đang tận dụng lợi thế hạ tầng TPU khổng lồ để phát động cuộc chiến giá, gây sức ép buộc OpenAI và Anthropic phải điều chỉnh giá bán.
Giới hạn đầu ra mở rộng, điểm benchmark cao
Argon nâng giới hạn đầu ra từ 64 nghìn token lên tới 1 triệu token mỗi lượt, mức cao chưa từng có, giúp mô hình có không gian xử lý đủ lớn để suy luận sâu và giải quyết các bài toán phức tạp trong một lần chạy duy nhất. Nhờ đó, Argon đạt kết quả cao trong nhiều bài kiểm tra chuẩn, như 77,9% trên DeepSWE v1.1 về năng lực kỹ thuật phần mềm, dẫn đầu Vals Index với 68,9%, dẫn đầu AutomationBench với 51,3%, đạt 91,7% trên LVBench về hiểu video dài, và đứng đầu Blueprint-Bench 2 về hiểu dữ liệu 3D.

Những ứng dụng nội bộ đáng chú ý tại Google
Trước khi phát hành rộng rãi, hàng nghìn nhân viên Google đã sử dụng Argon trong công việc hằng ngày và ghi nhận ba thành tựu đáng chú ý. Thứ nhất, các tác nhân AI do Argon vận hành đã tự động phát hiện và đề xuất tối ưu hóa, giúp giải phóng hơn 300 TiB bộ nhớ hệ thống, dự kiến có thể đạt từ 500 TiB đến 1 PiB, tiết kiệm hàng chục triệu USD tiền điện và máy chủ. Thứ hai, Argon đã hỗ trợ viết lại hơn 800.000 dòng mã kernel hệ thống lõi, bao gồm cả kernel Fuchsia Zircon, chuyển từ C/C++ sang ngôn ngữ Rust an toàn bộ nhớ hơn, dưới sự kiểm tra và rà soát nghiêm ngặt của con người. Thứ ba, Argon viết lại thành công đoạn mã xử lý video cấp thấp dài 32.000 dòng trong dự án mã nguồn mở libgav1, giúp tăng tốc độ giải mã video lên 2,7 lần mà vẫn giữ nguyên chất lượng hình ảnh.
Năng lực an ninh mạng và cách triển khai thận trọng
Argon cũng được giới thiệu như một công cụ phát hiện và vá lỗ hổng bảo mật tự động, đạt 68% điểm trong bài đánh giá CWE-bench v1, đồng hạng nhất ngành. Trong một thử nghiệm với công ty bảo mật đám mây Wiz, Argon đã phát hiện một lỗ hổng nghiêm trọng trong phần mềm y tế dùng tại nhiều bệnh viện, điều mà các mô hình thế hệ trước bỏ sót.
Nhận thức được rủi ro từ năng lực này, Google áp dụng chiến lược phát hành theo từng lớp, gồm phiên bản không giới hạn chỉ cấp cho một số tổ chức an ninh mạng tin cậy qua chương trình nội bộ Fairwind, phiên bản API hạn chế đang được chính phủ Mỹ xem xét tự nguyện trước khi phát hành, và phiên bản công khai sẽ mở rộng dần cho nhà phát triển trả phí cùng người dùng gói AI Ultra. Google cũng áp dụng các biện pháp giám sát như cách ly môi trường huấn luyện rủi ro cao và theo dõi chuỗi suy luận của mô hình theo thời gian thực để kịp thời ngắt nếu phát hiện dấu hiệu đi chệch mục đích sử dụng.
Áp lực nội bộ trước khi Argon ra đời
Theo Bloomberg, quá trình phát triển Argon trải qua giai đoạn khó khăn kéo dài nhiều tháng tại Google. Dự án Gemini 3.5 Pro, từng được giới thiệu tại hội nghị I/O hồi tháng 5, đã bị hủy bỏ dù chi phí huấn luyện ước tính lên tới 400 triệu USD. Nội bộ công ty cũng tồn tại tranh cãi về chất lượng mô hình, khi một số nhân viên cho rằng khả năng lập trình của Argon chưa đồng đều, đặc biệt yếu ở mảng thiết kế giao diện người dùng. Chuyên gia AI Edwin Chen nhận định đây là biểu hiện của hiện tượng chạy đua điểm chuẩn, khi các kỹ sư tập trung tối ưu điểm số thay vì phát triển ứng dụng thực tế hữu ích.
Giai đoạn này cũng chứng kiến làn sóng nhân sự cấp cao rời đi, gồm Jeff Dean, nhà khoa học đoạt giải Nobel John Jumper và nhà phát minh Noam Shazeer. Tháng 8 vừa qua, Demis Hassabis được thăng chức Chủ tịch, giao quyền điều hành DeepMind cho cấp phó Koray Kavukcuoglu, người sau đó đã lên tiếng trấn an đội ngũ về năng lực cạnh tranh của công ty.
Cục diện ba bên trong ngành AI
Sự ra mắt của Gemini 4 Argon chưa đủ để Google vượt trội hoàn toàn so với đối thủ, nhưng đã giúp hãng trở lại nhóm dẫn đầu, tạo thế cân bằng giữa ba công ty. Google được đánh giá mạnh về xử lý ngữ cảnh siêu dài, an ninh mạng và đa phương tiện. OpenAI với GPT-6 Astra vẫn giữ vị trí dẫn đầu ở các tác vụ khoa học, toán học và lập trình tác nhân. Trong khi đó, dòng Claude của Anthropic tiếp tục được giới lập trình viên ưa chuộng, với Claude Fable 5.1 dẫn đầu trong bài kiểm tra Terminal-Bench 4.0 dành cho tác nhân lập trình.
Nhìn chung, hiện chưa có công ty nào chiếm ưu thế tuyệt đối trong cuộc đua AI, chỉ có sự thay đổi vị trí dẫn đầu theo từng giai đoạn, trong khi chiến lược giá của Google nhiều khả năng sẽ tiếp tục gây sức ép lên các đối thủ trong thời gian tới.