OpenAI vừa tạo ra bước ngoặt mới trên thị trường khi thiết lập tỷ lệ hiệu năng trên chi phí chưa từng có với bộ đôi mô hình GPT-6 Sol và GPT-6 Luna. Trong đó, mức phí API của phiên bản GPT-6 Luna thậm chí còn thấp hơn giải pháp từ DeepSeek V4.1 Flash, cái tên vốn được xem là chuẩn mực về tối ưu chi phí trong giai đoạn qua.

Động thái phát hành mô hình mới liên tiếp từ cả Anthropic lẫn OpenAI trong cùng một ngày, chỉ ít ngày sau các đợt ra mắt trước đó, cho thấy những lời kêu gọi làm chậm tốc độ phát triển trí tuệ nhân tạo dường như đã bị gạt sang một bên. Cuộc đua nâng cấp công nghệ và giành thị phần giữa các hãng công nghệ lớn vẫn đang tăng tốc rõ rệt.

Khi đặt cạnh các giải pháp cạnh tranh, GPT-6 Sol có giá đầu vào lẫn đầu ra thấp hơn 50% so với Claude 5.5 Opus của Anthropic. Trong khi đó, GPT-6 Luna có mức phí rẻ hơn cả mức giá API giờ thấp điểm của DeepSeek V4.1 Flash, vốn đang niêm yết 0,15 USD cho mỗi 1 triệu token đầu vào và 0,60 USD cho mỗi 1 triệu token đầu ra. Dù vậy, DeepSeek V4.1 Flash vẫn duy trì lợi thế về điểm số kỹ thuật với 74,2 điểm trên bài kiểm tra DeepSWE v1.1, cao hơn mức khoảng 67 điểm của GPT-6 Luna.
OpenAI cho biết GPT-6 Sol áp dụng các phương pháp huấn luyện tương tự như GPT-6 Astra, giúp cải thiện khả năng suy luận, độ tin cậy về dữ liệu thực tế, kỹ năng lập trình, tương tác máy tính và mức độ tương thích an toàn.
Mặc dù vậy, Claude Opus 5.5 của Anthropic hiện vẫn dẫn đầu bảng xếp hạng Artificial Analysis Intelligence Index với 58 điểm, trong khi GPT-6 Sol chỉ đạt 48 điểm, kết quả được đánh giá là chưa đạt kỳ vọng của thị trường.
Về năng lực lập trình, GPT-6 Sol ghi nhận bước tiến bộ, nhưng GPT-6 Luna lại thụt lùi nhẹ so với GPT-5.6 Luna. Ở khía cạnh kiểm soát ảo giác theo chỉ số AA-Omniscience Index, tỷ lệ sai lệch của GPT-6 Sol bản tối đa đã giảm từ 92% xuống 60%, còn GPT-6 Luna bản tối đa giảm từ 93% xuống 77%. Tuy nhiên, Sol đạt được mức giảm này chủ yếu nhờ xu hướng từ chối trả lời thường xuyên hơn, giúp giảm khoảng một phần tư số câu trả lời sai nhưng đồng thời kéo độ chính xác chung giảm 5 điểm xuống còn 54%. Với Luna, độ chính xác gần như giữ nguyên ở mức 44% trong khi tần suất đưa ra câu trả lời cũng giảm xuống.
Ở các bài kiểm tra chuyên sâu khác, cả GPT-6 Sol lẫn GPT-6 Luna đều cho thấy sự suy giảm trên bộ đánh giá GDPval-AA v2.1 ở mức vận hành tối đa. Nguyên nhân chủ yếu xuất phát từ việc mô hình tạo ra các phản hồi ngắn hơn và thường xuyên bỏ sót các yếu tố được yêu cầu. Ngoài ra, GPT-6 Sol thể hiện kém hơn GPT-5.6 Sol ở các tác vụ DeepSWE, tương tác máy tính và gỡ lỗi nghiên cứu, dù năng lực trong lĩnh vực an ninh mạng vẫn tương đương thế hệ trước.
Động thái hạ giá trở nên đặc biệt quan trọng trong bối cảnh Claude Opus 5.5 ở mức thiết lập trung bình vẫn vượt qua GPT-6 Astra ở mức tối đa trên bài đo OSWorld 2.0 Offline, nhưng chi phí trên mỗi tác vụ của Opus 5.5 chỉ bằng một phần năm. Mức giá API mới của OpenAI không chỉ nhằm cân bằng ưu thế cạnh tranh với đối thủ nguồn đóng mà còn đặt ra thách thức lớn đối với tính kinh tế của các mô hình nguồn mở trọng số mở trên thị trường.

Động thái phát hành mô hình mới liên tiếp từ cả Anthropic lẫn OpenAI trong cùng một ngày, chỉ ít ngày sau các đợt ra mắt trước đó, cho thấy những lời kêu gọi làm chậm tốc độ phát triển trí tuệ nhân tạo dường như đã bị gạt sang một bên. Cuộc đua nâng cấp công nghệ và giành thị phần giữa các hãng công nghệ lớn vẫn đang tăng tốc rõ rệt.
Mức giá gây sức ép trực tiếp lên các đối thủ
Về biểu phí, GPT-6 Sol hiện có giá 2 USD cho mỗi 1 triệu token đầu vào, trong khi GPT-6 Luna chỉ tốn 0,10 USD cho 1 triệu token đầu vào. Cả hai mô hình này đều có chi phí rẻ hơn 50% so với thế hệ GPT-5.6 tiền nhiệm.
Khi đặt cạnh các giải pháp cạnh tranh, GPT-6 Sol có giá đầu vào lẫn đầu ra thấp hơn 50% so với Claude 5.5 Opus của Anthropic. Trong khi đó, GPT-6 Luna có mức phí rẻ hơn cả mức giá API giờ thấp điểm của DeepSeek V4.1 Flash, vốn đang niêm yết 0,15 USD cho mỗi 1 triệu token đầu vào và 0,60 USD cho mỗi 1 triệu token đầu ra. Dù vậy, DeepSeek V4.1 Flash vẫn duy trì lợi thế về điểm số kỹ thuật với 74,2 điểm trên bài kiểm tra DeepSWE v1.1, cao hơn mức khoảng 67 điểm của GPT-6 Luna.
OpenAI cho biết GPT-6 Sol áp dụng các phương pháp huấn luyện tương tự như GPT-6 Astra, giúp cải thiện khả năng suy luận, độ tin cậy về dữ liệu thực tế, kỹ năng lập trình, tương tác máy tính và mức độ tương thích an toàn.
Đánh giá hiệu năng và những điểm đánh đổi thực tế
Dữ liệu do đơn vị nghiên cứu Artificial Analysis công bố chỉ ra rằng chi phí vận hành thực tế của các mô hình mới đã giảm mạnh. Trên thang đo Artificial Analysis Intelligence Index, GPT-6 Sol bản tối đa tốn 1,06 USD cho mỗi tác vụ tiêu chuẩn, giảm gần 50% so với mốc 1,99 USD của GPT-5.6 Sol bản tối đa. Tương tự, GPT-6 Luna bản tối đa tiêu tốn 0,07 USD cho mỗi tác vụ, thấp hơn khoảng 60% so với mức 0,18 USD của GPT-5.6 Luna.Mặc dù vậy, Claude Opus 5.5 của Anthropic hiện vẫn dẫn đầu bảng xếp hạng Artificial Analysis Intelligence Index với 58 điểm, trong khi GPT-6 Sol chỉ đạt 48 điểm, kết quả được đánh giá là chưa đạt kỳ vọng của thị trường.
Về năng lực lập trình, GPT-6 Sol ghi nhận bước tiến bộ, nhưng GPT-6 Luna lại thụt lùi nhẹ so với GPT-5.6 Luna. Ở khía cạnh kiểm soát ảo giác theo chỉ số AA-Omniscience Index, tỷ lệ sai lệch của GPT-6 Sol bản tối đa đã giảm từ 92% xuống 60%, còn GPT-6 Luna bản tối đa giảm từ 93% xuống 77%. Tuy nhiên, Sol đạt được mức giảm này chủ yếu nhờ xu hướng từ chối trả lời thường xuyên hơn, giúp giảm khoảng một phần tư số câu trả lời sai nhưng đồng thời kéo độ chính xác chung giảm 5 điểm xuống còn 54%. Với Luna, độ chính xác gần như giữ nguyên ở mức 44% trong khi tần suất đưa ra câu trả lời cũng giảm xuống.
Ở các bài kiểm tra chuyên sâu khác, cả GPT-6 Sol lẫn GPT-6 Luna đều cho thấy sự suy giảm trên bộ đánh giá GDPval-AA v2.1 ở mức vận hành tối đa. Nguyên nhân chủ yếu xuất phát từ việc mô hình tạo ra các phản hồi ngắn hơn và thường xuyên bỏ sót các yếu tố được yêu cầu. Ngoài ra, GPT-6 Sol thể hiện kém hơn GPT-5.6 Sol ở các tác vụ DeepSWE, tương tác máy tính và gỡ lỗi nghiên cứu, dù năng lực trong lĩnh vực an ninh mạng vẫn tương đương thế hệ trước.
Cạnh tranh trong môi trường đa tác tử
Trước đó, Anthropic đã giới thiệu Claude Opus 5.5 với khả năng vận hành đồng thời khoảng 100 tác tử độc lập. GPT-6 Astra của OpenAI cũng sở hữu năng lực tương đương, và việc định giá GPT-6 Sol cùng Luna ở mức thấp được xem là nỗ lực nhằm củng cố hệ sinh thái đa tác tử xoay quanh Astra. Mức giá này giúp người dùng kết hợp linh hoạt các mô hình phụ trợ với chi phí tối ưu hơn.Động thái hạ giá trở nên đặc biệt quan trọng trong bối cảnh Claude Opus 5.5 ở mức thiết lập trung bình vẫn vượt qua GPT-6 Astra ở mức tối đa trên bài đo OSWorld 2.0 Offline, nhưng chi phí trên mỗi tác vụ của Opus 5.5 chỉ bằng một phần năm. Mức giá API mới của OpenAI không chỉ nhằm cân bằng ưu thế cạnh tranh với đối thủ nguồn đóng mà còn đặt ra thách thức lớn đối với tính kinh tế của các mô hình nguồn mở trọng số mở trên thị trường.