Mạnh Quân✔
Writer
Một xu hướng đáng chú ý đang diễn ra trong thế giới trí tuệ nhân tạo: AI đang trở thành đối tượng sử dụng AI nhiều hơn cả con người.
Theo dữ liệu từ OpenRouter, ngày 6/2/2026 đánh dấu thời điểm lượng token được sử dụng bởi con người và các AI Agent trên nền tảng này lần đầu tiên ngang nhau. Nhưng chỉ sau khoảng 6 tháng, khoảng cách đã thay đổi chóng mặt.
Tính đến ngày 10/8, lượng token thuộc nhóm Agentic đã tăng từ khoảng 0,51 nghìn tỷ lên 7,3 nghìn tỷ token, tương đương mức tăng hơn 14 lần. Trong khi đó, lượng token của nhóm người dùng trực tiếp tăng lên khoảng 1,4 nghìn tỷ, tức chỉ tăng khoảng 2,8 lần. Như vậy, AI Agent hiện tiêu thụ lượng token cao hơn con người khoảng 5,2 lần trên OpenRouter.

Vì sao AI Agent lại “ngốn” token đến vậy?
Sự khác biệt nằm ở cách con người và AI Agent làm việc.
Khi sử dụng chatbot thông thường, bạn nhập câu hỏi, chờ AI trả lời, đọc kết quả rồi mới đặt câu hỏi tiếp theo. Giữa các lượt luôn có khoảng thời gian để con người đọc, suy nghĩ và nhập nội dung.
AI Agent thì khác. Sau khi được giao một mục tiêu, nó có thể liên tục đọc file, gọi công cụ, phân tích kết quả, ghi dữ liệu, kiểm tra lại, sửa lỗi rồi tiếp tục thực hiện bước tiếp theo cho đến khi hoàn thành nhiệm vụ.
Ví dụ, bạn chỉ đưa ra một yêu cầu: “Hãy kiểm tra dự án này, tìm lỗi và sửa toàn bộ code.” Phía người dùng chỉ có một prompt. Nhưng phía sau, Agent có thể thực hiện hàng chục lượt gọi mô hình và công cụ. Vì vậy, thống kê token không đơn giản phản ánh có bao nhiêu người đang dùng AI mà còn cho thấy khối lượng công việc AI đang tự thực hiện thay con người.
Một yêu cầu của con người có thể kích hoạt hàng chục tác vụ AI
Đây cũng là lý do các công cụ AI Agent như trợ lý lập trình có thể tiêu tốn lượng token lớn hơn chatbot truyền thống.
Trước đây, một hệ thống hỗ trợ khách hàng có thể nhận câu hỏi rồi trả lời trực tiếp. Với Agent, cùng câu hỏi đó có thể khiến AI kiểm tra đơn hàng, truy vấn hồ sơ, đối chiếu dữ liệu, cập nhật tồn kho rồi trải qua nhiều vòng xử lý trước khi đưa ra một câu trả lời cuối cùng.
Theo ước tính được dẫn trong tài liệu, Goldman Sachs cho rằng AI Agent có thể khiến mức tiêu thụ token tăng tới 24 lần vào năm 2030.
Token tăng mạnh nhưng chi phí không tăng theo tỷ lệ tương ứng
Con số 7,3 nghìn tỷ token nghe rất lớn, nhưng không có nghĩa chi phí cũng tăng đúng 14 lần.
Nguyên nhân là AI Agent thường làm việc nhiều vòng trên cùng một lượng thông tin. Theo dữ liệu được đề cập, trung bình gần 70% token trong các yêu cầu Agent đến từ nội dung đã được cache. Những token này thường có chi phí thấp hơn token đầu vào mới. Agent có thể đọc một lượng lớn code, tài liệu, hướng dẫn và danh sách công cụ ở lần đầu. Những vòng tiếp theo tiếp tục sử dụng lại phần lớn context đó thay vì xử lý mọi thứ hoàn toàn từ đầu.
Dù vậy, mức tăng sử dụng quá nhanh vẫn tạo áp lực đáng kể lên chi phí và hạ tầng tính toán.
Một điểm đáng chú ý khác là cùng một model có thể tiêu thụ lượng token hoàn toàn khác nhau tùy cách sử dụng. Nếu sử dụng AI giống một công cụ tìm kiếm, một người có thể chỉ tiêu thụ vài nghìn token mỗi ngày. Nhưng khi kết nối cùng model đó với file, dữ liệu, công cụ và một workflow tự động chạy liên tục, lượng sử dụng có thể lên tới hàng chục triệu token mỗi ngày.
Điều này cho thấy sự thay đổi lớn của AI đang không chỉ đến từ việc các model ngày càng thông minh hơn. Quan trọng hơn là chúng đang chuyển từ: Con người hỏi → AI trả lời sang: Con người giao mục tiêu → AI tự thực hiện hàng loạt công việc để đạt mục tiêu.
AI làm được nhiều hơn, nhưng ai sẽ kiểm tra?

Sự bùng nổ AI Agent cũng tạo ra một vấn đề mới. Nếu lượng công việc AI thực hiện tăng gấp nhiều lần, khả năng của con người trong việc kiểm tra và phê duyệt kết quả lại không thể tăng với tốc độ tương tự. Đơn cử một AI assistant đã xóa 18 video khỏi một tài khoản quảng cáo và sự việc chỉ được phát hiện một ngày sau. Vấn đề không nhất thiết nằm ở một lỗi nghiêm trọng của model, mà ở chỗ không có người theo dõi bước hành động đó kịp thời.
Vì vậy, khi AI Agent ngày càng đảm nhiệm nhiều công việc, thứ trở nên khan hiếm có thể không còn là khả năng tạo nội dung, phân tích hay viết code. Khả năng kiểm chứng, đánh giá và đưa ra quyết định cuối cùng của con người mới có thể trở thành nút thắt quan trọng.
Nói cách khác, câu hỏi trong tương lai có thể không còn là “Bạn có sử dụng AI hay không?”, mà là: “AI đang làm những gì thay bạn, và ai chịu trách nhiệm kiểm tra những gì nó đã làm?”
Tài liệu tham khảo:
the-decoder.com
www.a16z.news
www.ey.com
Theo dữ liệu từ OpenRouter, ngày 6/2/2026 đánh dấu thời điểm lượng token được sử dụng bởi con người và các AI Agent trên nền tảng này lần đầu tiên ngang nhau. Nhưng chỉ sau khoảng 6 tháng, khoảng cách đã thay đổi chóng mặt.
Tính đến ngày 10/8, lượng token thuộc nhóm Agentic đã tăng từ khoảng 0,51 nghìn tỷ lên 7,3 nghìn tỷ token, tương đương mức tăng hơn 14 lần. Trong khi đó, lượng token của nhóm người dùng trực tiếp tăng lên khoảng 1,4 nghìn tỷ, tức chỉ tăng khoảng 2,8 lần. Như vậy, AI Agent hiện tiêu thụ lượng token cao hơn con người khoảng 5,2 lần trên OpenRouter.

Vì sao AI Agent lại “ngốn” token đến vậy?
Sự khác biệt nằm ở cách con người và AI Agent làm việc.
Khi sử dụng chatbot thông thường, bạn nhập câu hỏi, chờ AI trả lời, đọc kết quả rồi mới đặt câu hỏi tiếp theo. Giữa các lượt luôn có khoảng thời gian để con người đọc, suy nghĩ và nhập nội dung.
AI Agent thì khác. Sau khi được giao một mục tiêu, nó có thể liên tục đọc file, gọi công cụ, phân tích kết quả, ghi dữ liệu, kiểm tra lại, sửa lỗi rồi tiếp tục thực hiện bước tiếp theo cho đến khi hoàn thành nhiệm vụ.
Ví dụ, bạn chỉ đưa ra một yêu cầu: “Hãy kiểm tra dự án này, tìm lỗi và sửa toàn bộ code.” Phía người dùng chỉ có một prompt. Nhưng phía sau, Agent có thể thực hiện hàng chục lượt gọi mô hình và công cụ. Vì vậy, thống kê token không đơn giản phản ánh có bao nhiêu người đang dùng AI mà còn cho thấy khối lượng công việc AI đang tự thực hiện thay con người.
Một yêu cầu của con người có thể kích hoạt hàng chục tác vụ AI
Đây cũng là lý do các công cụ AI Agent như trợ lý lập trình có thể tiêu tốn lượng token lớn hơn chatbot truyền thống.
Trước đây, một hệ thống hỗ trợ khách hàng có thể nhận câu hỏi rồi trả lời trực tiếp. Với Agent, cùng câu hỏi đó có thể khiến AI kiểm tra đơn hàng, truy vấn hồ sơ, đối chiếu dữ liệu, cập nhật tồn kho rồi trải qua nhiều vòng xử lý trước khi đưa ra một câu trả lời cuối cùng.
Theo ước tính được dẫn trong tài liệu, Goldman Sachs cho rằng AI Agent có thể khiến mức tiêu thụ token tăng tới 24 lần vào năm 2030.
Token tăng mạnh nhưng chi phí không tăng theo tỷ lệ tương ứng
Con số 7,3 nghìn tỷ token nghe rất lớn, nhưng không có nghĩa chi phí cũng tăng đúng 14 lần.
Nguyên nhân là AI Agent thường làm việc nhiều vòng trên cùng một lượng thông tin. Theo dữ liệu được đề cập, trung bình gần 70% token trong các yêu cầu Agent đến từ nội dung đã được cache. Những token này thường có chi phí thấp hơn token đầu vào mới. Agent có thể đọc một lượng lớn code, tài liệu, hướng dẫn và danh sách công cụ ở lần đầu. Những vòng tiếp theo tiếp tục sử dụng lại phần lớn context đó thay vì xử lý mọi thứ hoàn toàn từ đầu.
Dù vậy, mức tăng sử dụng quá nhanh vẫn tạo áp lực đáng kể lên chi phí và hạ tầng tính toán.
Một điểm đáng chú ý khác là cùng một model có thể tiêu thụ lượng token hoàn toàn khác nhau tùy cách sử dụng. Nếu sử dụng AI giống một công cụ tìm kiếm, một người có thể chỉ tiêu thụ vài nghìn token mỗi ngày. Nhưng khi kết nối cùng model đó với file, dữ liệu, công cụ và một workflow tự động chạy liên tục, lượng sử dụng có thể lên tới hàng chục triệu token mỗi ngày.
Điều này cho thấy sự thay đổi lớn của AI đang không chỉ đến từ việc các model ngày càng thông minh hơn. Quan trọng hơn là chúng đang chuyển từ: Con người hỏi → AI trả lời sang: Con người giao mục tiêu → AI tự thực hiện hàng loạt công việc để đạt mục tiêu.
AI làm được nhiều hơn, nhưng ai sẽ kiểm tra?

Sự bùng nổ AI Agent cũng tạo ra một vấn đề mới. Nếu lượng công việc AI thực hiện tăng gấp nhiều lần, khả năng của con người trong việc kiểm tra và phê duyệt kết quả lại không thể tăng với tốc độ tương tự. Đơn cử một AI assistant đã xóa 18 video khỏi một tài khoản quảng cáo và sự việc chỉ được phát hiện một ngày sau. Vấn đề không nhất thiết nằm ở một lỗi nghiêm trọng của model, mà ở chỗ không có người theo dõi bước hành động đó kịp thời.
Vì vậy, khi AI Agent ngày càng đảm nhiệm nhiều công việc, thứ trở nên khan hiếm có thể không còn là khả năng tạo nội dung, phân tích hay viết code. Khả năng kiểm chứng, đánh giá và đưa ra quyết định cuối cùng của con người mới có thể trở thành nút thắt quan trọng.
Nói cách khác, câu hỏi trong tương lai có thể không còn là “Bạn có sử dụng AI hay không?”, mà là: “AI đang làm những gì thay bạn, và ai chịu trách nhiệm kiểm tra những gì nó đã làm?”
Tài liệu tham khảo:
AI is becoming AI's biggest customer as agentic token usage jumps 14x on OpenRouter
AI agents have consumed more tokens than humans on OpenRouter since February 6, 2025. Agentic usage has grown 14x since then, while human usage is up just 2.8x. Nearly 70 percent of agent token consumption comes from cheap cached prompts, though, so actual costs are rising far more slowly than...
Charts of the Week: Winds of Thematic Change
Data Centers Are A Blue Collar Bonanza; It’s Not Your Imagination–Ridesharing Really Is More Expensive; Agents Are Early, But They’re Already Changing Things
Agentic AI Enterprise Token Cost
Agentic AI is changing enterprise costs. Learn the total cost of agentic AI, from infrastructure and governance to change, risk and Agent FinOps.