Nghịch lý token AI: Rẻ chưa chắc đã tiết kiệm
Nghịch lý token AI là hiện tượng giá token, đơn vị tính toán cơ bản của mô hình ngôn ngữ lớn, giảm mạnh nhờ cạnh tranh và cải tiến kỹ thuật, nhưng tổng chi phí AI của doanh nghiệp lại tăng vọt vì khối lượng sử dụng bùng nổ, đặc biệt khi AI được triển khai rộng trong quy trình làm việc và dưới dạng tác nhân tự động hóa chuỗi tác vụ phức tạp. Đây không phải câu chuyện lý thuyết mà là thực tế các tập đoàn công nghệ đang đối mặt. Cuối năm 2022, chi phí để xử lý một triệu token ở mức rất cao; từ đó đến nay, giá token đã giảm khoảng 98%. Theo lẽ thường, chi phí token AI phải đi xuống. Thay vào đó, hóa đơn AI doanh nghiệp trung bình tăng gấp ba lần trong cùng khoảng thời gian. Điều này cho thấy một sự thật khó chịu: công nghệ rẻ đi nhưng văn hóa dùng không kiểm soát sẽ đốt ngân sách nhanh hơn mọi mức giảm giá.
Microsoft siết lại thời kỳ dùng AI bừa bãi
Không phải start-up thiếu tiền, mà chính một tập đoàn lợi nhuận kỷ lục như Microsoft đang phải phanh gấp chi phí token AI. Trong một email nội bộ bị lộ, Phó Chủ tịch điều hành Jay Parikh thông báo công ty sẽ áp dụng ngân sách token cấp bộ phận từ tháng 7/2026 và chuyển mô hình AI mặc định nội bộ sang phiên bản OpenAI rẻ hơn. Ông nói thẳng: “Tokenmaxxing không phải điều chúng ta đang tối ưu hóa”. Tokenmaxxing là kiểu dùng AI như thể miễn phí, không quan tâm chi phí. Nhân viên Microsoft đã có dashboard để theo dõi tiêu thụ token cá nhân, nhưng nhiều kỹ sư vẫn chi từ vài trăm đến vài nghìn USD mỗi tháng cho AI trong công việc hàng ngày. Từ tháng 5, Microsoft âm thầm hủy hầu hết giấy phép Claude Code trong một bộ phận, yêu cầu kỹ sư chuyển sang GitHub Copilot CLI trước cuối năm tài chính. Thời kỳ “AI cho tất cả mọi người” đang được thay bằng thời kỳ “AI trong hạn mức” – một bước ngoặt về quản lý ngân sách AI.
Vì sao giá giảm nhưng chi phí doanh nghiệp vẫn tăng mạnh?
Cốt lõi của nghịch lý nằm ở cách doanh nghiệp sử dụng AI, không phải ở bảng giá. Ban đầu, AI chủ yếu được dùng để gợi ý mã lệnh, viết email, hỗ trợ từng tác vụ nhỏ nên mỗi tương tác chỉ tiêu thụ lượng token tương đối ít và khá dễ đoán. Khi các mô hình tiến hóa thành tác nhân tự động thực hiện cả chuỗi nhiệm vụ, mỗi yêu cầu có thể ngốn hàng chục, thậm chí hàng trăm lần token so với trước. Giá mỗi token rẻ hơn 98%, nhưng số token sử dụng tăng nhanh hơn nhiều so với mức giảm đó, khiến tổng chi phí token AI phình to. Đây là dạng hiệu ứng Jevons trong thế giới AI: công nghệ càng rẻ, càng tiện, người dùng càng mở rộng phạm vi và tần suất sử dụng, làm chi phí thực tế tăng chứ không giảm. Vấn đề mà Microsoft thừa nhận không phải thiếu tiền, mà là chi tiêu AI tăng với tốc độ không thể dự đoán và không tương xứng với lợi ích năng suất. Nếu tiếp tục tokenmaxxing, mọi mô hình dự báo chi phí doanh nghiệp đều trở nên vô nghĩa.
Các tập đoàn lớn đang kiểm soát chi phí token AI như thế nào?
Microsoft không cô đơn. Nhiều tập đoàn như các nhà mạng, nền tảng mạng xã hội, hãng gọi xe, bán lẻ, phần mềm và tài chính đều đã triển khai giới hạn hoặc theo dõi chi tiêu AI của nhân viên trong những tháng gần đây. Điểm chung: mô hình tính phí theo token khác hẳn mô hình phần mềm doanh nghiệp truyền thống tính theo số ghế; đội ngũ tài chính thiếu mô hình dự báo phù hợp cho loại chi phí biến động liên tục này. Vì thế, các công ty bắt đầu xây dựng dashboard theo dõi token, đặt trần ngân sách cho từng bộ phận và thay thế mô hình đắt bằng mô hình rẻ hơn cho sử dụng mặc định. Về bản chất, đây là chuyển đổi từ tư duy “dùng AI càng nhiều càng tốt” sang “dùng AI có mục tiêu, có giới hạn”. Chi phí token AI không còn được xem là khoản phụ, mà trở thành dòng chi phí vận hành cần kiểm soát như điện, cloud hay băng thông. Ai không làm điều này sớm sẽ sớm sốc trước hóa đơn AI tăng ba lần.
Doanh nghiệp cần chiến lược nào để quản lý ngân sách AI?
Bài học từ Microsoft rất rõ: nếu không kiểm soát, hóa đơn AI sẽ chạy trước mọi lợi ích năng suất. Trước hết, doanh nghiệp phải thiết lập hạn mức sử dụng cho từng bộ phận và từng nhóm sản phẩm AI, coi đó là một phần của quản lý ngân sách AI, không phải biện pháp tạm thời. Dashboard giám sát số lượng API calls và token tiêu thụ theo thời gian là lớp kiểm soát bắt buộc, giúp phát hiện sớm các mô hình tokenmaxxing trong tổ chức. Song song, đội ngũ kỹ thuật cần tối ưu hóa prompt và quy trình để giảm token thừa, tránh cho tác nhân AI xử lý những phần việc không cần thiết. Cuối cùng, cần phân tầng mô hình: tác vụ đơn giản dùng mô hình rẻ, tác vụ phức tạp mới dùng mô hình cao cấp. Chi phí token AI sẽ không tự giảm chỉ vì bảng giá rẻ hơn; nó chỉ giảm khi doanh nghiệp coi AI là hạ tầng phải đo lường, thiết kế và tối ưu giống như bất kỳ tài nguyên số nào khác.






