Tối ưu hóa chi phí AI bắt đầu từ việc thừa nhận mô hình mạnh không phải cho mọi việc
Tối ưu hóa chi phí AI là chiến lược phân bổ tác vụ giữa các mô hình khác nhau dựa trên độ phức tạp công việc, trong đó mô hình cao cấp chỉ xử lý phần suy luận khó, còn các tác vụ lặp lại, dễ dự đoán và nhiều nhập/xuất được định tuyến sang mô hình chi phí thấp để giảm token, hạ chi phí và vẫn giữ hiệu quả tự động hóa. Theo Techzine, Spotify ngày 6/9 cho biết họ đã triển khai đúng tư duy này và cắt giảm mạnh lượng token của Claude Code bằng cách xây dựng một cổng dành cho nhà phát triển để định tuyến mô hình theo từng tác vụ. Đây không phải chi tiết kỹ thuật phụ, mà là lựa chọn mang tính quản trị: doanh nghiệp chấp nhận rằng mô hình frontier nên là "bộ não" chứ không phải "chân tay" của hệ thống.

Spotify cắt 90% token Claude Code nhờ định tuyến mô hình token cho tác vụ lặp
Trường hợp Spotify là minh họa rõ nhất cho việc định tuyến mô hình token giữa các lớp AI khác nhau để tối ưu hóa chi phí AI. Cốt lõi của phương án này là chuyển các tác vụ lặp lại như đọc tệp hoặc tạo những đoạn mã dễ dự đoán sang các mô hình AI chi phí thấp hơn thông qua cổng dành cho nhà phát triển do công ty tự xây dựng. Hệ thống xoay quanh các agent "AiKA mode" chạy trong môi trường runtime tạm thời; lập trình viên chỉ cần chọn mô hình, chỉ dẫn và công cụ MCP cho từng mode thay vì tự quản lý hạ tầng hay API key. Trong thử nghiệm trên một monorepo Java, Dimitri Mazmanov tách hai mode "bulk reader" và "code writer" dùng Google Gemini 2.5 Flash làm worker, giúp lượng token Claude Code giảm trung bình 90% theo kết quả thử nghiệm. Đây là con số đủ để khiến mọi đội kỹ thuật phải xem lại cách họ đang dùng mô hình frontier.
Chiến lược phân tách tác vụ: frontier để suy luận, mô hình chi phí thấp để I/O
Nhìn kỹ vào cách Spotify thiết kế AiKA, ta thấy một tư duy phân tách tác vụ rất rõ ràng. Mazmanov cho biết các agent này phần lớn không đòi hỏi năng lực suy luận, mà chủ yếu xử lý các tác vụ nhập/xuất (I/O); ngay cả khi giao cho AI thực hiện, những tác vụ này vẫn phát sinh chi phí đáng kể. Vì vậy, Spotify tách phần I/O khỏi Claude, vốn có chi phí cao hơn, để các mô hình frontier chỉ tập trung vào những phần việc thực sự cần suy luận. Đồng thời, họ nhấn mạnh rằng mô hình worker không phù hợp cho các công việc như gỡ lỗi, quyết định kiến trúc hay tác vụ suy luận cốt lõi. Nói cách khác, Spotify coi Claude như "kiến trúc sư" và mô hình chi phí thấp như "công nhân": mỗi bên làm đúng vai, và tổng hệ thống đạt tự động hóa hiệu quả mà không đốt token vô tội vạ.
Claude tự động hóa hiệu quả nhưng benchmark nhắc doanh nghiệp phải chọn đúng mô hình cho đúng việc
Ở phía nhà phát triển mô hình, nghiên cứu mà Anthropic công bố ngày 28/8 cho thấy các tác tử Claude đã tự động hóa thành công một vòng tìm kiếm phương pháp hậu huấn luyện giúp giảm cả 10 nhóm lỗi căn chỉnh được thử. Hệ thống Automated Alignment Researchers vận hành lặp: giữ phương pháp hiệu quả, loại phương pháp kém và tiếp tục thử nghiệm, với mỗi phương pháp có khoảng 30 phút huấn luyện trên một GPU H200 và một lượt tìm kiếm kéo dài tối đa 48 giờ. Mười hành vi được đo gồm từ xu nịnh, tuân theo jailbreak, prompt injection đến ảo giác, thiên kiến xã hội và vi phạm riêng tư. Tuy vậy, cổng năng lực chỉ dùng MMLU, GSM8K và IFEval làm đại diện cho kiến thức, toán học và khả năng làm theo chỉ dẫn. Vì thế, kết luận chính xác là các phương pháp không gây suy giảm có ý nghĩa thống kê theo ba phép đo đã chọn, chứ không chứng minh mọi năng lực của mô hình không đổi. Doanh nghiệp không thể coi benchmark là tấm giấy chứng nhận vạn năng; họ phải hiểu giới hạn mô hình để định tuyến tác vụ phù hợp.

Từ Spotify đến mọi doanh nghiệp: định tuyến mô hình là chìa khóa giảm chi phí mà vẫn tăng năng suất
Hai câu chuyện – Spotify tách I/O khỏi Claude và Claude tự động hóa vòng nghiên cứu căn chỉnh – gợi ra một kết luận thực dụng: tự động hóa hiệu quả không đến từ một mô hình "thần thánh", mà từ kiến trúc định tuyến mô hình thông minh. Benchmark vừa là động cơ vừa là giới hạn: Claude chỉ tối ưu được những gì đã có tín hiệu chấm điểm, và khi hệ thống chỉ tối ưu một benchmark, cải thiện không chuyển ổn định sang phép đo chưa thấy. Trong khi đó, Spotify cho thấy nếu bạn phân loại tác vụ rõ ràng, xây dựng cổng định tuyến mô hình token và tách phần việc lặp lại sang mô hình chi phí thấp, lượng token frontier có thể giảm tới 90% mà vẫn giữ năng suất lập trình viên. Hai mode "bulk reader" và "code writer" đã được công bố qua AiKA, cho phép lập trình viên tái sử dụng hoặc điều chỉnh theo nhu cầu từng dự án. Bài học cho doanh nghiệp là rõ ràng: hãy để mô hình frontier tập trung vào nơi nó tạo giá trị cao nhất, và xây cả một lớp mô hình chi phí thấp xung quanh để gánh phần việc dự đoán được.







