Chọn mô hình Claude: bắt đầu từ chi phí và tác vụ, không phải độ “xịn”
Chọn mô hình Claude là quá trình so sánh các phiên bản có năng lực gần tương đương nhưng khác biệt về chi phí token, cách xử lý tác vụ lặp lại và khả năng suy luận, từ đó phân bổ mỗi mô hình cho đúng loại công việc để tối ưu hóa chi phí AI và hiệu quả hệ thống trong dài hạn. Khi bạn quyết định dùng Claude cho agent hay ứng dụng nội bộ, lỗi phổ biến nhất là chọn bản “cao cấp nhất” rồi để mô hình đó làm mọi việc. Thực tế, điều quan trọng hơn là xác định: tác vụ nào cần khả năng lập trình, agentic và suy luận phức tạp; tác vụ nào chỉ là nhập/xuất dữ liệu hoặc thao tác lặp lại có thể giao cho mô hình giá rẻ hơn. Nếu không tư duy phân lớp như vậy, bạn sẽ biến AI thành khoản chi khó kiểm soát, thay vì là nền tảng giúp giảm chi phí vận hành.
Bài học từ Spotify: cắt 90% token bằng cách tách tác vụ lặp
Câu chuyện Spotify là minh chứng rõ ràng cho việc tối ưu hóa chi phí AI bằng chiến lược mô hình nhiều tầng. Theo một bài phân tích, họ đã xây dựng cổng dành cho nhà phát triển để chuyển các tác vụ lặp lại như đọc tệp hoặc tạo đoạn mã dễ dự đoán sang mô hình AI chi phí thấp hơn. Kết quả: lượng token Claude Code tiêu thụ giảm trung bình 90%. Đây là một phát biểu đáng trích dẫn: "Kết quả thử nghiệm cho thấy lượng token mà Claude Code tiêu thụ giảm trung bình 90%". Điểm cốt lõi trong cách làm này là nhận diện các tác vụ không đòi hỏi năng lực suy luận, chủ yếu là I/O, rồi tách chúng khỏi mô hình frontier mang tính đa năng và đắt đỏ hơn. Với ai đang muốn chọn mô hình Claude, bài học rất rõ: không phải lúc nào cũng nên dùng một mô hình duy nhất cho tất cả; hãy thiết kế kiến trúc tác vụ để mô hình mạnh chỉ xử lý phần việc “cần não”, còn khối thao tác lặp được giao cho mô hình chi phí thấp.
Opus 5 và Fable 5: năng lực gần như ngang nhau nhưng chi phí chỉ bằng một nửa
Khi cân nhắc chọn mô hình Claude cho agent, nhiều người nghĩ mô hình đắt hơn đương nhiên phải tốt hơn. So sánh trực tiếp Opus 5 và Fable 5 cho thấy điều ngược lại: hai mô hình đạt kết quả tương đương nhau (sai số không đáng kể) ở hầu hết bài kiểm tra hiệu năng, nhưng Opus 5 có chi phí chỉ bằng một nửa. Trong nhóm tác vụ lập trình, Opus 5 đạt 96,0% trên SWE-bench Verified so với 95,0% của Fable 5, và 43,3% trên Frontier-Bench v0.1 so với 33,7% cho Fable 5. Ngược lại, Fable 5 nhỉnh hơn đôi chút trên SWE-bench Pro với 80,3% so với 79,2% của Opus 5. Ở mảng công việc tri thức, Opus 5 tiếp tục dẫn trước với 1.861 điểm trên GDPval-AA v2, còn Fable 5 là 1.747 điểm. Nếu mục tiêu là tối ưu hóa chi phí AI, thật khó biện minh cho việc trả gấp đôi mà phần lớn benchmark không tốt hơn.
| Khía cạnh | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| Lập trình (SWE-bench Verified) | 96,0% | 95,0% |
| Lập trình (SWE-bench Pro) | 79,2% | 80,3% |
| Lập trình terminal (Frontier-Bench v0.1) | 43,3% | 33,7% |
| Công việc tri thức (GDPval-AA v2) | 1.861 | 1.747 |

Suy luận, agentic và nghiên cứu: khi nào nên trả thêm cho Fable 5?
Để chọn mô hình Claude phù hợp, bạn phải nhìn sâu vào loại tác vụ chứ không phải bảng so sánh chung chung. Cả Opus 5 và Fable 5 đều được thiết kế cho tác vụ agentic với quy trình dài hơi, nhưng Opus 5 lại thể hiện vượt trội hơn về hiệu quả chi phí trong các bài kiểm tra liên quan. Ở các bài kiểm tra khả năng giải quyết vấn đề mới lạ và sử dụng máy tính, Opus 5 chiếm vị trí dẫn đầu, và đối với các tác vụ lập trình, công việc tri thức và sử dụng máy tính thông thường, nó được đánh giá là mô hình có độ tuân thủ tốt và ít cản trở người dùng hơn. Tuy vậy, Fable 5 vẫn được ghi nhận là vượt trội trong các tác vụ suy luận khoa học khó, thời gian xử lý cao, đặc biệt với nhóm năng lực Mythos dành cho nghiên cứu sinh học tự hành dài hạn. Nói cách khác: nếu bạn cần AI cho phân tích, lập trình, tác vụ agentic rộng rãi, Opus 5 là lựa chọn tiết kiệm chi phí token Claude; còn nếu trọng tâm là nghiên cứu khoa học dài hạn với yêu cầu suy luận cực khó, Fable 5 mới có lý do tồn tại.

Kết luận: tư duy “đa mô hình” là chìa khóa tối ưu hóa chi phí Claude
Điểm chung giữa câu chuyện Spotify và so sánh Opus 5 – Fable 5 là một thông điệp rất thực tế: muốn tối ưu hóa chi phí AI, bạn phải thiết kế hệ thống quanh chi phí token và loại tác vụ, không quanh cảm giác “mô hình càng lớn càng tốt”. Spotify đạt được mức giảm 90% token Claude Code bằng cách tách tác vụ lặp sang mô hình rẻ hơn và giữ mô hình frontier cho phần việc cần suy luận. Trong hệ sinh thái Claude, Opus 5 cho thấy bạn có thể đạt hiệu năng ngang hoặc tốt hơn Fable 5 trong lập trình và xử lý kiến thức, trong khi chi phí lại chỉ bằng một nửa. Vì vậy, chiến lược hợp lý là: phân loại tác vụ theo mức độ cần suy luận, gán phần lập trình, agentic và phân tích tri thức cho Opus 5, và dùng mô hình chi phí thấp hơn cho tác vụ I/O, thao tác lặp. Nếu bạn duy trì tư duy “đa mô hình”, chi phí token Claude sẽ trở thành biến số có thể kiểm soát, không phải rủi ro ngầm trong ngân sách.






