Khám phá sở thích, cùng nhau

Deal thật, đánh giá chân thực và câu chuyện mua sắm từ những người cùng sở thích với bạn — mỗi ngày trên Sammfy.

Khám phá sở thích, cùng nhauDeal thật, đánh giá chân thực và câu chuyện mua sắm từ những người cùng sở thích với bạn — mỗi ngày trên Sammfy.

Gemini giảm 88% token khi phân tích video: dùng thế nào cho hiệu quả?

Gemini giảm 88% token khi phân tích video: dùng thế nào cho hiệu quả?
Sở thích|Mẹo dùng AI

Gemini phân tích video chọn lọc là gì và vì sao đáng quan tâm?

Gemini phân tích video chọn lọc là chế độ xử lý trong Gemini API cho phép mô hình chỉ tải và kiểm tra những khung hình, đoạn âm thanh và phần transcript liên quan đến câu hỏi thay vì đọc toàn bộ video với một tốc độ khung hình cố định, từ đó giảm mạnh số token tiêu thụ và chi phí phân tích trong các tác vụ xử lý video dài. Từ ngày 1 tháng 9 năm 2026, Google phát hành Agentic Video Understanding cho Gemini 3.7 Flash, 3.6 Flash và 3.5 Flash‑Lite, hoạt động với video tải lên và video YouTube thông qua Gemini API. Theo công bố, ở các phép đo với Gemini 3.7 Flash, lượng token có thể giảm tối đa 88% và chi phí phân tích giảm tới 66% so với chế độ tĩnh. Đây không phải là cải tiến mỹ thuật mà là một thay đổi chiến lược: cho phép bạn tối ưu hóa chi phí AI thay vì chấp nhận việc mọi phút video đều bị “đốt” token như nhau.

Gemini giảm 88% token khi phân tích video: dùng thế nào cho hiệu quả?

Cách Gemini chọn khung hình thông minh để tiết kiệm token

Trong chế độ tĩnh, Gemini sẽ lấy khung hình theo tốc độ cố định (mặc định 1 FPS), đặt toàn bộ vật liệu này vào ngữ cảnh rồi trả lời câu hỏi; vì thế, video càng dài thì lượng token càng phình ra, ngay cả khi câu hỏi chỉ liên quan tới một khoảnh khắc hoặc một câu nói ngắn. Ngược lại, khi bật chế độ agentic, mô hình thay một lượt quét tuyến tính bằng vòng lặp tìm kiếm: nó có thể rà transcript để xác định khoảng thời gian liên quan, sau đó yêu cầu khung hình hoặc âm thanh ở chính đoạn đó, và thậm chí quay lại một khoảng hẹp với tốc độ khung hình cao hơn nếu cần theo dõi chuyển động nhanh. Một câu nói có thể trích dẫn là: “Ở bài test 1H‑VideoQA, Gemini 3.7 Flash giảm tiêu thụ từ 397.600 xuống còn 47.700 token khi dùng chế độ agentic”. Tư duy ở đây rất rõ: token là tài nguyên, nên để mô hình tự chọn dữ liệu cần thiết thay vì nghiền nát toàn bộ video là cách xử lý video hiệu quả hơn.

Gemini giảm 88% token khi phân tích video: dùng thế nào cho hiệu quả?

Khi nào nên dùng phân tích video chọn lọc thay vì chế độ tĩnh?

Dù khái niệm tiết kiệm token Gemini nghe rất hấp dẫn, không phải nhiệm vụ nào cũng phù hợp với Agentic Video Understanding. Ở các video ngắn, nơi bạn cần phản hồi ban đầu cực nhanh và việc bao trùm toàn bộ timeline là đơn giản, chế độ tĩnh với tốc độ lấy khung hình cố định sẽ dễ tính toán chi phí và độ trễ hơn. Ngược lại, với những bài giảng dài, phỏng vấn nhiều giờ hay kho lưu trữ video lớn, khi câu hỏi tập trung vào một khoảnh khắc, một câu nói hoặc một sự kiện cụ thể, chế độ agentic là lựa chọn tự nhiên: mô hình chỉ tải những phần liên quan thay vì mang toàn bộ video vào ngữ cảnh. Tuy nhiên, nếu bạn đang làm kiểm tra tuân thủ, an ninh hoặc những tác vụ cần quét toàn bộ timeline một cách đầy đủ, việc chọn lọc nội dung lại trở thành rủi ro: đoạn không được đánh giá là “liên quan” có thể không được kiểm tra sâu. Nghĩa là, dùng sai chế độ sẽ phá hỏng lợi ích tối ưu hóa chi phí AI mà bạn đang nhắm tới.

Gemini giảm 88% token khi phân tích video: dùng thế nào cho hiệu quả?

Thực hành cấu hình Gemini để tối ưu hóa chi phí AI

Điểm mạnh thực tế của Gemini phân tích video không nằm ở việc bật agentic cho mọi tác vụ, mà ở khả năng chọn chế độ theo từng video. Trên mỗi đối tượng video trong Gemini API, bạn đặt trường "processing" thành "agentic" nếu muốn mô hình phân tích video chọn lọc; nếu bỏ trống hoặc để mặc định, video đó sẽ được xử lý theo chế độ tĩnh với 1 khung hình mỗi giây. Một kiểm tra kỹ thuật cho thấy bạn có thể gửi nhiều video trong cùng một yêu cầu, mỗi video dùng chế độ khác nhau; các trường "processing_call" và "processing_result" trong phản hồi thể hiện cách mô hình di chuyển qua timeline. Cách cấu hình khôn ngoan là: clip ngắn, cần phản hồi nhanh và bao trùm timeline thì để tĩnh; bài giảng dài, phỏng vấn nhiều giờ hay câu hỏi về một điểm cụ thể thì bật agentic để xử lý video hiệu quả và giảm token không cần thiết.

Gemini giảm 88% token khi phân tích video: dùng thế nào cho hiệu quả?

Hiểu đúng về con số 88% và cách đo hiệu quả thực sự

Con số 88% giảm token nghe như một “mức giảm cố định”, nhưng thực tế đây chỉ là kết quả cao nhất trong các bài test so sánh với chế độ tĩnh, không phải mức giảm được bảo đảm cho mọi truy vấn. Ở một số bài benchmark, token giảm ít hơn, ví dụ trong bài kiểm tra suy luận Minerva, lượng token chỉ giảm khoảng 58,4%. Hơn nữa, phần trăm giảm token và phần trăm giảm chi phí phân tích cũng không trùng hoàn toàn: chi phí giảm tối đa 66%, vì hệ thống agentic vẫn phải suy nghĩ và dùng công cụ nội bộ để “nhảy” trên timeline. Một câu nói đáng trích dẫn là: “Do đó 88% ít hơn token không đồng nghĩa với 88% hóa đơn thấp hơn cho mọi khối lượng công việc”. Nếu bạn muốn tối ưu hóa chi phí AI một cách có trách nhiệm, hãy nhìn toàn bộ bức tranh: token đầu vào, token suy nghĩ, token công cụ, chất lượng trả lời, độ trễ và nhu cầu quét đầy đủ hay chọn lọc. Chỉ khi đó, việc dùng Gemini phân tích video chọn lọc mới thực sự mang lại lợi ích lâu dài, thay vì chỉ là một thống kê đẹp.

Sammfy nhận hoa hồng khi bạn mua sắm qua liên kết của chúng tôi, bạn không phải trả thêm chi phí. Bài viết này được tạo bằng AI từ các nguồn đã công bố và dữ liệu sản phẩm.

You May Also Like

Comments
Viết gì đó...
Chưa có bình luận nào. Hãy là người đầu tiên chia sẻ suy nghĩ!