DeepSeek đã có “thị giác”: khoảng cách với nhóm dẫn đầu thu hẹp

DeepSeek đã có “thị giác”: khoảng cách với nhóm dẫn đầu thu hẹp
Sở thích|Khám phá ứng dụng AI

DeepSeek-V4-Flash-Vision-Exp là gì và vì sao lại quan trọng lúc này?

DeepSeek-V4-Flash-Vision-Exp là một DeepSeek multimodal model mới, mở rộng từ V4-Flash, có khả năng xử lý đồng thời văn bản và hình ảnh để phục vụ các tác vụ AI Agent phức tạp vốn đòi hỏi mô hình ngôn ngữ vision hiểu được giao diện, tài liệu và ảnh chụp màn hình thay vì chỉ đọc chữ. Model đa phương thức đầu tiên thực sự dùng được cho developer này được DeepSeek đưa lên API với tên DeepSeek-V4-Flash-Vision-Exp, ra mắt ngày 21/8. Về bản chất, đây là biến thể multimodal thực nghiệm của V4-Flash, ngôi sao hiệu năng/chi phí trong hệ sinh thái DeepSeek. Sau hơn một năm chỉ xử lý văn bản, việc DeepSeek bổ sung “đôi mắt” là bước xoay trục chiến lược trong cuộc đua AI xử lý hình ảnh đang bị GPT, Gemini và Claude chiếm ưu thế từ rất lâu.

DeepSeek đã có “thị giác”: khoảng cách với nhóm dẫn đầu thu hẹp

Hiệu năng: chưa thắng Opus 4.8 nhưng đã đủ “đáng tiền”

Lý do DeepSeek-V4-Flash-Vision-Exp gây chú ý không phải vì nó vượt mặt nhóm dẫn đầu, mà vì nó đã đủ “gần” Anthropic Opus 4.8 với một mức chi phí thấp bất thường. DeepSeek khẳng định model thực nghiệm này giữ nguyên năng lực text của V4-Flash, bao gồm khả năng Agent, lập luận và kiến thức thế giới, đồng thời khi đo như một multimodal agent, nó đạt mức hiệu năng “gần Opus-4.8”. Trên ApexBench, điểm số nhảy từ 26,2 (khi chỉ dùng bản text-only và buộc phải bỏ qua phần ảnh) lên 36,5 sau khi thêm vision, dù vẫn thấp hơn Claude Opus 4.8 ở mức 39,4 điểm. Đáng chú ý hơn, trong 11 phép so, DeepSeek thắng Opus 4.8 ở 3 bài gồm DeepSWE, Agents’ Last Exam và ZeroBench với biên độ khoảng 1–1,6 điểm, nhưng thua ở 8 bài còn lại và có ít nhất một bài chênh tới hai chữ số.

Câu chuyện trở nên thú vị khi nhìn sang bảng giá. Theo báo cáo, chi phí vận hành Vision-Exp rẻ hơn khoảng 99% so với Opus 4.8. Một câu nói đáng trích dẫn ở đây là: “Any model that performs less in eight out of eleven tests but costs a fraction of the price would certainly become very interesting to developers”. Nói cách khác, DeepSeek không cần thắng về điểm số để thắng trong đầu bài hiệu suất/giá.

Áp lực từ chính DeepSeek Harness và cuộc đua AI Agent phức tạp

DeepSeek không tự dưng bật chế độ vision; họ bị chính cộng đồng developer “đẩy” phải làm. DeepSeek Harness – framework AI Agent mã nguồn mở – ra mắt ngày 13/8 và đạt hơn 160.000 star trên GitHub chỉ sau 6 ngày, một tốc độ hiếm gặp cho công cụ lập trình viên. Bản rc.8 ngày 19/8 đã mở sẵn luồng nhận ảnh để Agent đọc ảnh chụp màn hình, giao diện hay lỗi terminal, nhưng model phía sau lại chưa hiểu được ảnh. Đó là một nghịch lý: framework AI Agent phức tạp đã sẵn sàng cho multimodal, còn mô hình ngôn ngữ vision của DeepSeek thì chưa. Vision-Exp xuất hiện hai ngày sau, đúng nghĩa một bản vá gấp để bịt lỗ hổng này.

Ở góc độ chiến lược, đây là bước bắt buộc nếu DeepSeek muốn AI Agent của mình cạnh tranh sòng phẳng. Model mới không chỉ “match” bản V4-Flash về agents, reasoning và world knowledge trên văn bản, mà việc thêm thị giác giúp Agent xử lý nguyên vẹn workflow: đọc tài liệu, xem log lỗi chụp màn hình, hiểu bố cục UI, rồi ra quyết định. Khả năng xử lý multimodal (văn bản, hình ảnh, và tiềm năng cho cả âm thanh sau này) mở đường cho thế hệ AI Agent phức tạp hơn nhiều so với chatbot thuần chữ.

Tác động thực tế: từ giới developer toàn cầu đến cộng đồng Việt Nam

Điểm mạnh dễ thấy nhất của DeepSeek-V4-Flash-Vision-Exp là nó thực dụng với developer. Về AI xử lý hình ảnh, model hỗ trợ các định dạng JPEG, PNG, GIF và WebP, cho phép tải lên tới 600 ảnh trong một yêu cầu – một ngưỡng rất hấp dẫn cho những ai đang xây agent đọc tài liệu scan hay ảnh chụp màn hình hàng loạt. DeepSeek cũng cung cấp Files API để tải ảnh một lần rồi tham chiếu nhiều lần bằng file ID. Về phía text, model mới vẫn giữ năng lực xử lý văn bản, lập luận và kiến thức tổng quát của V4-Flash, nay cộng thêm khả năng đọc hiểu ảnh. Với một DeepSeek multimodal model như vậy, các hệ thống tự động hoá quy trình văn phòng, hỗ trợ khách hàng hay kiểm thử sản phẩm có thêm “mắt” mà không cần đổi cả stack.

Đối với cộng đồng lập trình viên Việt Nam, tác động còn rõ hơn. DeepSeek đã quen thuộc từ lâu nhờ rẻ hơn nhiều so với các model Mỹ. Việc bổ sung khả năng đọc ảnh đồng nghĩa các ứng dụng nội địa dùng DeepSeek API – từ chatbot chăm sóc khách hàng đến công cụ tự động hoá quy trình văn phòng – có thêm lựa chọn xử lý ảnh mà không phải chuyển sang nhà cung cấp khác với chi phí cao hơn. Ở phía trên, các đối thủ cùng phân khúc như GPT-5.6 Luna hay Gemini Flash-Lite thường tính phí riêng cho phần xử lý ảnh, còn DeepSeek quy đổi ảnh thành token (tối đa 384 token mỗi ảnh) và áp cùng mức giá với model text V4-Flash. Về mặt trải nghiệm, đó là sự đơn giản mà developer coi trọng.

Quan điểm: Vision-Exp vá chậm, nhưng là cú đánh nặng ký vào tỉ lệ hiệu suất/giá

Có thể nói DeepSeek đã bị chậm khoảng một năm trong cuộc đua multimodal: khi GPT, Gemini và Claude đều đã có API đa phương thức công khai, DeepSeek vẫn loay hoay với text-only. Vision-Exp không biến họ thành người dẫn đầu qua một đêm, nhưng nó giúp DeepSeek “chạm” vào vùng hiệu năng của Opus 4.8 mà vẫn giữ được lợi thế chi phí – thứ vốn là trọng tâm trong chiến lược của hãng. Ở quy mô ngành, đây là một cú đấm nữa vào cuộc đua hiệu suất/giá AI, và lần này, “cú đấm có mắt” đúng như cách bài viết gốc mô tả.

Điểm còn thiếu là xác nhận độc lập: tất cả benchmark hiện tại đều do DeepSeek tự đo bằng framework của chính hãng, chưa có bên thứ ba kiểm chứng. Điều đó buộc developer tỉnh táo: Vision-Exp rất đáng thử nghiệm cho AI Agent phức tạp, nhưng không nên được coi là “Opus giá rẻ” cho đến khi dữ liệu thực tế đủ dày. Hướng đi hợp lý lúc này là dùng Vision-Exp cho các tác vụ cần khối lượng xử lý hình ảnh lớn, nhạy về chi phí, và giữ các model đắt tiền cho những bài toán đòi hỏi độ chính xác tối đa. Nếu xu hướng 99% rẻ hơn vẫn giữ được hiệu năng “gần” Opus, cuộc chơi AI sắp chuyển từ câu hỏi “model nào mạnh nhất?” sang “model nào đủ mạnh và rẻ nhất?”.

Sammfy nhận hoa hồng khi bạn mua sắm qua liên kết của chúng tôi, bạn không phải trả thêm chi phí. Bài viết này được tạo bằng AI từ các nguồn đã công bố và dữ liệu sản phẩm.

You May Also Like

Comments
Viết gì đó...
Chưa có bình luận nào. Hãy là người đầu tiên chia sẻ suy nghĩ!