DeepSeek thêm thị giác: đối thủ mới trong cuộc đua mô hình đa phương tiện

DeepSeek thêm thị giác: đối thủ mới trong cuộc đua mô hình đa phương tiện
Sở thích|Khám phá ứng dụng AI

DeepSeek mô hình multimodal: từ thiếu hụt đến bước nhảy chiến lược

DeepSeek-V4-Flash-Vision-Exp là một mô hình đa phương thức (multimodal) mới của DeepSeek, có khả năng xử lý đồng thời văn bản và hình ảnh, giữ nguyên hiệu năng suy luận trên text của bản V4-Flash gốc trong khi bổ sung khả năng AI nhận diện hình ảnh phục vụ cho các tác vụ agent phức tạp hơn. Điểm đáng nói không phải ở chỗ DeepSeek “đuổi kịp” các ông lớn, mà ở cách hãng chọn thời điểm nhảy vào cuộc đua mô hình ngôn ngữ đa phương tiện. Trong khi GPT, Gemini và Claude đã có API đa phương thức công khai từ lâu, DeepSeek là một trong số ít phòng lab hàng đầu vẫn chỉ cung cấp mô hình text-only, khiến hệ sinh thái của mình bị lệch pha. Sự chậm chân này giờ đã chấm dứt: ngày 21/8, DeepSeek đưa lên API model đa phương thức đầu tiên thực sự dùng được cho developer, mang tên DeepSeek-V4-Flash-Vision-Exp, như một bản mở rộng thị giác của V4-Flash nhẹ và nhanh.

DeepSeek thêm thị giác: đối thủ mới trong cuộc đua mô hình đa phương tiện

Vì sao DeepSeek buộc phải có thị giác: sức ép từ chính AI Agent của mình

Việc bổ sung thị giác không phải là bước tiến “xa xỉ”, mà là bản vá bắt buộc đối với chiến lược AI Agent của DeepSeek. DeepSeek Harness, framework AI Agent mã nguồn mở ra mắt ngày 13/8, đã đạt hơn 160.000 star trên GitHub chỉ sau 6 ngày – một tốc độ hiếm thấy với công cụ cho lập trình viên. Nhưng thành công này đi kèm một nghịch lý: đến bản rc.8 ngày 19/8, Harness đã mở sẵn luồng nhận ảnh để agent đọc ảnh chụp màn hình, giao diện hay lỗi terminal, trong khi mô hình phía sau lại chưa hiểu được ảnh. Nói cách khác, DeepSeek tự đẩy mình vào thế “framework đi trước, model chạy theo”. Vision-Exp ra đời hai ngày sau đó, đúng lúc vá lại lỗ hổng này. Với khả năng xử lý JPEG, PNG, GIF và WebP cùng giới hạn tới 600 ảnh mỗi request, model mới chuyển những luồng ảnh vốn chỉ mang tính thử nghiệm thành đầu vào thật sự hữu ích cho agent dựa trên tài liệu, screenshot hay giao diện phức tạp. Điều này không chỉ giải quyết một bug sản phẩm, mà còn mở đường cho thế hệ AI Agent có mắt để quan sát môi trường thay vì chỉ đọc chữ.

Gần Opus 4.8 nhưng không vượt: hiệu năng và cái giá của “đủ tốt”

DeepSeek tự tin tuyên bố Vision-Exp “đạt mức hiệu năng gần Opus 4.8” khi benchmark như một agent đa phương thức. Ở góc độ con số, tuyên bố này vừa đúng vừa mang tính marketing. DeepSeek thực hiện 11 phép so sánh với Anthropic Claude Opus 4.8: Vision-Exp thắng ở 3 bài, gồm DeepSWE, Agents' Last Exam và ZeroBench với biên độ khoảng 1–1,6 điểm, nhưng thua ở 8 bài còn lại, trong đó ít nhất một bài khó chênh lệch tới hàng chục điểm. Trên ApexBench, khi thêm phần hiểu ảnh, điểm số tăng từ 26,2 lên 36,5, vẫn dưới mức 39,4 điểm của Opus 4.8. Điều quan trọng là DeepSeek chọn “gần bằng” chứ không chọn “vượt qua”. Họ chấp nhận đứng dưới đỉnh hiệu năng tuyệt đối, đổi lại một lợi thế nơi khác: theo báo cáo, chi phí vận hành Vision-Exp rẻ hơn khoảng 99% so với Opus 4.8. Quotable: "Any model that performs less in eight out of eleven tests but costs a fraction of the price would certainly become very interesting to developers". Trong cuộc đua mô hình ngôn ngữ hiện nay, DeepSeek không đóng vai nhà vô địch benchmark, mà là kẻ phá giá có hiệu năng “đủ tốt” để nhiều ứng dụng không cần chi cho phân khúc cao cấp.

Giá hiệu suất AI: chiến lược phá giá và cơ hội cho developer Việt

Chiến lược trung tâm của DeepSeek luôn xoay quanh tỷ lệ giá/hiệu suất, và Vision-Exp là minh chứng rõ ràng nhất. Ở đây, ảnh được quy đổi thành token để tính phí, tối đa 384 token mỗi ảnh, áp chung mức giá với model text V4-Flash thay vì tách một bảng giá riêng cho xử lý ảnh như nhiều đối thủ. Điều này đặt DeepSeek mô hình multimodal vào vị thế hiếm: ai cần AI nhận diện hình ảnh nhưng không muốn trả mức giá cao cho model Mỹ hoặc tính phí ảnh riêng, sẽ cân nhắc DeepSeek như lựa chọn mặc định. Với cộng đồng lập trình viên Việt Nam, DeepSeek vốn đã quen thuộc nhờ giá rẻ hơn hẳn nhiều model Mỹ cùng phân khúc. Việc thêm thị giác giúp các ứng dụng nội địa – từ chatbot chăm sóc khách hàng đọc ảnh hóa đơn, đến hệ thống tự động hoá quy trình văn phòng dựa trên ảnh chụp màn hình – có thể mở rộng tính năng mà không phải chuyển sang nhà cung cấp khác với chi phí cao hơn. Ở tầm thị trường, DeepSeek gửi đi một thông điệp rõ: trong cuộc đua mô hình ngôn ngữ, họ không chạy theo độ “xịn” tối đa, mà theo tỷ lệ giá hiệu suất AI tối ưu cho developer.

Từ text-only đến AI Agent đa phương tiện: DeepSeek đang chơi ván bài nào?

Nhìn rộng hơn, Vision-Exp cho thấy DeepSeek đang chuyển trọng tâm khỏi mô hình thuần text sang hạ tầng AI Agent đủ mắt, đủ tai. Model mới giữ nguyên khả năng xử lý văn bản, lập luận và kiến thức tổng quát của V4-Flash bản gốc, đồng thời thêm khả năng đọc hiểu ảnh – đúng những gì một agent cần để giải quyết công việc “trong thế giới thật”, nơi dữ liệu là tài liệu scan, giao diện phần mềm, biểu đồ hay ảnh lỗi hệ thống. Trên các bài đo dành cho agent cần hiểu ảnh, model có bước nhảy hiệu năng đáng kể, thay vì chỉ tăng điểm trên các benchmark câu hỏi–đáp. Tất nhiên, Vision-Exp vẫn mang nhãn “Exp”, chưa được cam kết đưa vào danh sách model chính thức, và mọi số liệu đều do DeepSeek tự đo bằng framework của họ, chưa có kiểm chứng độc lập. Nhưng nếu đặt nó trong dòng chảy thị trường, quyết định này hợp lý: DeepSeek thử nghiệm nhanh, chấp nhận vị thế “đối thủ rẻ nhưng gần bằng”, rồi để cộng đồng developer kiểm chứng bằng ứng dụng thật. Kết luận hợp lý lúc này là: ai đang xây AI Agent đa phương tiện, cần mắt nhưng không cần vô địch thế giới, thì Vision-Exp là nước đi thực dụng đáng thử.

Sammfy nhận hoa hồng khi bạn mua sắm qua liên kết của chúng tôi, bạn không phải trả thêm chi phí. Bài viết này được tạo bằng AI từ các nguồn đã công bố và dữ liệu sản phẩm.

You May Also Like

Comments
Viết gì đó...
Chưa có bình luận nào. Hãy là người đầu tiên chia sẻ suy nghĩ!