Mô hình AI nhỏ gọn cho thiết bị biên: cuộc cách mạng ngoài đám mây

Mô hình AI nhỏ gọn cho thiết bị biên: cuộc cách mạng ngoài đám mây
Sở thích|Khám phá ứng dụng AI

AI đang rời đám mây: vì sao mô hình nhỏ gọn là bước ngoặt

Mô hình AI nhỏ gọn cho xử lý biên edge computing là các mô hình deep learning cục bộ được thiết kế để chạy trực tiếp trên thiết bị người dùng như laptop, điện thoại hay GPU đơn, giúp thực hiện nhận diện hình ảnh, xử lý văn bản và các tác vụ trí tuệ nhân tạo khác mà không cần phụ thuộc liên tục vào điện toán đám mây, từ đó giảm độ trễ, tiết kiệm chi phí hạ tầng và tăng quyền kiểm soát dữ liệu cho người dùng cuối. Sự xuất hiện liên tiếp của Muse Glimmer 30B và LFM2.5-VL-3B cho thấy cuộc chơi AI đang dịch chuyển trọng tâm từ “càng lớn càng tốt” sang “càng gần người dùng càng giá trị”. Mấu chốt không chỉ là số tham số, mà là việc làm thế nào để AI trên thiết bị di động và PC trở nên đủ mạnh, đủ nhanh và đủ an toàn, để doanh nghiệp lẫn người dùng cá nhân dám mang các tác vụ quan trọng ra khỏi đám mây.

Muse Glimmer 30B: tham số lớn, định hướng xử lý cục bộ

Meta đã công bố Muse Glimmer 30B, một mô hình ngôn ngữ nhẹ với 30 tỷ tham số, được phát hành dưới giấy phép Apache 2.0 và nhắm thẳng vào việc chạy trên Mac và PC dưới dạng AI cục bộ. Điểm đáng nói không phải là con số 30 tỷ, mà là cách mô hình này được lượng tử hóa để nén xuống dung lượng dưới 20GB, nhờ đó có thể vận hành trong môi trường có bộ nhớ 24GB hoặc 32GB mà nhiều máy trạm và PC cao cấp hiện nay đáp ứng được. Theo nhà phát triển ứng dụng chạy LLM cục bộ LM Studio, Muse Glimmer 30B "là mô hình mạnh nhất trong cùng kích thước mà họ từng thử nghiệm". Điều này củng cố quan điểm rằng xử lý deep learning cục bộ không còn là trò chơi của những mô hình vài tỷ tham số; các mô hình khổng lồ cũng đang được ép xuống để nằm gọn trong máy người dùng.

LFM2.5-VL-3B: AI thị giác ngôn ngữ tối ưu cho edge và di động

Nếu Muse Glimmer 30B thể hiện tham vọng đưa trợ lý ngôn ngữ mạnh mẽ lên PC, thì Liquid AI chọn cách đánh thẳng vào AI trên thiết bị di động với LFM2.5-VL-3B. Đây là mô hình thị giác-ngôn ngữ mở có 3,1 tỷ tham số, được xây dựng để chạy trên điện thoại, laptop và card đồ họa đơn thay vì trong trung tâm dữ liệu. Theo mô tả, LFM2.5-VL-3B đạt tốc độ giải mã 228 token mỗi giây trên Apple M5 Max, khoảng 116 token mỗi giây trên AMD Ryzen AI Max+ 395, và 20 token mỗi giây trên Galaxy S26 Ultra, chỉ cần khoảng 3GB bộ nhớ. Mô hình này cung cấp hiệu suất thị giác cạnh tranh với các mô hình có kích thước gấp đôi, đồng thời chạy nhanh hơn trên nhiều triển khai CPU và GPU, kể cả so với các mô hình có ít tham số hơn. Nói cách khác, Liquid AI đang cho thấy xử lý biên edge computing với AI thị giác không còn là phiên bản “giảm chất” mà là một lựa chọn kỹ thuật thông minh để tối ưu độ trễ.

Mô hình AI nhỏ gọn cho thiết bị biên: cuộc cách mạng ngoài đám mây

Từ benchmark đến ứng dụng: deep learning cục bộ mang lại gì cho người dùng

Giá trị của các mô hình ngôn ngữ nhẹ không nằm ở bảng điểm số đẹp, mà ở những tình huống đời thường nơi đám mây là điểm yếu chứ không phải điểm mạnh. Muse Glimmer 30B được thiết kế cho AI agent thực hiện các tác vụ như hỗ trợ viết mã, xử lý quy trình dài, tiếp nhận cả đầu vào có hình ảnh trên máy người dùng, thay vì gửi mọi thứ lên máy chủ từ xa. LFM2.5-VL-3B được khuyến nghị cho các nhiệm vụ "một lượt, tốc độ cao, độ trễ thấp" như phát hiện đối tượng gần thời gian thực trong ứng dụng ô tô, OCR hàng loạt tài liệu quét, dịch trực tiếp menu và biển báo đường trên thiết bị. Điều này nghĩa là nhận diện hình ảnh, xử lý văn bản và thậm chí âm thanh có thể diễn ra ngay tại điểm thu thập dữ liệu. Người dùng được lợi ở ba mặt: phản hồi nhanh hơn, ít phụ thuộc mạng, và dữ liệu nhạy cảm không phải lang thang liên tục qua các trung tâm dữ liệu.

Cuộc cạnh tranh mới: AI cục bộ sẽ thách thức mô hình “đám mây trước”

Các thông số của LFM2.5-VL-3B cho thấy một thế hệ edge model đã đủ trưởng thành để cạnh tranh với đàn anh trên đám mây: được huấn luyện trước trên khoảng 34 nghìn tỷ token, ngữ cảnh 32.768 token, đạt trung bình 69,4 điểm trên 28 chuẩn thị giác so với 57,2 của phiên bản tiền nhiệm. Mức tăng đáng kể ở các bài test như ScreenSpot-v2 (trung bình 80,7 điểm), RefCOCO (87,9 điểm), ToolSandbox (59,5 điểm) chứng minh rằng tối ưu hóa cho thiết bị biên không đồng nghĩa với đánh đổi chất lượng. Về phía Meta, việc đưa Muse Glimmer 30B vào cuộc chơi và được đánh giá cao bởi công cụ chạy LLM cục bộ cho thấy "cuộc cạnh tranh AI cục bộ" bên cạnh các mô hình đám mây quy mô lớn sẽ ngày càng khốc liệt. Liquid AI đã hoàn thiện dòng LFM2.5 với mô hình văn bản, biến thể bộ mã hóa cho suy luận CPU dài và giờ là tầng thị giác, tiếp theo là các biến thể nhỏ hơn 1,6B và 450M. Kết luận rõ ràng: chiến lược "cloud-first" đang bị thách thức, và những ai thiết kế sản phẩm, dịch vụ số mà bỏ qua deep learning cục bộ sẽ sớm bị tụt lại.

Sammfy nhận hoa hồng khi bạn mua sắm qua liên kết của chúng tôi, bạn không phải trả thêm chi phí. Bài viết này được tạo bằng AI từ các nguồn đã công bố và dữ liệu sản phẩm.

You May Also Like

Comments
Viết gì đó...
Chưa có bình luận nào. Hãy là người đầu tiên chia sẻ suy nghĩ!