Mô hình AI nhỏ trên Raspberry Pi: cú hích mới cho edge computing

Mô hình AI nhỏ trên Raspberry Pi: cú hích mới cho edge computing
Sở thích|Khám phá ứng dụng AI

Mô hình AI nhỏ là gì và vì sao Raspberry Pi lại quan trọng?

Mô hình AI nhỏ là các mô hình ngôn ngữ hay thị giác ngôn ngữ với số tham số vừa phải, được tối ưu để chạy trên phần cứng khiêm tốn như CPU, điện thoại, Raspberry Pi và GPU đơn, nhằm đem lại khả năng edge computing và AI di động mà không cần phụ thuộc hạ tầng đám mây hay cụm GPU cỡ trung tâm dữ liệu. Trên nền câu chuyện “càng to càng tốt” của các mô hình khổng lồ, hướng đi này nghe có vẻ đi ngược dòng, nhưng lại là lựa chọn hợp lý nếu mục tiêu là triển khai cục bộ, chi phí thấp và dữ liệu không rời khỏi hệ thống nội bộ. Làn sóng Small Language Model (SLM) mới đang cho thấy: hiệu quả và gần người dùng quan trọng hơn việc đua bảng điểm benchmark.

Ví dụ rõ nhất là LFM2.5-2.6B, mô hình ngôn ngữ mở trọng số do startup Liquid do các nhà khoa học máy tính từ MIT thành lập giới thiệu, với 2,6 tỷ tham số và được thiết kế cho khối lượng công việc mang tính “agentic” – các tác vụ agent nhiều bước, tự động gọi công cụ và xử lý tài liệu. Mô hình này chạy hoàn toàn trên phần cứng cục bộ, từ smartphone, laptop cho tới Raspberry Pi, mà không cần hạ tầng đám mây hay GPU, qua đó mở khóa hàng loạt ứng dụng edge computing và AI di động cho doanh nghiệp cần giữ dữ liệu tại chỗ. Câu hỏi không còn là “có chạy được không”, mà là “tại sao còn phải đẩy mọi thứ lên cloud nữa?”.

Mô hình AI nhỏ trên Raspberry Pi: cú hích mới cho edge computing

LFM2.5-2.6B: Small Language Model nhưng tốc độ không “nhỏ”

LFM2.5-2.6B là ví dụ điển hình cho việc một Small Language Model vẫn đủ mạnh để thay thế nhiều kịch bản cloud. Mô hình có 2,6 tỷ tham số, hỗ trợ cửa sổ ngữ cảnh 128.000 token và tích hợp sẵn khả năng tool calling. Trên Apple M5 Max, Liquid AI báo cáo tốc độ giải mã khoảng 220 token/giây, trên AMD Ryzen AI Max+ 395 là 113 token/giây với dưới 2,5 GB bộ nhớ, còn trên smartphone khoảng 30 token/giây. Đây là những con số cho thấy hiệu năng thực sự, không phải “demo trên GPU đỉnh cao” nữa.

Trong một đánh giá do nền tảng khách hàng AI cục bộ Atomic Chat thực hiện, LFM2.5-2.6B hoàn thành 35 lần tool calling cho ba nhiệm vụ khác nhau nhanh hơn 3,7 lần so với DeepSeek-V4-Flash – một mô hình tới 284 tỷ tham số. Câu nói đáng trích là: “Một mô hình đủ nhỏ nhưng được tối ưu cho agent có thể mở khóa những ứng dụng doanh nghiệp nơi độ trễ, quyền riêng tư và chi phí suy luận quan trọng hơn vị trí dẫn đầu benchmark”. Nói cách khác, thay vì ám ảnh về “mô hình to nhất”, LFM2.5-2.6B chứng minh rằng hiệu năng trên CPU đời thực và khả năng triển khai cục bộ mới là phép đo cần quan tâm trong kỷ nguyên edge computing.

LFM2.5-VL-3B: tầm nhìn ngôn ngữ cho AI di động và edge

Nếu LFM2.5-2.6B là cỗ máy chữ trên edge, thì LFM2.5-VL-3B là đôi mắt. Liquid AI đã phát hành LFM2.5-VL-3B, một mô hình tầm nhìn ngôn ngữ mở với 3,1 tỷ tham số, được xây để chạy trên điện thoại, laptop và card đồ họa đơn thay vì trong trung tâm dữ liệu. Trọng số mô hình có thể tải xuống ngay trên Hugging Face theo giấy phép trọng số mở, với xuất khẩu lượng tử GGUF, ONNX và MLX cùng hỗ trợ ngày đầu cho llama.cpp, MLX, vLLM, SGLang và nhiều runtime ONNX khác. Đây là định nghĩa rất rõ ràng của một mô hình AI nhỏ nhưng định hướng triển khai cục bộ và edge computing.

LFM2.5-VL-3B dùng bộ mã hóa tầm nhìn SigLIP2 400M NaFlex của Google kết hợp cùng xương sống được đào tạo trước như LFM2.5-2.6B, được huấn luyện trên khoảng 34 nghìn tỷ token với lượng dữ liệu tầm nhìn gấp bốn lần bản tiền nhiệm và từ vựng tăng gấp đôi lên 128.000 token. Mô hình đạt trung bình 69,4 trên 28 tiêu chuẩn tầm nhìn, tăng so với 57,2 của LFM2-VL-3B, và đạt 80,7 điểm trên ScreenSpot-v2 cho hiểu màn hình, vượt xa mô hình Gemma-4-E4B 8B tham số ở mức 50,9, dù vẫn dưới InternVL 3.5 4B với 84,2. Trên Apple M5 Max, tốc độ giải mã đạt 228 token/giây, trên Galaxy S26 Ultra khoảng 20 token/giây, dùng tầm 3 GB bộ nhớ và khoảng 11.000 token/giây trên một card H100 ở độ đồng thời cao.

Tại sao Small Language Model là lựa chọn thực tế cho triển khai cục bộ?

Các nhà phát triển LFM2.5-2.6B không cố gắng biến nó thành đối thủ của những mô hình biên giới khổng lồ; họ đưa ra luận điểm khác: một mô hình đủ nhỏ nhưng đủ tốt có thể mở khóa những ứng dụng doanh nghiệp nơi độ trễ, quyền riêng tư, linh hoạt triển khai hoặc chi phí suy luận quan trọng hơn việc dẫn đầu bảng điểm. Với việc LFM2.5-2.6B chạy rất tốt trên CPU, kiến trúc LFM2 được thiết kế xoay quanh hiệu năng CPU thực tế chứ không phải benchmark GPU. Điều này phù hợp logic edge computing: thay vì đẩy dữ liệu lên cloud, ta đưa mô hình đến gần dữ liệu. SLM vì thế trở thành giải pháp thực tế cho triển khai cục bộ và AI di động.

LFM2.5-2.6B phù hợp nhất với các tác vụ agent có tần suất cao, định nghĩa rõ và chạy cục bộ: tool calling, quản lý tài liệu, tự động hóa lịch và quy trình, các tác vụ nền luôn bật, cũng như môi trường hạn chế kết nối như xe cộ hoặc robot. Quan trọng hơn, cả mô hình đã hậu huấn luyện và checkpoint nền LFM2.5-2.6B-Base đều có trên Hugging Face, giúp đội ngũ kỹ sư fine-tune theo nhu cầu riêng. Với giấy phép trọng số mở, doanh nghiệp có thể thử nghiệm trên hạ tầng riêng, không bị tính phí theo từng lần sinh và không cần cho dữ liệu rời khỏi hệ thống. Đây không chỉ là lợi ích chi phí mà còn là vấn đề quyền kiểm soát.

Làn sóng AI di động mới: doanh nghiệp sẽ chọn gì sau LFM2.5?

Việc Liquid AI hoàn thiện dòng LFM2.5 với mô hình văn bản LFM2.5-2.6B, các biến thể bộ mã hóa tối ưu suy luận CPU dài và tầng tầm nhìn LFM2.5-VL-3B, tiếp theo là các bản nhỏ hơn LFM2.5-VL-1.6B và 450M, cho thấy chiến lược rõ ràng: không phải làm một “siêu mô hình duy nhất”, mà là một họ mô hình AI nhỏ phục vụ đủ nhu cầu edge computing và triển khai cục bộ. Người dùng có thể thử ngay trên điện thoại thông qua ứng dụng Apollo của Liquid AI, trong khi doanh nghiệp có thể đưa cùng một kiến trúc lên máy chủ nội bộ, laptop hay Raspberry Pi mà không thay đổi hoàn toàn stack.

Theo nhóm phát triển, mô hình được huấn luyện trong các framework agent như Hermes Agent và OpenClaw, tập trung vào tác vụ năng suất thực tế như nghiên cứu, coding, quản lý tài liệu và tự động hóa workflow. Họ khuyến nghị nên fine-tune cho môi trường production vì “nếu không fine-tune, bạn bỏ phí một phần chất lượng; nếu fine-tune tốt, mô hình có thể đạt mức GPT hay Claude với các tác vụ không quá phức tạp” và rào cản để fine-tune giờ rất thấp. Thông điệp gửi tới doanh nghiệp khá thẳng: đã đến lúc tự chủ với AI di động và Small Language Model, thay vì khóa mình trong hóa đơn đám mây và những mô hình không bao giờ chạm tới edge.

Sammfy nhận hoa hồng khi bạn mua sắm qua liên kết của chúng tôi, bạn không phải trả thêm chi phí. Bài viết này được tạo bằng AI từ các nguồn đã công bố và dữ liệu sản phẩm.

You May Also Like

Comments
Viết gì đó...
Chưa có bình luận nào. Hãy là người đầu tiên chia sẻ suy nghĩ!