Chạy mô hình LLM nhỏ trên vi điều khiển và bộ tăng tốc AI USB

Chạy mô hình LLM nhỏ trên vi điều khiển và bộ tăng tốc AI USB
Sở thích|Phần cứng mã nguồn mở

AI trên vi điều khiển: suy luận cục bộ giá rẻ là gì và vì sao đáng quan tâm

AI trên vi điều khiển là cách triển khai các mô hình LLM nhỏ và những mô hình học sâu khác trực tiếp trên bo mạch có tài nguyên rất hạn chế, cho phép suy luận cục bộ giá rẻ, không cần kết nối mạng, phù hợp cho cảm biến, thiết bị IoT và hệ thống nhúng tiết kiệm năng lượng.

Điểm đáng chú ý là một nhà phát triển với bí danh slvDev đã chạy một mô hình ngôn ngữ 28,9 triệu tham số trên vi điều khiển ESP32-S3 và đạt tốc độ khoảng 9,88 token mỗi giây, với toàn bộ xử lý diễn ra trên chip và không có dữ liệu nào rời khỏi thiết bị. Điều này biến AI không kết nối mạng từ ý tưởng thành giải pháp thực tế. Một mô hình như vậy không cạnh tranh với các LLM lớn trên đám mây, nhưng nó mở ra lớp ứng dụng mới: cảm biến thông minh, thiết bị ngoại tuyến, hệ thống an ninh và robot nhỏ có thể tự “hiểu” dữ liệu tại chỗ mà không cần gửi đi đâu. Nếu bạn coi chi phí và quyền riêng tư là ưu tiên, đây là hướng đi đáng để thử, không phải trò chơi thử nghiệm.

Bên trong mô hình LLM nhỏ trên ESP32-S3: giới hạn và thủ thuật

Dự án esp32-ai cho thấy cộng đồng phát triển đang tối ưu hóa các mô hình AI nhỏ để chạy trên phần cứng hạn chế, thay vì chờ đợi phần cứng mạnh hơn xuất hiện. ESP32-S3 chỉ có vài trăm KB RAM và một ít PSRAM, nhưng mô hình 28,9 triệu tham số vẫn được nhét vào bằng hai chiến lược: lượng tử hóa xuống 4 bit và đẩy phần lớn trọng số ra bộ nhớ flash ngoài. Trích một câu dễ trích dẫn: “một mô hình 28,9 triệu tham số chạy trên ESP32-S3 ở tốc độ 9,88 token/giây với toàn bộ xử lý nằm trên chip”.

Cách làm này không miễn phí: mô hình chỉ viết được những câu chuyện ngắn, tương đối mạch lạc và không trả lời câu hỏi, không làm theo hướng dẫn, không viết mã, không biết sự kiện. Phần “bộ não” suy luận thực tế chỉ khoảng vài triệu tham số, nên không thể mong đợi hành vi như các LLM lớn. Chính tác giả cũng thừa nhận cách tiếp cận này không làm mô hình nhỏ trở nên thông minh hơn, mà chỉ cho phép chúng chạy trên bo mạch trước đây không thể đảm đương, đồng thời vẫn có tính ứng dụng thực tế khá hạn chế trong phiên bản hiện tại.

Bộ tăng tốc AI USB MLD-R1: thêm sức mạnh cho thiết bị hiện có

Nếu bạn không muốn gò một mô hình LLM nhỏ vào vi điều khiển, bộ tăng tốc AI USB là lựa chọn khác cho suy luận cục bộ giá rẻ. Ngày 7/8, Mobilint ra mắt phiên bản thương mại của MLD-R1, một bộ tăng tốc AI kết nối qua USB để bổ sung năng lực suy luận cho laptop, PC công nghiệp và hệ thống nhúng mà không cần thay đổi phần cứng lớn. Đây là bộ tăng tốc AI thương mại đầu tiên của hãng ở dạng USB, tích hợp chip REGULUS do chính họ phát triển.

MLD-R1 đạt hiệu năng tối đa 10 TOPS ở định dạng INT8, tiêu thụ khoảng 3W điện và đi kèm bộ nhớ LPDDR4X dung lượng 4GB hoặc 8GB. Câu nói dễ trích là: “MLD-R1 đạt hiệu năng AI tối đa 10TOPS (INT8) với mức tiêu thụ điện khoảng 3W”. Nhờ vậy, thiết bị có thể xử lý thị giác máy, phân tích video và cả các mô hình AI tạo sinh, bao gồm mô hình ngôn ngữ cỡ nhỏ từ 1 đến 3 tỷ tham số. Mobilint cho biết MLD-R1 tương thích với các framework phổ biến như PyTorch, ONNX, TensorFlow và Hugging Face, giúp nhà phát triển rút ngắn thời gian triển khai.

Chạy mô hình LLM nhỏ trên vi điều khiển và bộ tăng tốc AI USB

Khi nào nên chọn vi điều khiển, khi nào nên chọn bộ tăng tốc AI USB

Vi điều khiển với mô hình LLM nhỏ phù hợp khi bạn cần AI không kết nối mạng, siêu tiết kiệm năng lượng và chi phí phần cứng thấp cho mỗi nút cảm biến. Dự án trên ESP32-S3 cho thấy có thể tạo mô hình tạo văn bản dạng TinyStories chạy ngoại tuyến với tốc độ gần 10 token/giây. Tuy nhiên, khả năng của mô hình này rất hạn chế và khó áp dụng cho các tác vụ phức tạp hoặc yêu cầu độ chính xác cao. Đó là cái giá phải trả cho việc ép AI lên phần cứng cực nhỏ – bạn chấp nhận tính năng tối giản để đổi lấy việc triển khai ở quy mô cực rộng.

Ngược lại, bộ tăng tốc AI USB như MLD-R1 nhắm đến những thiết bị đã có CPU x86 hoặc ARM, nhưng cần thêm sức mạnh AI cục bộ để xử lý thị giác máy, robot, tự động hóa công nghiệp, an ninh, thiết bị y tế và biển hiệu kỹ thuật số. Nhờ hiệu năng 10 TOPS (INT8) trong khoảng 3W, MLD-R1 giúp bạn đưa mô hình LLM nhỏ và mô hình thị giác mạnh hơn lên thiết bị hiện có, mà vẫn giữ được mức tiêu thụ điện hợp lý. Lựa chọn nằm ở chỗ: bạn muốn mỗi nút rẻ và đơn giản với AI tối thiểu, hay muốn nâng cấp hẳn một lớp thiết bị với sức mạnh AI tương đối mạnh?

Kết luận: suy luận cục bộ giá rẻ là cuộc chơi của cộng đồng và hệ sinh thái

Điểm chung giữa mô hình LLM nhỏ trên ESP32-S3 và bộ tăng tốc AI USB MLD-R1 là tinh thần “AI on-device” do cộng đồng và các nhà sản xuất cùng thúc đẩy. Offloading trọng số ra bộ nhớ lưu trữ đã lâu không mới, nhưng các nhà phát triển đang biến thủ thuật đó thành công cụ thực tế để ép các mô hình vốn dành cho máy mạnh xuống những bo mạch không sinh ra cho việc đó. Đồng thời, các công ty như Mobilint lại đưa chip AI riêng vào bộ tăng tốc USB và mở rộng dần sang card AI, AI Box để xây dựng hệ sinh thái hoàn chỉnh cho AI cục bộ.

Nếu bạn là kỹ sư nhúng, nhà sản xuất thiết bị công nghiệp hay startup IoT, thời điểm thử nghiệm suy luận cục bộ giá rẻ chính là bây giờ. Hãy bắt đầu với mô hình LLM nhỏ trên vi điều khiển cho các ứng dụng cần mức thông minh cơ bản, và chuyển sang bộ tăng tốc AI USB khi bạn cần hiệu năng 10 TOPS, hỗ trợ mô hình lớn hơn và vẫn giữ quyền kiểm soát dữ liệu tại chỗ. Tương lai của AI không chỉ nằm trong trung tâm dữ liệu, mà còn nằm trên những bo mạch nhỏ xíu và các thiết bị USB khiêm tốn ngay trên bàn làm việc của bạn.

Sammfy nhận hoa hồng khi bạn mua sắm qua liên kết của chúng tôi, bạn không phải trả thêm chi phí.

Related Products

You May Also Like

Comments
Viết gì đó...
Chưa có bình luận nào. Hãy là người đầu tiên chia sẻ suy nghĩ!