AI giá rẻ, chạy cục bộ: cuộc chơi không còn thuộc về data center
Chạy AI trên phần cứng giá rẻ là cách đưa suy luận AI cục bộ, offline vào laptop, vi điều khiển và nền tảng nhúng mà không cần trung tâm dữ liệu, cho phép nhà phát triển xây dựng ứng dụng thông minh ở sát thiết bị, tiết kiệm năng lượng và giảm phụ thuộc kết nối mạng. Quan điểm đáng nói ở đây là: thời của “AI chỉ nằm trên cloud” đang kết thúc, và ba hướng tiếp cận mới – tăng tốc AI USB, vi điều khiển AI và Vision AI nhúng – đang âm thầm định nghĩa lại cách chúng ta thiết kế hệ thống.
Bộ tăng tốc AI USB MLD-R1, một mô hình LLM nhỏ chạy trên vi điều khiển ESP32-S3 và nền tảng Banana Pi BPI-AI2N là ba ví dụ cho thấy suy luận AI cục bộ không còn là đặc quyền của phần cứng đắt tiền nữa. Điểm chung của chúng là thay đổi góc nhìn: thay vì nâng cấp cả hệ thống, ta ghép thêm “bộ não” AI vào đúng nơi cần thiết. Đây là cơ hội lớn cho nhà phát triển nhúng, robot, camera công nghiệp và cả những người đam mê DIY muốn thử nghiệm AI on-device trên ngân sách hạn chế.

Tăng tốc AI USB MLD-R1: ghép thêm ‘GPU AI’ qua cổng USB
MLD-R1 là dạng tăng tốc AI USB cho những ai đã có PC, laptop hoặc hệ thống nhúng nhưng thiếu sức mạnh AI. Thiết bị này tích hợp chip AI REGULUS do chính Mobilint phát triển và kết nối qua USB 3.1 Gen1 Type-C, tương thích cả Windows lẫn Linux trên nền x86 và ARM. Nói thẳng: đây là cách “độ” AI cho máy hiện có mà không phải mở thùng, đổi main hay lắp card mới.
Về lõi, MLD-R1 đạt tối đa 10 TOPS (INT8) với mức tiêu thụ khoảng 3W và đi kèm 4GB hoặc 8GB LPDDR4X. Theo Mobilint, “MLD-R1 đạt hiệu năng AI tối đa 10TOPS (INT8) với mức tiêu thụ điện khoảng 3W”. Thiết bị xử lý tốt thị giác máy, phân tích video và cả các mô hình tạo sinh cỡ nhỏ 1–3 tỷ tham số. Quan trọng hơn, nó hỗ trợ PyTorch, ONNX, TensorFlow và Hugging Face, giúp nhà phát triển chuyển mô hình sang suy luận AI cục bộ mà không phải học lại toolchain mới. Với những ai cần tăng tốc AI USB cắm là chạy, MLD-R1 là lựa chọn khá thuyết phục.
| Thông số | MLD-R1 (USB AI) | Ghi chú |
|---|---|---|
| Hiệu năng AI | 10 TOPS INT8 | Tối ưu cho suy luận on-device |
| Công suất | ≈3W | Phù hợp thiết bị di động, nhúng |
| Bộ nhớ | 4GB hoặc 8GB LPDDR4X | Đủ cho model thị giác, LLM nhỏ |
| Kết nối | USB 3.1 Gen1 Type-C | Cắm vào laptop, PC công nghiệp |
| Nền tảng host | Windows, Linux; x86, ARM | Linh hoạt trong triển khai |
Vi điều khiển ESP32-S3: LLM tí hon, bài học lớn về kiến trúc
Ở đầu kia phổ hiệu năng là vi điều khiển AI, mà ESP32-S3 là ví dụ nổi bật. Một nhà phát triển đã cho một mô hình ngôn ngữ 28,9 triệu tham số chạy trên ESP32-S3 – vốn được thiết kế cho nút cảm biến và ổ cắm thông minh – với tốc độ khoảng 9,88 token mỗi giây, hoàn toàn offline và không gửi dữ liệu ra ngoài chip. Đây không phải phép màu, mà là sự kết hợp giữa lượng tử hóa 4-bit và bố trí lại kiến trúc bộ nhớ.
Trên con chip chỉ có 512KB SRAM và 8MB PSRAM, việc dồn mô hình vào bộ nhớ nghe như bất khả thi. Thủ thuật là đưa khoảng 25 triệu tham số – chủ yếu là embedding – vào flash 16MB, chỉ đọc vài trăm byte mỗi token. Phần lõi tính toán còn lại nằm trong PSRAM và SRAM khoảng 2MB. Kết quả là một LLM TinyStories tạo ra những đoạn truyện ngắn, tương đối mạch lạc, nhưng gần như không làm được Q&A, không theo hướng dẫn, không viết code, không chứa tri thức rộng. Chính tác giả cũng thừa nhận cách này “không làm mô hình nhỏ trở nên thông minh hơn”, chỉ giúp chúng chạy được trên board mà trước đây không thể, và hiện nay “có giá trị thực tế còn hạn chế”.

Banana Pi BPI-AI2N: Vision AI nhúng cho camera và công nghiệp
Nếu MLD-R1 là “card rời” cho AI và ESP32-S3 là bài thử nghiệm cực hạn, thì Banana Pi BPI-AI2N đại diện cho xu hướng Vision AI nhúng ở mức hệ thống. Nền tảng này kết hợp một system-on-module dựa trên Renesas RZ/V2N Vision AI MPU với bo carrier dành cho camera thông minh, thị giác công nghiệp, robot và các ứng dụng edge AI khác. Đây không phải toy project mà là nền tảng cho hệ sinh thái camera và robot có thể triển khai ngoài thực địa.
RZ/V2N tích hợp bốn nhân Arm Cortex-A55 lên đến 1,8GHz, kèm một nhân Cortex-M33 200MHz cho xử lý thời gian thực. Điểm nhấn là bộ tăng tốc DRP-AI3 với hiệu năng tới 15 TOPS AI thưa (sparse), cao hơn MLD-R1 về con số thô. Ngoài ra còn có GPU Mali-G31 và bộ xử lý tín hiệu ảnh Mali-C55 để xử lý đồ họa và pipeline camera. Nói cách khác, BPI-AI2N là “máy chủ mini” chuyên cho Vision AI nhúng: từ smart camera nhận diện vật thể, đếm người, đến hệ thống kiểm tra lỗi trên dây chuyền sản xuất – tất cả có thể chạy suy luận AI cục bộ ngay tại biên mạng.
| Thông số | MLD-R1 (USB) | BPI-AI2N (RZ/V2N) |
|---|---|---|
| Hiệu năng AI | 10 TOPS INT8 | 15 TOPS sparse DRP-AI3 |
| CPU chính | Phụ thuộc máy chủ | 4× Arm Cortex-A55 @1,8GHz |
| Công suất | ≈3W | Không nêu rõ |
| Trọng tâm ứng dụng | Tăng tốc thêm cho PC/nhúng | Vision AI nhúng, camera, robot |

Ba lựa chọn, một tinh thần chung: suy luận AI cục bộ, không cần mạng
Đặt ba giải pháp cạnh nhau, ta thấy mỗi cái chạm tới một tầng khác nhau của hệ sinh thái phần cứng AI giá rẻ. MLD-R1 là tăng tốc AI USB cho những hệ thống đã có hạ tầng máy tính; BPI-AI2N là nền tảng Vision AI nhúng chuyên dụng; ESP32-S3 với LLM 28,9M tham số là chứng minh rằng vi điều khiển AI có thể chạy mô hình ngôn ngữ cục bộ với tốc độ gần 10 token mỗi giây. Tất cả đều chung mục tiêu: suy luận AI cục bộ, không phải phụ thuộc cloud.
Dù vậy, chúng cũng chia sẻ những giới hạn không nên bỏ qua. LLM trên ESP32-S3 bị bó hẹp khả năng: chỉ viết truyện ngắn, không trả lời câu hỏi, không theo lệnh, không biết sự kiện hay kiến thức. Ngay cả tác giả cũng thừa nhận cách làm này hiện có “giá trị thực tế còn hạn chế”. MLD-R1 và BPI-AI2N dù mạnh hơn, vẫn phải cân bằng giữa công suất, bộ nhớ và độ phức tạp mô hình. Kết luận hợp lý là: thay vì cố nhồi mọi thứ như trên cloud, nhà phát triển cần thiết kế lại mô hình và trải nghiệm người dùng cho phù hợp với giới hạn phần cứng. AI on-device rẻ không phải bản sao giảm cấp của AI trên server, mà là một thiết kế khác hẳn – nơi tối ưu hóa, sáng tạo và chọn đúng bài toán quan trọng hơn chạy được model “khủng”.








