Mini PC cluster AI là gì và vì sao đáng quan tâm?
Mini PC cluster AI là cụm nhiều mini PC cấu hình cao được liên kết với nhau để chạy chung một mô hình trí tuệ nhân tạo lớn, cho phép doanh nghiệp thực hiện inference on-premise với hiệu năng ổn định mà không cần phụ thuộc vào hạ tầng cloud bên ngoài. Geekom đang cho thấy một hướng đi rõ ràng cho xu hướng này khi phát hành cụm bốn A9 Mega mini PC chạy mô hình DeepSeek V4 Flash như một cluster phân tán nhắm tới workload AI doanh nghiệp. Đây không phải prototype phòng lab mà là thử nghiệm thực chiến với kiến trúc phần cứng lẫn phần mềm khá hoàn chỉnh.
Điểm đáng nói là toàn bộ cụm mini PC này giao tiếp với nhau qua USB4, thay vì cần switch chuyên dụng hay rack server truyền thống. Điều đó biến mỗi A9 Mega thành một "máy chủ AI compact" có thể xếp trên bàn làm việc nhưng vẫn gom lại thành một hệ thống inference on-premise đáng kể. Cách thiết kế này thách thức tư duy quen thuộc rằng muốn chạy mô hình lớn thì bắt buộc phải lên cloud hoặc xây cả phòng máy riêng.

DeepSeek V4 Flash chạy local: kiến trúc kỹ thuật và hiệu năng
Trái tim của cụm AGENT 4N là bốn chiếc GEEKOM A9 Mega, mỗi máy dùng AMD Ryzen AI Max+ 395 với 16 nhân Zen 5, GPU tích hợp Radeon 8060S và NPU XDNA-2. Mỗi mini PC hỗ trợ tới 128 GB LPDDR5X, hợp lại thành 512 GB bộ nhớ dùng cho distributed inference. Phần mềm Ubuntu, ROCm và DwarfStar chịu trách nhiệm chia mô hình DeepSeek V4 Flash lên từng nút, trong khi API tương thích OpenAI nối cluster với ứng dụng và agent AI.
Về con số cụ thể, Geekom cho biết cụm bốn máy đạt khoảng 14,61 tokens per second khi chỉ có một yêu cầu đồng thời, với thời gian P95 tới token đầu tiên khoảng 0,42 giây. Đây là tốc độ không dành cho chatbot phục vụ hàng nghìn người dùng công cộng, nhưng lại khá hợp lý cho các workload AI vừa và nhỏ trong doanh nghiệp, nơi độ trễ chấp nhận được miễn là dữ liệu ở lại bên trong. Nhờ API tương thích OpenAI, các nhóm dev có thể chuyển ứng dụng từ cloud API sang cụm local này mà không phải viết lại toàn bộ logic gọi mô hình.
Bảo mật dữ liệu và tự chủ hạ tầng: lợi thế lớn nhất của chạy AI local
Lý do quan trọng nhất để cân nhắc mini PC cluster AI không phải hiệu năng thuần túy, mà là quyền kiểm soát dữ liệu. Cấu hình này cho phép tổ chức giữ toàn bộ prompt, tài liệu, mã nguồn và thông tin đăng nhập trong hạ tầng nội bộ, không phải gửi qua cloud công cộng. Điều đó trực tiếp giảm rủi ro rò rỉ dữ liệu hợp đồng, báo cáo nội bộ hay tài liệu kỹ thuật nhạy cảm. Về bản chất, đây là một máy chủ AI compact chạy trong mạng LAN, nơi tất cả tính toán inference on-premise diễn ra phía sau firewall.
Một hệ quả thú vị là doanh nghiệp có thể xây trợ lý tri thức riêng, tra cứu hợp đồng, manual, report nội bộ mà không cần mở đường ra bên ngoài. Với agent-based system, Geekom còn mô tả khả năng xử lý tool, policy, memory và log trước khi thực thi hành động, với ngữ cảnh lên tới 250K tokens. Câu chuyện ở đây là: thay vì gửi mọi thứ lên API xa lạ, tổ chức giữ toàn bộ chuỗi xử lý trong không gian kiểm soát của mình – một điểm cộng lớn với các ngành tài chính, pháp lý, y tế, sản xuất.
Đầu tư ban đầu, mở rộng linh hoạt và giới hạn thực tế
Geekom thiết kế AGENT 4N theo hướng modul: doanh nghiệp có thể bắt đầu với một hoặc hai A9 Mega rồi mở rộng lên bốn nút khi workload tăng dần. Mỗi máy vẫn có thể dùng độc lập, trong khi khi cần thì liên kết lại cho distributed inference. Về phần cứng, A9 Mega hỗ trợ tới 120 W hiệu năng duy trì, hai khe M.2 PCIe Gen4x4 và tối đa 8 TB lưu trữ cấu hình RAID, cùng Wi‑Fi 7, Bluetooth 5.4, hai cổng 2.5G Ethernet và hỗ trợ bốn màn hình 8K.
Tuy vậy, cần nhìn thẳng vào giới hạn. Hiệu năng 14,61 tokens per second với một luồng đồng thời và thời gian tới token đầu tiên P95 0,42 giây vẫn là con số do nhà sản xuất công bố, chưa được xác nhận độc lập. Chưa có thông tin rõ ràng về phiên bản mô hình, mức quantization hay độ dài input. Nói cách khác, đây là lựa chọn hợp lý cho workload nội bộ vừa và nhỏ, nhưng không phải cây đũa thần thay thế hoàn toàn hạ tầng AI cloud ở quy mô lớn. Doanh nghiệp nên xem mini PC cluster AI như một phần của chiến lược AI lai – những tác vụ nhạy cảm, ổn định chạy local, còn nhu cầu bùng nổ, khó đoán vẫn dành cho cloud.






