Chạy LLM cục bộ là gì và bạn cần chuẩn bị những gì?
Chạy LLM cục bộ nghĩa là bạn vận hành các mô hình ngôn ngữ lớn ngay trên thiết bị của mình, từ GPU consumer hardware đến laptop và điện thoại cũ, để tạo ra mô hình AI offline có thể xử lý tác vụ văn bản, phân tích tài liệu và hỗ trợ năng suất mà không gửi dữ liệu ra internet. Bạn nên quan tâm nếu cần riêng tư, làm việc offline, hoặc muốn tận dụng đống phần cứng cũ vẫn còn chạy tốt. Điều kiện tiên quyết là có đủ RAM hoặc VRAM, chịu khó cài đặt phần mềm, và chấp nhận hiệu năng sẽ thấp hơn các mô hình “đỉnh” trên mây. Điểm mấu chốt đầu tiên: bất kỳ thiết bị nào bạn dùng nên có tối thiểu 8GB RAM, và 16GB thì tốt hơn. Trên PC có GPU mạnh, Muse Glimmer 30B chạy rất tốt trên RTX 5090 với bản Unsloth UD-Q4_K_XL nặng khoảng 20GB trên đĩa, dùng khoảng 27,6GB từ tổng 31,5GB VRAM khi chạy vòng agent đầy đủ. Với điện thoại, bạn sẽ cần cài một inference engine gọn nhẹ như llama.cpp, thông qua môi trường kiểu Termux trước khi nghĩ đến chuyện phục vụ model. Nếu có GPU RTX với ít nhất 24GB bộ nhớ, bạn còn được hỗ trợ các bộ cài 1-click cho OpenClaw, Hermes Agent và Perplexity Portable Computer, giúp giảm đáng kể công sức setup ban đầu.
| Spec | A | B |
|---|---|---|
| RAM tối thiểu cho laptop | 8GB | Khuyến nghị 16GB |
| VRAM cho RTX chạy agent lớn | 24GB+ | 32GB là điểm ngọt cho Muse Glimmer 30B |
Từ GPU 32GB tới luôn-on agent: Muse Glimmer 30B trên PC
Nếu bạn có một GPU consumer hardware với 32GB VRAM, đây là vùng đất lý tưởng để chơi với Muse Glimmer 30B. Đây là mô hình transformer dày khoảng 29,6B tham số, kèm bộ mã hóa hình ảnh 1,8B, được thiết kế từ đầu để làm agent luôn bật chứ không chỉ là chatbot tán gẫu. Quan trọng hơn benchmark là cách nó xử lý vòng tool: gọi công cụ, nuốt kết quả, ra quyết định tiếp theo, và tự hồi phục khi lệnh lỗi. Theo mô tả, “Muse Glimmer 30B trên RTX 5090 có thể đạt khoảng 110 token mỗi giây end-to-end với toàn bộ ngữ cảnh 131.072 token, không tràn sang bộ nhớ chia sẻ”. Bản Unsloth UD-Q4_K_XL dạng GGUF khoảng 20GB trên đĩa là lựa chọn hợp lý, vì KV cache của nó chỉ khoảng 52KiB mỗi token, giúp duy trì ngữ cảnh dài mà vẫn nằm gọn trong VRAM. Khi chạy bằng Lemonade, bạn có thêm draft decoding, xử lý hình ảnh và tool calling chỉ với vài ô tick, và toàn bộ vòng agent — từ schema, tool call, kết quả, đến quyết định tiếp theo — đều diễn ra trên máy trạm, không có bước nào chạm internet. Điều này biến PC của bạn thành một local AI server mạnh, giữ trọn dữ liệu nhạy cảm tại chỗ.
Ưu điểm
- Hiệu năng cao với ~110 token/giây trên GPU 32GB
- Tool calling được thiết kế sẵn, có khả năng tự phục hồi khi công cụ lỗi
- Toàn bộ vòng xử lý và tài liệu (kể cả hình ảnh hóa đơn, hợp đồng) không rời khỏi máy
Nhược điểm
- Cần GPU RTX cao cấp với 24–32GB VRAM
- Thiết lập agent phức tạp nếu không dùng sẵn giao diện hỗ trợ
- Mô hình lớn, không phù hợp cho máy tính xách tay yếu

Biến điện thoại lỗi thời thành local AI server với llama.cpp
Phần thú vị nhất của việc chạy mô hình AI offline là nhận ra: một chiếc điện thoại cũ vẫn có thể trở thành local AI server hữu ích. Có người đã dùng một chiếc Poco M6 Pro rẻ tiền, vốn chỉ dùng để chạy vài dịch vụ container đơn giản, rồi phát hiện rằng với một chút llama.cpp optimization, nó có thể xử lý các tác vụ năng suất nhẹ nhàng. Trọng tâm là chọn inference engine thật nhẹ, tránh các ứng dụng GUI cồng kềnh, và tận dụng môi trường dòng lệnh như Termux để kiểm soát tài nguyên. Gemma 4 E2B dạng Q4_M_K là ví dụ điển hình: khi chạy qua llama.cpp trên chiếc điện thoại cũ đó, hiệu năng ổn định ở khoảng 5–6 token mỗi giây, vẫn đủ đáp ứng ghi chú, tóm tắt, và hỗ trợ công việc nhẹ bên cạnh các container khác. Quan trọng là mô hình chạy hoàn toàn cục bộ, nên bạn có một mô hình AI offline bên trong túi, giúp soạn email, sinh văn bản hoặc nhắc việc mà không cần kết nối mạng nữa. Bạn cần chuẩn bị tâm lý là mọi thứ sẽ chậm hơn đáng kể so với PC, nhưng cho nhu cầu tối thiểu, nó đáng công thử.
- Cài Termux và cho phép truy cập bộ nhớ điện thoại, vì đây sẽ là môi trường để bạn biên dịch và chạy llama.cpp.
- Cài các gói phụ thuộc bằng lệnh apt install git cmake libandroid-spawn để chuẩn bị biên dịch inference engine.
- Dùng git clone https://github.com/ggml-org/llama.cpp rồi chuyển vào thư mục mới tạo bằng cd llama.cpp.
- Chạy cmake -B build và cmake --build build --config Release; nếu máy quá chậm, hủy và thay bằng cmake --build build --config Release -j 8 để biên dịch song song 8 job cho nhanh hơn.
- Chép file gguf và mmproj của Gemma 4 E2B vào bộ nhớ, rồi chạy ./llama-server -m “/storage/emulated/0/Download/LLMs/Gemma-4-E2B-it-Q4_M_K.gguf” -mmproj “/storage/emulated/0/Download/LLMs/mmproj-gemma-4-E4B-it-BF16.gguf” -c 100000 --host 0.0.0.0 --port 8080 để dựng local AI server trên điện thoại.
Laptop 8GB RAM và GPU RTX 24GB+: mô hình miễn phí cho việc hàng ngày
Một chiếc laptop cũ không phải thứ bạn nghĩ đến khi nói về chạy LLM cục bộ, nhưng nếu chọn đúng mô hình AI offline, nó vẫn phục vụ tốt nhiều việc thường ngày. Điều kiện cơ bản là ít nhất 8GB RAM, và lý tưởng là 16GB. Các mô hình nhỏ tầm 4–12 tỷ tham số có thể chạy ổn trên CPU, và nếu laptop có GPU, bạn có thể thử các model nhanh hơn. Có những ứng dụng miễn phí, mã nguồn mở giúp chuyện này trở nên dễ chịu: một ứng dụng dạng “studio cục bộ” dùng Ollama để kéo model, hỗ trợ RAG với tài liệu PDF, bảng tính, rồi cho bạn trò chuyện với dữ liệu ngay trên máy; một ứng dụng khác đóng vai chatbot bóng bẩy tích hợp luôn bộ tải model, inference engine và giao diện chat, hạn chế phải đụng tới dòng lệnh. Bạn cần giữ kỳ vọng hợp lý: 8GB hay 16GB RAM không thể mang lại khả năng suy luận ngang các frontier model trên mây. Lỗi phổ biến là chọn model quá lớn, khiến máy ì ạch hoặc treo. Nếu bạn cẩn thận với ứng dụng và kích thước mô hình, đây là cách dễ “ăn điểm” về riêng tư và chi phí, nhất là khi phân tích sao kê ngân hàng, hồ sơ bệnh án hay tài liệu thuế mà bạn không muốn tải lên internet.
Những lỗi thường gặp khi chạy LLM trên hardware yếu là gì?
Một là chọn mô hình quá lớn: người dùng 8–16GB RAM hay kỳ vọng năng lực suy luận ngang model đám mây, dẫn đến chậm và đơ. Hai là agent dùng model nhỏ hoặc trung bình gọi sai tool, hoặc hoảng loạn khi lệnh lỗi, trong khi model lớn đủ khỏe lại không vừa một GPU consumer hardware. Ba là biên dịch llama.cpp trên điện thoại bằng thiết lập mặc định khiến thời gian build kéo dài vô lý; giải pháp là dùng tuỳ chọn -j 8 để chạy nhiều job song song.
RTX 24GB+ và tương lai 1-click cho local AI agent
Nếu bạn đang sở hữu một PC với GPU RTX có từ 24GB bộ nhớ trở lên, bạn gần như đứng ở cửa ngõ của thế hệ local AI agent được đóng gói 1-click. Hiện tại, để chạy agent với OpenClaw hoặc Hermes Agent, bạn vẫn phải tự tay chọn inference engine kiểu LM Studio hay Ollama và tự chọn LLM phù hợp với hệ thống cùng kịch bản dùng. Nhưng các bộ cài 1-Click-Installer được hứa hẹn sẽ xuất hiện, giúp tự động hóa cả việc chọn engine lẫn model, hướng tới nhóm người dùng không quá rành kỹ thuật. Điều kiện là GPU RTX tương thích với ít nhất 24GB bộ nhớ, dù là VRAM riêng hay unified memory. Song song đó, mô hình như Muse Glimmer 30B cho thấy trên card 32GB, bạn đã có thể giữ toàn bộ vòng agent trên workstation, không hề chạm internet. Trên đầu kia của phổ phần cứng, một chiếc điện thoại cũ chạy Gemma 4 E2B qua llama.cpp vẫn đạt 5–6 token mỗi giây cho các tác vụ năng suất. Từ laptop 8GB đến GPU 32GB, điểm chung là: khi bạn chạy LLM cục bộ, dữ liệu nhạy cảm như hóa đơn, hợp đồng thuê nhà hay sao kê ngân hàng đều ở lại trong máy, và đó là lý do lớn khiến công sức thiết lập rất đáng bỏ ra.





