Phần 2 – Chọn máy để chạy Local AI: CPU, GPU, RAM và VRAM quan trọng thế nào?
Sau khi hiểu Local AI là gì, câu hỏi tiếp theo thường là:Và nếu mua một máy mới:Máy của tôi có chạy được Local AI không?
Câu trả lời ngắn gọn là:Nên ưu tiên CPU, GPU, RAM hay VRAM?
Đối với Local LLM, dung lượng bộ nhớ thường quan trọng không kém, thậm chí trong nhiều trường hợp còn quan trọng hơn sức mạnh tính toán thuần túy của GPU.
1. Trước tiên: bạn muốn chạy model cỡ nào?
Local LLM thường được gọi theo số lượng parameter:3B
7B
8B
14B
20B
32B
70B
120B
...
Trong đó:
B = billion parameters
Ví dụ:
8B ≈ 8 tỷ parameter
32B ≈ 32 tỷ parameter
70B ≈ 70 tỷ parameter
Model càng lớn thường càng cần nhiều bộ nhớ.
Tuy nhiên dung lượng thực tế còn phụ thuộc vào quantization:
FP16
Q8
Q6
Q5
Q4
Q3
Trong thế giới Local AI, Q4 và Q5 rất phổ biến vì cho tỷ lệ khá tốt giữa:
chất lượng / tốc độ / dung lượng bộ nhớ.
2. VRAM là gì và tại sao cực kỳ quan trọng?
VRAM là bộ nhớ nằm trên GPU.Ví dụ:
GPU 8 GB VRAM
GPU 12 GB VRAM
GPU 16 GB VRAM
GPU 24 GB VRAM
GPU 48 GB VRAM
Khi chạy Local LLM, lý tưởng nhất là:
Toàn bộ model
↓
nằm trong VRAM
Khi đó GPU có thể xử lý model mà không phải liên tục trao đổi dữ liệu với RAM hệ thống.
Nếu model lớn hơn VRAM:
Model
├── một phần → VRAM
└── một phần → RAM
hệ thống vẫn có thể chạy được với một số runtime, nhưng thường chậm hơn.
Đây gọi là CPU/GPU offloading hoặc chia model giữa CPU và GPU.
3. Vì sao GPU 24 GB đôi khi hữu ích hơn GPU mới nhưng chỉ có 12 GB?
Giả sử:GPU A
12 GB VRAM
rất nhanh
và:
GPU B
24 GB VRAM
chậm hơn
Nếu model cần khoảng 20 GB bộ nhớ, GPU A không thể chứa toàn bộ model.
GPU B lại có thể.
Do đó đối với Local AI:
Phải nhìn thêm:Không nên chỉ nhìn benchmark gaming hay số CUDA core.
VRAM.
Đây cũng là lý do một số GPU workstation hoặc GPU thế hệ cũ có nhiều VRAM vẫn rất được người chơi Local AI quan tâm.
4. Bao nhiêu VRAM là hợp lý?
Có thể chia tương đối như sau.8 GB VRAM
Phù hợp để bắt đầu.Có thể chạy tốt các model nhỏ như:
3B
7B
8B quantized
Phù hợp:
- chatbot
- dịch
- tóm tắt
- AI assistant nhẹ
- coding cơ bản.
12 GB VRAM
Đây là mức khá dễ sử dụng.Phù hợp:
7B
8B
12B
14B tùy quantization
Có thể làm:
- coding
- RAG
- chatbot
- tool calling
- AI assistant.
16 GB VRAM
Bắt đầu khá thoải mái.Có thể chạy:
8B
14B
20B ở một số cấu hình
và có thêm không gian cho context.
24 GB VRAM
Đây là một trong những mức rất hấp dẫn cho Local AI cá nhân.Có thể chạy nhiều model:
8B
14B
20B
24B
32B Q4
Trong thực tế, 24 GB mở ra rất nhiều lựa chọn model mà GPU 8–12 GB không thể chứa hoàn toàn.
32–48 GB VRAM
Bắt đầu bước sang workstation AI.Phù hợp:
- model lớn
- context dài
- nhiều request
- VLM
- RAG lớn
- nhiều model cùng lúc.
80 GB VRAM trở lên
Đây chủ yếu là vùng server/datacenter.Phù hợp:
- model rất lớn
- nhiều user
- batching
- inference production.
5. RAM hệ thống có quan trọng không?
Có. Rất quan trọng.Nếu model không nằm hết trong GPU thì phần còn lại phải nằm trong RAM.
Ngoài model, hệ thống còn cần RAM cho:
- hệ điều hành
- ứng dụng
- KV cache
- embedding
- vector database
- document processing
- browser
- IDE
- Docker.
6. 16 GB RAM
16 GB vẫn có thể chơi Local AI.Nhưng nên giới hạn ở:
3B
7B
8B nhỏ
Nếu vừa chạy:
LLM
+
Chrome
+
VS Code
+
Docker
thì 16 GB khá dễ đầy.
Do đó 16 GB phù hợp hơn với:
thử nghiệm Local AI.
7. 32 GB RAM
Đây là mức tôi cho rằng hợp lý để bắt đầu sử dụng Local AI nghiêm túc.Có thể thoải mái hơn với:
7B
8B
14B
và vẫn còn không gian cho:
- IDE
- browser
- database
- RAG
- Docker.
32 GB hiện là mức khá cân bằng.
8. 64 GB RAM
64 GB mở ra nhiều khả năng hơn đáng kể.Bạn có thể thử:
14B
20B
32B
70B quantized trong một số trường hợp
đặc biệt khi dùng llama.cpp và offload một phần model lên GPU.
64 GB cũng phù hợp với:
- coding project lớn
- RAG
- database
- Docker
- AI server.
9. 128 GB RAM trở lên
Đây bắt đầu là workstation Local AI thực sự.Có thể phục vụ:
- model 70B
- MoE
- context lớn
- nhiều service AI
- nhiều người dùng.
Đổi lại tốc độ sẽ thấp hơn chạy hoàn toàn trên GPU.
10. CPU có quan trọng không?
Có, nhưng nếu mục tiêu chính là LLM inference thì thường không phải thành phần đầu tiên nên dồn toàn bộ ngân sách.CPU chịu trách nhiệm cho:
- tokenization
- model loading
- một phần inference
- preprocessing
- embedding
- RAG
- database
- application logic.
memory bandwidth đặc biệt quan trọng.
CPU nhiều core cũng giúp, nhưng tăng core không đồng nghĩa tốc độ LLM sẽ tăng tuyến tính.
11. Có thể chạy AI hoàn toàn bằng CPU không?
Có.Các runtime như llama.cpp hỗ trợ inference trên CPU và cả mô hình kết hợp CPU + GPU.
Ví dụ:
32B Q4
│
├── 16 GB → GPU
│
└── phần còn lại → RAM
Nhờ vậy một máy không có GPU đủ lớn vẫn có thể chạy model.
Nhược điểm là:
token/giây thường thấp hơn đáng kể so với khi model nằm hoàn toàn trong GPU.
12. SSD quan trọng đến mức nào?
Model AI chiếm rất nhiều dung lượng.Một người chơi Local AI rất dễ có:
Model A 5 GB
Model B 10 GB
Model C 20 GB
Model D 40 GB
Embedding models
Vision models
Image models
Chỉ sau một thời gian:
200–500 GB
model là chuyện bình thường.
Do đó:
512 GB SSD
Đủ thử nghiệm nhưng nhanh đầy.1 TB
Mức khá hợp lý.2 TB
Tốt cho người dùng AI thường xuyên.4 TB+
Hợp lý nếu lưu:- nhiều LLM
- Stable Diffusion/Flux
- dataset
- video
- embeddings.
13. NVIDIA hay AMD?
NVIDIA
Hiện vẫn là lựa chọn rất phổ biến trong hệ sinh thái AI vì CUDA có độ tương thích phần mềm rộng.Nhiều framework AI ưu tiên NVIDIA trước.
Nếu mục tiêu là:
Local AI
+
Stable Diffusion
+
training
+
fine-tuning
+
CUDA applications
NVIDIA thường là lựa chọn dễ triển khai.
14. AMD có chạy được không?
Có.Hệ sinh thái Local AI ngày càng hỗ trợ AMD tốt hơn qua:
- ROCm
- Vulkan
- llama.cpp.
Điểm cần kiểm tra trước khi mua là:
phần mềm bạn dự định sử dụng có hỗ trợ GPU cụ thể đó tốt hay không.
15. Apple Silicon thì sao?
Apple Silicon có một lợi thế rất đặc biệt:Unified Memory.
Thay vì:
CPU RAM
+
GPU VRAM
Mac sử dụng vùng bộ nhớ thống nhất giữa CPU và GPU.
Ví dụ:
64 GB Unified Memory
GPU có thể truy cập phần lớn vùng bộ nhớ chung này.
Điều này đặc biệt hữu ích cho model lớn.
LM Studio hiện hỗ trợ cả llama.cpp và MLX trên Apple Silicon.
Do đó Mac có:
64 GB
96 GB
128 GB
Unified Memory có thể chạy những model mà GPU PC 12–16 GB VRAM không thể chứa hoàn toàn.
Nhược điểm là NVIDIA vẫn có lợi thế mạnh về một số workload AI chuyên dụng, training và hệ sinh thái CUDA.
16. Context length cũng ăn bộ nhớ
Một lỗi phổ biến là chỉ nhìn dung lượng file model.Ví dụ:
Model = 20 GB
VRAM = 24 GB
không có nghĩa chắc chắn mọi workload đều vừa.
Khi context tăng:
8K
32K
64K
128K
KV cache cũng tăng theo.
Đặc biệt với coding agent đọc repository lớn, context dài có thể tiêu tốn thêm rất nhiều RAM/VRAM.
Ollama hiện cũng khuyến nghị context lớn cho các coding tool; tài liệu của họ đưa ví dụ một model chạy 64K context có thể cần khoảng 23 GB VRAM.
17. Cấu hình đề xuất theo nhu cầu
Cấu hình A – Bắt đầu chơi Local AI
CPU: Core i5 / Ryzen 5RAM: 16–32 GB
GPU: 8 GB VRAM
SSD: 1 TB
Phù hợp:
- học Local AI
- 3B–8B
- chat
- coding nhẹ.
Cấu hình B – Developer Local AI
CPU: Core i7 / Ryzen 7RAM: 32–64 GB
GPU: 12–16 GB VRAM
SSD: 1–2 TB
Phù hợp:
- AI coding
- RAG
- API local
- agent
- 7B–14B.
Cấu hình C – Local AI mạnh
CPU: Core i9 / Ryzen 9RAM: 64–128 GB
GPU: 24 GB VRAM
SSD: 2 TB+
Phù hợp:
- 14B
- 20B
- 32B
- coding agent
- VLM
- RAG lớn.
Cấu hình D – AI Workstation
RAM: 128 GB+GPU: 32–48 GB VRAM+
SSD: 4 TB+
hoặc:
Apple Silicon
64–128 GB+ Unified Memory
Phù hợp:
- 32B
- 70B
- MoE
- AI server
- nhiều agent
- nhiều user.
18. Quy tắc chọn máy đơn giản
Nếu mục tiêu là Local LLM, có thể ưu tiên theo thứ tự:1. Model muốn chạy
↓
2. VRAM / Unified Memory
↓
3. RAM
↓
4. Memory bandwidth
↓
5. GPU compute
↓
6. CPU
↓
7. SSD
Không phải lúc nào GPU benchmark cao nhất cũng là lựa chọn Local AI tốt nhất.
Ví dụ:
Một GPU có 24 GB VRAM đôi khi hữu ích hơn rất nhiều so với GPU mạnh hơn nhưng chỉ có 8 hoặc 12 GB VRAM.
Kết luận
Khi xây máy Local AI, hãy bắt đầu từ câu hỏi:sau đó mới chọn phần cứng.Tôi muốn chạy model bao nhiêu B?
Có thể ghi nhớ ba mốc:
32 GB RAM + 8–12 GB VRAM
→ Local AI cơ bản
64 GB RAM + 16–24 GB VRAM
→ Local AI mạnh
128 GB RAM + 24–48 GB VRAM
→ AI Workstation
Và nếu hướng tới model lớn:
dung lượng bộ nhớ thường là yếu tố quyết định trước khi sức mạnh GPU trở thành vấn đề.