Local AI và Local LLM: Chạy trí tuệ nhân tạo ngay trên máy tính của bạn
Trong vài năm gần đây, khi nói đến AI, nhiều người thường nghĩ ngay đến ChatGPT, Claude, Gemini hay các dịch vụ AI chạy trên cloud.Tuy nhiên, một hướng phát triển ngày càng được quan tâm là Local AI – chạy các mô hình trí tuệ nhân tạo trực tiếp trên máy tính, workstation hoặc server của chính mình thay vì gửi toàn bộ dữ liệu lên máy chủ của nhà cung cấp.
Ngày nay, một chiếc PC gaming, workstation hay Mac Apple Silicon có đủ bộ nhớ đã có thể chạy những mô hình ngôn ngữ khá mạnh ngay tại nhà.
Local AI là gì?
Local AI là việc chạy mô hình AI trên phần cứng do chính người dùng kiểm soát.Ví dụ, thay vì:
Người dùng → Internet → ChatGPT/Claude/Gemini → Server của nhà cung cấp
chúng ta có thể chạy:
Người dùng → Local AI → CPU/GPU/RAM trên máy của mình
Máy tính có thể tải model về ổ SSD và thực hiện quá trình inference trực tiếp.
Local AI không chỉ bao gồm LLM mà còn có thể bao gồm:
- Large Language Model – LLM
- Vision Language Model – VLM
- AI tạo ảnh
- Speech-to-Text
- Text-to-Speech
- Embedding Model
- Reranker
- OCR
- AI Coding
- AI Agent
- RAG
- Computer Vision
Local LLM là gì?
LLM là viết tắt của:Large Language Model
Đây là các mô hình có khả năng hiểu và tạo ngôn ngữ tự nhiên.
Một Local LLM có thể hoạt động tương tự chatbot AI trực tuyến:
- đặt câu hỏi
- viết nội dung
- dịch thuật
- tóm tắt
- lập trình
- phân tích tài liệu
- xử lý dữ liệu
- reasoning
- sử dụng tool
- truy vấn cơ sở dữ liệu
Các công cụ như LM Studio hiện hỗ trợ tải và chạy nhiều model local, cung cấp giao diện chat, kết nối MCP và thậm chí mở API tương thích kiểu OpenAI để những ứng dụng khác trong mạng sử dụng model trên máy tính.
Local AI có thể làm được những gì?
1. Chatbot AI cá nhân
Đây là ứng dụng đơn giản nhất.Bạn có thể tải một LLM về máy rồi trò chuyện với nó tương tự:
- ChatGPT
- Claude
- Gemini
- trả lời câu hỏi
- giải thích kiến thức
- brainstorming
- viết bài
- sửa văn bản
- viết email
- dịch
- học ngoại ngữ
- phân tích vấn đề
2. AI Coding
Local AI đặc biệt hữu ích cho lập trình.Bạn có thể sử dụng LLM để:
- viết code
- sửa lỗi
- giải thích code
- refactor
- viết unit test
- sinh SQL
- viết API
- đọc repository
- phân tích log
- viết Dockerfile
- hỗ trợ DevOps
- tạo documentation
VS Code
│
↓
AI Coding Extension
│
↓
Local LLM Server
│
↓
GPU của máy
Như vậy source code không nhất thiết phải được gửi tới một dịch vụ AI bên ngoài.
Điều này đặc biệt hữu ích với:
- source code nội bộ
- phần mềm doanh nghiệp
- code chứa bí mật thương mại
- hệ thống không được phép đưa dữ liệu lên cloud.
3. Chat với tài liệu bằng RAG
Một trong những ứng dụng mạnh nhất của Local AI là RAG – Retrieval-Augmented Generation.Ví dụ bạn có:
5.000 PDF
20.000 tài liệu Word
100.000 bài viết
database nội bộ
tài liệu kỹ thuật
hợp đồng
giáo trình
Có thể xây dựng hệ thống:
Tài liệu
↓
Embedding Model
↓
Vector Database
↓
Tìm tài liệu liên quan
↓
Local LLM
↓
Trả lời
Sau đó có thể hỏi:
AI sẽ tìm nội dung liên quan trong kho tài liệu rồi tạo câu trả lời.Chính sách bảo hành sản phẩm A là gì?
4. AI tìm kiếm dữ liệu nội bộ
Local AI có thể trở thành một dạng Google Search cho dữ liệu cá nhân hoặc doanh nghiệp.Ví dụ:
Word
Excel
Wiki
Source Code
Database
Log
được index thành một knowledge base.
Người dùng chỉ cần đặt câu hỏi bằng ngôn ngữ tự nhiên.
Ví dụ:
hoặc:Tìm tất cả tài liệu có nói đến PostgreSQL replication.
Trong các báo cáo năm 2025, sản phẩm nào tăng doanh thu mạnh nhất?
5. AI đọc và phân tích codebase
Một hệ thống Local AI có thể index toàn bộ project:Frontend
Backend
Database schema
API
Docker
Configuration
Documentation
Git history
Sau đó developer có thể hỏi:
Authentication đang được xử lý ở đâu?
API tạo user nằm trong module nào?
Đây là một ứng dụng rất đáng chú ý của Local AI đối với developer.Tại sao WebSocket này có khả năng memory leak?
6. Tạo AI Server riêng
Không nhất thiết mỗi máy phải chạy một model.Có thể xây dựng một máy AI trong mạng:
┌── Laptop
│
├── Desktop
AI Server ──────┼── Website
│
├── Mobile App
│
└── Server nội bộ
Ví dụ một workstation có GPU mạnh chạy Local LLM.
Những thiết bị còn lại gọi API đến máy đó.
Các dự án như llama.cpp thậm chí có thể cung cấp server API tương thích với OpenAI. llama.cpp hiện hỗ trợ nhiều backend như CUDA, Metal, HIP, Vulkan, SYCL và cả chế độ CPU + GPU hybrid.
7. AI Agent
Local LLM không chỉ trả lời câu hỏi.Model có thể được kết nối với các công cụ để trở thành AI Agent.
Ví dụ agent có thể:
Nhận yêu cầu
↓
Phân tích
↓
Đọc file
↓
Truy vấn database
↓
Chạy chương trình
↓
Kiểm tra kết quả
↓
Tiếp tục xử lý
Agent có thể được sử dụng để:
- quản trị server
- xử lý tài liệu
- hỗ trợ lập trình
- phân tích log
- automation
- xử lý dữ liệu
- tạo báo cáo.
8. AI xử lý hình ảnh
Local AI không chỉ có text.Các Vision Language Model có thể phân tích:
- ảnh
- screenshot
- biểu đồ
- tài liệu scan
- giao diện phần mềm
- hình sản phẩm
Trong screenshot này có lỗi gì?
Hãy đọc bảng trong ảnh.
Mô tả giao diện này.
Một số runtime Local AI hiện đã hỗ trợ cả LLM và VLM.Phân tích biểu đồ.
9. Nhận dạng giọng nói
Local Speech-to-Text có thể sử dụng để:- ghi âm → văn bản
- tạo phụ đề
- transcription cuộc họp
- transcription bài giảng
- tìm kiếm nội dung audio/video
- điều khiển máy bằng giọng nói
10. Text-to-Speech
Chiều ngược lại:Text
↓
Local TTS
↓
Audio
có thể được sử dụng cho:
- trợ lý AI
- audiobook
- đọc tài liệu
- chatbot voice
- game
- ứng dụng học ngoại ngữ.
11. AI tạo ảnh
Một workstation GPU cũng có thể chạy các model tạo ảnh local.Ví dụ hệ thống:
Prompt
↓
Image Model
↓
GPU
↓
Image
Ứng dụng gồm:
- concept art
- thiết kế
- game asset
- quảng cáo
- ảnh minh họa
- chỉnh sửa ảnh
- inpainting
- upscaling.
Tại sao người ta muốn chạy AI Local?
Quyền riêng tư
Đây có lẽ là ưu điểm lớn nhất.Dữ liệu có thể:
Máy của bạn
↓
Local AI
↓
Kết quả
thay vì:
Máy của bạn
↓
Internet
↓
Server bên thứ ba
Điều này đặc biệt quan trọng với:
- source code
- tài liệu doanh nghiệp
- dữ liệu khách hàng
- tài liệu nghiên cứu
- dữ liệu nội bộ.
Không phụ thuộc Internet
Sau khi model đã được tải về:Local AI có thể hoạt động offline.
Điều này rất hữu ích với:
- máy nội bộ
- phòng lab
- mạng kín
- server không có Internet
- dữ liệu không được phép ra ngoài.
Không phải trả tiền theo token
Cloud AI thường tính:Input Token
+
Output Token
=
Chi phí
Local AI không có chi phí API theo từng token.
Thay vào đó bạn trả chi phí cho:
- máy tính
- GPU
- điện
- SSD
- bảo trì.
Có thể tùy biến rất sâu
Người dùng có thể tự quyết định:- model nào
- quantization nào
- system prompt
- context
- temperature
- RAG
- embedding
- reranker
- tool
- agent
- API
- fine-tuning.
Điểm yếu của Local AI
Local AI cũng không phải giải pháp thay thế hoàn toàn cloud AI.Các model hàng đầu chạy trên hạ tầng khổng lồ thường vẫn có lợi thế về:
- reasoning
- coding phức tạp
- khả năng agent
- multimodal
- context lớn
- tốc độ trên workload rất lớn.
Model càng mạnh thì càng cần nhiều bộ nhớ.
Parameter là gì?
Bạn thường thấy các model có tên:3B
7B
8B
14B
32B
70B
B nghĩa là billion parameters.
Ví dụ:
8B = khoảng 8 tỷ parameters
70B = khoảng 70 tỷ parameters
Thông thường model lớn hơn có tiềm năng mạnh hơn, nhưng đồng thời cần nhiều RAM/VRAM hơn.
Quantization – chìa khóa của Local AI
Nếu chạy model ở độ chính xác đầy đủ, bộ nhớ cần thiết có thể rất lớn.Vì vậy Local AI thường sử dụng quantization.
Ví dụ:
FP16
Q8
Q6
Q5
Q4
Q3
Q2
Quantization giảm độ chính xác số học của trọng số để giảm:
- dung lượng model
- RAM
- VRAM
llama.cpp hiện hỗ trợ nhiều mức quantization từ khoảng 1,5-bit tới 8-bit.
Trong thực tế, Q4/Q5 thường là vùng rất được ưa chuộng cho Local LLM vì cân bằng khá tốt giữa:
chất lượng ↔ bộ nhớ ↔ tốc độ.
Model cần bao nhiêu RAM/VRAM?
Có thể ước lượng sơ bộ đối với model Q4:| Model | Bộ nhớ model gần đúng | Cấu hình nên có |
|---|---|---|
| 1–3B | 1–3 GB | 8–16 GB RAM |
| 7–8B | 5–7 GB | 16 GB RAM / 8 GB VRAM |
| 12–14B | 8–11 GB | 24–32 GB RAM / 12–16 GB VRAM |
| 30–32B | 18–24 GB | 32–64 GB RAM / 24 GB VRAM |
| 70–72B | khoảng 40–50 GB | 64–96 GB+ memory |
| >100B | >60 GB | workstation/server |
Ngoài trọng số model còn có:
- KV Cache
- context
- runtime overhead
- embedding
- GPU workspace.
VRAM quan trọng hơn sức mạnh GPU trong nhiều trường hợp
Khi chọn GPU chạy LLM, rất nhiều người chỉ nhìn:Nhưng đối với Local LLM còn một yếu tố cực kỳ quan trọng:GPU nào nhanh hơn?
VRAM.
Ví dụ:
GPU cực nhanh + 8 GB VRAM
có thể không chạy được model mà:
GPU chậm hơn + 24 GB VRAM
có thể chứa hoàn toàn trong GPU.
Nếu model nằm hoàn toàn trong VRAM, quá trình inference thường nhanh hơn nhiều so với việc phải liên tục sử dụng RAM hệ thống.
CPU có chạy Local LLM được không?
Có.Đây chính là một trong những điểm rất thú vị của llama.cpp.
Nó hỗ trợ chạy inference trên nhiều loại CPU và cũng cho phép kết hợp CPU + GPU khi model lớn hơn VRAM của GPU.
Ví dụ:
Model 32B
↓
20 GB model
↓
GPU 12 GB
+
RAM hệ thống
một phần model có thể được đưa lên GPU, phần còn lại nằm trong RAM.
Nhược điểm:
tốc độ sẽ thấp hơn so với việc chứa toàn bộ model trong GPU.
RAM bao nhiêu là đủ?
Một cách phân loại thực tế:16 GB RAM
Phù hợp:- model 1B
- 3B
- 7B nhẹ
- thử nghiệm Local AI.
32 GB RAM
Đây là mức khá tốt cho người dùng phổ thông.Có thể chạy:
- 7B
- 8B
- 14B
- một số model lớn hơn bằng quantization mạnh.
64 GB RAM
Bắt đầu bước vào vùng workstation.Có thể chạy:
- 14B thoải mái
- 32B
- một số 70B quantized.
- developer
- RAG
- AI coding
- server Local AI.
128 GB RAM trở lên
Có thể thử:- model 70B lớn
- model MoE
- context lớn
- nhiều model đồng thời
- hệ thống RAG lớn.
GPU NVIDIA
NVIDIA hiện vẫn là lựa chọn phổ biến cho Local AI nhờ hệ sinh thái CUDA.llama.cpp có backend CUDA riêng cho GPU NVIDIA.
Có thể hình dung theo VRAM:
6–8 GB VRAM
Phù hợp:3B
7B
8B
12 GB VRAM
Khá tốt cho:7B
8B
14B
16 GB VRAM
Có thể chạy nhiều model:8B
14B
một số model lớn hơn
24 GB VRAM
Đây là một ngưỡng rất hấp dẫn.Có thể chạy:
7B
14B
20B
32B Q4
với phần lớn hoặc toàn bộ model nằm trên GPU.
48 GB VRAM trở lên
Bắt đầu bước vào workstation AI thực sự.Có thể chạy model lớn hơn nhiều và context dài hơn.
Apple Silicon có lợi thế đặc biệt
Mac Apple Silicon có kiến trúc:Unified Memory
Thay vì:
CPU RAM
+
GPU VRAM
Apple Silicon sử dụng một vùng bộ nhớ chung.
Ví dụ:
64 GB Unified Memory
CPU và GPU đều có thể truy cập vùng bộ nhớ này.
Điều đó khiến những máy Mac có nhiều Unified Memory trở nên khá thú vị cho Local LLM.
llama.cpp coi Apple Silicon là nền tảng được hỗ trợ trực tiếp và tối ưu thông qua Metal.
LM Studio cũng hỗ trợ llama.cpp và MLX trên Apple Silicon.
Ví dụ Mac Studio M4 Max được Apple cung cấp các tùy chọn tới 128 GB Unified Memory, trong khi M3 Ultra có thể cấu hình tới 256 GB, với băng thông bộ nhớ rất cao.
Đây là lý do những chiếc Mac có RAM lớn thường được cộng đồng Local AI quan tâm.
SSD cũng rất quan trọng
Model AI có thể rất lớn.Ví dụ một người sử dụng Local AI có thể nhanh chóng sở hữu:
10 GB model A
20 GB model B
45 GB model C
15 GB embedding
30 GB image model
...
Chỉ một thời gian ngắn thư mục model có thể lên tới hàng trăm GB.
Vì vậy:
SSD 1 TB là mức hợp lý để bắt đầu.
Nếu sử dụng Local AI nhiều:
2 TB hoặc 4 TB sẽ thoải mái hơn.
Cấu hình Local AI theo từng cấp độ
Cấp 1 – Thử nghiệm
CPU: Core i5 / Ryzen 5 / Apple SiliconRAM: 16 GB
GPU: integrated hoặc 6–8 GB VRAM
SSD: 512 GB
Phù hợp:
- 1–3B
- 7B quantized
- chatbot cơ bản.
Cấp 2 – Người dùng Local AI thông thường
CPU: Core i7 / Ryzen 7RAM: 32 GB
GPU: 12–16 GB VRAM
SSD: 1 TB
Phù hợp:
- 7B
- 8B
- 14B
- coding
- RAG
- AI assistant.
Cấp 3 – Local AI mạnh
CPU: Core i9 / Ryzen 9RAM: 64 GB
GPU: 24 GB VRAM
SSD: 2 TB
Có thể chạy:
8B
14B
32B
rất tốt.
Đây có thể xem là một trong những cấu hình hấp dẫn nhất cho AI workstation cá nhân.
Cấp 4 – AI Workstation
RAM: 128 GB+GPU: 24–48 GB VRAM+
SSD: 2–4 TB+
hoặc:
Mac
64–128–256 GB Unified Memory
Có thể hướng tới:
- 32B
- 70B
- MoE
- RAG lớn
- nhiều agent
- nhiều người dùng.
Local AI Server tại nhà
Một hướng sử dụng rất thú vị là biến workstation thành AI Server.Ví dụ:
Internet/LAN
│
↓
Local AI Server
┌─────────┴─────────┐
│ │
LLM Embedding
│
┌──────┼───────┐
↓ ↓ ↓
Website VS Code Mobile
Máy workstation ở nhà có thể cung cấp inference cho:
- laptop
- website
- app
- IDE
- điện thoại
- máy tính khác.
Một Local AI Stack hoàn chỉnh có thể trông như thế nào?
Ví dụ:USER
│
↓
Web / App / IDE
│
↓
AI Gateway
│
┌──────────┼──────────┐
↓ ↓ ↓
LLM Embedding Vision
│ │
│ ↓
│ Vector DB
│ │
└──────┬───┘
↓
RAG
│
↓
AI Agent
│
┌───────┼────────┐
↓ ↓ ↓
Files Database Tools
Như vậy Local AI không còn đơn giản là:
Nó có thể trở thành hạ tầng AI riêng.tải một chatbot về máy.
Những phần mềm Local AI phổ biến
Một số công cụ thường gặp:LM Studio
Phù hợp người mới.Có:
- giao diện đồ họa
- tải model
- chat
- quản lý model
- API server
- MCP.
Ollama
Rất phổ biến trong giới developer vì cách sử dụng đơn giản và dễ tích hợp vào ứng dụng.llama.cpp
Một trong những nền tảng quan trọng nhất của hệ sinh thái Local LLM.Hỗ trợ:
- CPU
- CUDA
- Metal
- HIP
- Vulkan
- nhiều kiến trúc phần cứng
- nhiều loại quantization
- CPU/GPU hybrid.
Local AI có thay thế ChatGPT, Claude hay Gemini không?
Câu trả lời hợp lý hơn là:Local AI và Cloud AI sẽ tồn tại song song.
Cloud AI phù hợp khi cần:
- model mạnh nhất
- reasoning phức tạp
- không muốn mua GPU
- không muốn quản trị hệ thống.
- privacy
- offline
- kiểm soát dữ liệu
- tùy chỉnh model
- API nội bộ
- xử lý số lượng lớn
- nghiên cứu
- xây dựng AI infrastructure riêng.
AI SYSTEM
│
┌──────────┴──────────┐
↓ ↓
Local AI Cloud AI
│ │
dữ liệu riêng tác vụ khó
tác vụ thường model mạnh
automation reasoning
Tức là không nhất thiết phải lựa chọn một trong hai.
Những tác vụ phù hợp được chạy Local, còn những tác vụ quá khó mới gửi lên Cloud.
Kết luận
Local AI đang khiến việc sở hữu một hệ thống AI riêng trở nên dễ tiếp cận hơn rất nhiều.Một chiếc máy tính ngày nay không chỉ còn là:
PC
mà có thể trở thành:
AI Chatbot
+
Coding Assistant
+
Knowledge Base
+
RAG Server
+
AI Agent
+
Vision AI
+
Speech AI
+
Automation Server
Điều quan trọng nhất khi xây dựng máy Local AI không chỉ là CPU mạnh.
Ba yếu tố cần đặc biệt quan tâm là:
VRAM + RAM + Memory Bandwidth.
Nếu chỉ thử nghiệm, 16 GB RAM và model nhỏ đã đủ.
Nếu muốn sử dụng Local AI nghiêm túc, 32–64 GB RAM và GPU có 12–24 GB VRAM là vùng cấu hình rất đáng quan tâm.
Nếu muốn chạy model 70B, context lớn hoặc xây một AI server phục vụ nhiều ứng dụng, chúng ta bắt đầu bước sang thế giới của 64–128 GB+ bộ nhớ, GPU VRAM lớn hoặc Apple Silicon có Unified Memory dung lượng cao.
Local AI vì thế không đơn thuần là một chatbot chạy offline.
Nó có thể trở thành một lớp hạ tầng AI riêng nằm ngay trong PC, workstation hoặc server của chúng ta.