TƯ VẤN BÁO GIÁ 0922.47.6789
Giỏ Hàng Của Bạn
0 sản phẩm trong giỏ
Giỏ hàng đang trống

Hãy chọn thêm sản phẩm bạn ưng ý vào giỏ hàng nhé!

MÁY TÍNH BMT
Danh mục sản phẩm & dịch vụ
DANH MỤC SẢN PHẨM
HỖ TRỢ & LIÊN HỆ
Cẩm nang Bezon

Cần Bao Nhiêu RAM Và VRAM Để Chạy Mô Hình AI Local (Ollama, DeepSeek) Trên Máy Tính?

Bezon 26/08/2026 0 comments
Cần Bao Nhiêu RAM Và VRAM Để Chạy Mô Hình AI Local (Ollama, DeepSeek) Trên Máy Tính?
OLLAMA • DEEPSEEK • LLM LOCAL • RAM & VRAM

Muốn chạy DeepSeek, Qwen, Llama hoặc các mô hình LLM bằng Ollama ngay trên máy tính, hai thông số phải quan tâm đầu tiên là RAM hệ thống và VRAM của card đồ họa. Model càng lớn, quantization càng cao và context càng dài thì lượng bộ nhớ cần thiết càng tăng. Một máy không đủ VRAM vẫn có thể chạy một phần model bằng RAM/CPU, nhưng tốc độ thường giảm đáng kể so với khi model nằm hoàn toàn trên GPU.

Câu trả lời nhanh

Với Ollama và các bản DeepSeek-R1 quantized phổ biến: 16GB RAM phù hợp model nhỏ khoảng 1.5B–7B; 32GB RAM thoải mái hơn cho 7B–14B; 64GB RAM là mức đáng cân nhắc cho 32B; còn 96–128GB RAM thực dụng hơn nếu muốn chạy 70B bằng CPU hoặc CPU/GPU offload. Nếu muốn tốc độ tốt, hãy cố gắng chọn GPU có đủ VRAM để chứa phần lớn hoặc toàn bộ model.

Không thể tính RAM chỉ bằng số tham số

Model 32B không có nghĩa luôn cần chính xác 32GB RAM. Dung lượng thực tế phụ thuộc FP16, Q8, Q6, Q5, Q4, context length, KV cache, framework và mức offload sang GPU. Vì vậy nên xem các con số trong bài là mức định hướng thực tế, không phải yêu cầu tuyệt đối của mọi model.

RAM và VRAM khác nhau thế nào khi chạy Ollama?

Hai loại bộ nhớ đóng vai trò khác nhau.

Bộ nhớ Vai trò
RAM hệ thống CPU sử dụng; có thể chứa toàn bộ hoặc phần model khi không đủ VRAM
VRAM GPU sử dụng; model nằm càng nhiều trên GPU thì inference thường càng nhanh

Ollama có thể chạy:

  • 100% trên CPU.
  • 100% trên GPU.
  • Hoặc chia model giữa CPU và GPU.

Có thể kiểm tra trạng thái bằng lệnh:

ollama ps

Nếu cột Processor hiển thị:

  • 100% GPU: model nằm hoàn toàn trên GPU.
  • 100% CPU: model nằm trên RAM hệ thống.
  • CPU/GPU: model đang được chia giữa hai loại bộ nhớ.

DeepSeek-R1 trên Ollama hiện có những bản nào?

Ollama hiện cung cấp nhiều phiên bản DeepSeek-R1, từ model rất nhỏ tới model đầy đủ 671B.

Model Dung lượng model Ollama tham khảo
DeepSeek-R1 1.5B Khoảng 1.1GB
DeepSeek-R1 7B Khoảng 4.7GB
DeepSeek-R1 8B Khoảng 5.2GB
DeepSeek-R1 14B Khoảng 9GB
DeepSeek-R1 32B Khoảng 20GB
DeepSeek-R1 70B Khoảng 43GB
DeepSeek-R1 671B Khoảng 404GB

Dung lượng trên là kích thước các model phổ biến được Ollama phân phối, không phải tổng bộ nhớ hệ thống cần thiết khi chạy. Ollama vẫn cần thêm memory cho context, KV cache và runtime.

Bảng RAM và VRAM khuyến nghị thực tế

Model RAM nên có VRAM lý tưởng Đánh giá
1.5B–3B Q4 8–16GB 4–6GB Dễ chạy trên PC phổ thông
7B–8B Q4 16GB tối thiểu; 32GB thoải mái 6–8GB+ Rất phù hợp AI local cá nhân
14B Q4 24–32GB 12–16GB+ Mức cân bằng tốt
32B Q4 48–64GB 24GB+; 32GB rất phù hợp Workstation AI cá nhân
70B Q4 64GB có thể sát; 96–128GB thực dụng hơn 48GB+ nếu muốn GPU-heavy Workstation lớn / CPU-GPU offload
671B Hàng trăm GB Multi-GPU / server Không thực tế với PC gia đình thông thường
Vì sao RAM khuyến nghị lớn hơn file model?

Máy còn phải chạy Windows/Linux, Ollama, trình duyệt, ứng dụng giao diện, KV cache và các vùng nhớ runtime khác. Chọn RAM vừa đúng bằng dung lượng file model rất dễ thiếu memory khi context tăng.

DeepSeek 7B cần bao nhiêu RAM?

DeepSeek-R1 7B trên Ollama hiện có kích thước khoảng 4.7GB ở bản mặc định phổ biến.

Vì vậy:

  • 8GB RAM: có thể quá sát nếu hệ điều hành và ứng dụng khác đang dùng nhiều memory.
  • 16GB RAM: mức hợp lý để bắt đầu.
  • 32GB RAM: thoải mái hơn, đặc biệt khi dùng IDE, browser hoặc nhiều dịch vụ cùng lúc.

Nếu GPU có khoảng 6–8GB VRAM trở lên, model 7B Q4 có thể phù hợp với nhiều hệ thống AI local phổ thông, tùy context và runtime.

DeepSeek 14B cần bao nhiêu RAM và VRAM?

DeepSeek-R1 14B bản Q4 phổ biến trên Ollama có kích thước khoảng 9GB.

Định hướng:

  • 16GB RAM: có thể chạy nhưng tương đối sát.
  • 32GB RAM: hợp lý hơn rõ rệt.
  • 12–16GB VRAM: phù hợp nếu muốn offload phần lớn hoặc toàn model lên GPU với context phù hợp.

Đây là nhóm model rất đáng chú ý cho PC cá nhân vì chất lượng cao hơn model 7B nhưng chưa yêu cầu workstation cực lớn.

DeepSeek 32B cần bao nhiêu RAM?

DeepSeek-R1 32B Q4 trên Ollama có kích thước khoảng 20GB.

Nếu chạy bằng CPU:

  • 32GB RAM có thể khá chật khi tính thêm hệ điều hành và context.
  • 48–64GB RAM là lựa chọn an toàn và thực dụng hơn.

Nếu có GPU:

  • 16GB VRAM có thể offload một phần đáng kể.
  • 24GB VRAM phù hợp hơn.
  • 32GB VRAM tạo điều kiện tốt hơn để giữ model và context trên GPU.
32B là điểm bắt đầu của workstation AI local nghiêm túc

Nếu mục tiêu thường xuyên chạy model 32B, 64GB RAM + GPU 24–32GB VRAM là hướng cấu hình đáng cân nhắc hơn việc cố chạy trên máy chỉ có 16–32GB RAM.

DeepSeek 70B có chạy được trên PC tại nhà không?

Có thể, nhưng cấu hình bắt đầu trở nên khá nặng.

DeepSeek-R1 70B Q4 hiện có dung lượng model khoảng 43GB trên Ollama.

Do đó:

  • 64GB RAM: có thể chạy trong một số cấu hình nhưng tương đối sát.
  • 96GB RAM: dễ thở hơn.
  • 128GB RAM: thực dụng nếu muốn chạy CPU/offload và vẫn còn memory cho hệ điều hành.

Để chạy chủ yếu trên GPU, mức VRAM yêu cầu rất lớn. GPU 48GB trở lên phù hợp hơn, hoặc cần chia workload trên nhiều GPU nếu phần mềm và cấu hình hỗ trợ.

DeepSeek-R1 671B có chạy trên PC gia đình không?

Bản DeepSeek-R1 671B trên Ollama hiện có dung lượng khoảng 404GB.

Đây không còn là bài toán PC gaming/workstation phổ thông.

Muốn chạy local đầy đủ cần:

  • Hàng trăm GB RAM/VRAM.
  • Server hoặc multi-GPU chuyên dụng.
  • Nguồn điện và cooling lớn.

Với người dùng cá nhân, các bản distilled 7B, 14B, 32B hoặc 70B thực tế hơn nhiều.

Quantization Q4, Q8, FP16 ảnh hưởng RAM thế nào?

Đây là yếu tố cực kỳ quan trọng.

Quantization giảm độ chính xác số học của weights để giảm dung lượng bộ nhớ.

Định dạng Đặc điểm
Q4 Tiết kiệm memory, rất phổ biến cho AI local
Q8 Dung lượng lớn hơn Q4 nhưng giữ precision cao hơn
FP16 Dung lượng rất lớn, ít thực dụng hơn trên PC RAM/VRAM thấp

Ví dụ với DeepSeek-R1 32B:

  • Q4_K_M trên Ollama khoảng 20GB.
  • Q8_0 khoảng 35GB.
  • FP16 khoảng 66GB.

Cùng một model 32B, nhưng lựa chọn quantization có thể làm nhu cầu memory thay đổi rất lớn.

Context Length càng lớn càng tốn VRAM

Context là lượng token mà model có thể giữ và tham chiếu trong một phiên làm việc.

Ví dụ:

  • 4K token.
  • 8K token.
  • 32K token.
  • 64K token.
  • 128K token.

Context càng lớn, KV cache càng lớn và lượng RAM/VRAM cần thiết càng tăng.

Do đó câu hỏi: “32GB VRAM chạy được model nào?” vẫn chưa đủ.

Phải hỏi thêm: “chạy ở context bao nhiêu?”

Ollama tự chọn context theo VRAM như thế nào?

Tài liệu Ollama hiện cho biết ứng dụng có các mức context mặc định dựa trên VRAM:

VRAM Context mặc định hiện tại
Dưới 24 GiB 4K
24–48 GiB 32K
48 GiB trở lên 256K

Ollama cũng lưu ý rằng tăng context length sẽ làm tăng lượng memory cần thiết.

64K context có thật sự cần không?

Tùy ứng dụng.

Context lớn hữu ích cho:

  • Phân tích codebase lớn.
  • Agent.
  • Chat với tài liệu dài.
  • RAG với nhiều nội dung.
  • Phiên coding kéo dài.

Ollama hiện khuyến nghị các công cụ coding/agent nên dùng context ít nhất khoảng 64K token trong những workflow cần context lớn.

Nhưng nếu chỉ:

  • Chat hỏi đáp.
  • Viết nội dung.
  • Dịch văn bản ngắn.
  • Code từng đoạn nhỏ.

4K–16K có thể đã đủ, giúp giảm mức sử dụng memory.

GPU 8GB chạy Ollama được không?

Có.

8GB VRAM phù hợp:

  • Model 3B.
  • Nhiều model 7B/8B Q4.
  • Một phần workload 14B thông qua CPU/GPU offload.

Nhưng với 14B, 32B hoặc context lớn, 8GB nhanh chóng trở thành giới hạn.

GPU 12GB phù hợp model nào?

12GB VRAM là mức khá tốt cho:

  • 7B/8B.
  • 14B Q4 trong nhiều cấu hình.
  • Model nhỏ với context dài hơn.

32B vẫn thường phải offload sang RAM hệ thống.

GPU 16GB có phải mức đẹp cho AI Local?

Có, đặc biệt với PC mới tầm trung.

16GB VRAM phù hợp rất tốt với:

  • 7B/8B.
  • 14B.
  • Model coding tầm trung.
  • Một phần workload 32B thông qua offload.

Các GPU 16GB cũng thuận tiện nếu máy vừa chạy LLM vừa dùng Stable Diffusion hoặc các ứng dụng CUDA khác.

GPU 24GB chạy DeepSeek 32B thế nào?

DeepSeek-R1 32B Q4 có model file khoảng 20GB.

GPU 24GB vì vậy là mức rất đáng chú ý, nhưng vẫn cần tính thêm:

  • KV cache.
  • Context.
  • Runtime overhead.

Không nên mặc định: “model 20GB + GPU 24GB = chắc chắn chạy full GPU ở mọi context”.

Nếu thiếu, Ollama có thể offload một phần sang RAM.

RTX 5090 32GB có phù hợp Ollama và DeepSeek 32B?

Có.

32GB VRAM là mức rất hấp dẫn cho DeepSeek-R1 32B Q4 và nhiều LLM local cỡ tương tự.

Lợi thế:

  • Có khả năng giữ nhiều layer trên GPU.
  • Ít phụ thuộc CPU offload hơn.
  • Thông lượng token thường tốt hơn cấu hình CPU-heavy.
  • Có dư địa cho context tốt hơn so với GPU VRAM thấp.

Tuy nhiên, 32GB vẫn chưa đủ để coi RTX 5090 là GPU “chạy full mọi model 70B”.

Không có VGA rời có chạy Ollama được không?

Có.

Ollama có thể chạy hoàn toàn bằng CPU và RAM.

Đây là cách tiết kiệm để:

  • Thử nghiệm LLM.
  • Chat offline.
  • Chạy model 3B–14B.
  • Học cách sử dụng Ollama.

Nhược điểm là tốc độ generation thường thấp hơn đáng kể so với GPU phù hợp.

RAM nhiều có thay được VRAM không?

Có thể giúp model chạy, nhưng không thay thế hoàn toàn lợi thế của VRAM.

Ví dụ:

64GB RAM + 12GB VRAM → CÓ THỂ CHẠY MODEL LỚN HƠN 12GB VRAM NHỜ OFFLOAD

Nhưng dữ liệu phải trao đổi giữa CPU và GPU, nên tốc độ thường thấp hơn so với việc toàn bộ model nằm trong VRAM.

Có cần DDR5 để chạy Ollama không?

Không bắt buộc.

Máy DDR4 vẫn có thể chạy Ollama.

Tuy nhiên với CPU inference, băng thông RAM ảnh hưởng đáng kể đến hiệu năng LLM. DDR5 và các nền tảng có memory bandwidth cao có thể mang lại lợi thế.

Nếu build máy mới cho model 32B–70B CPU-heavy, RAM dung lượng lớn và bandwidth tốt đáng được ưu tiên.

16GB, 32GB, 64GB hay 128GB RAM?

RAM Nhu cầu LLM Local
16GB Model nhỏ 1.5B–7B; phù hợp bắt đầu
32GB Mức cân bằng cho 7B–14B, có thể thử model lớn hơn với offload
64GB Rất hợp cho 32B Q4 và AI workstation cá nhân
96–128GB 70B Q4 CPU/offload và workload AI nặng

3 cấu hình PC Ollama tham khảo

Cấp độ RAM GPU Model mục tiêu
AI Local Starter 32GB 8–16GB VRAM 7B–14B
AI Local Pro 64GB 16–32GB VRAM 14B–32B
LLM Workstation 128GB 32–48GB+ VRAM hoặc multi-GPU phù hợp 32B–70B

CPU, mainboard, PSU và GPU cụ thể nên chọn theo ngân sách, model cần chạy và mức token/giây kỳ vọng.

CPU Intel hay AMD chạy Ollama tốt hơn?

Không nên chọn chỉ theo thương hiệu.

CPU inference phụ thuộc:

  • Số nhân.
  • Kiến trúc CPU.
  • Memory bandwidth.
  • Tốc độ RAM.
  • Instruction set.
  • Model và quantization.

Nếu chạy model chủ yếu trên GPU, CPU cao cấp nhất không phải ưu tiên hàng đầu.

Nếu chạy 32B–70B bằng CPU, nền tảng có nhiều RAM và bandwidth cao trở nên quan trọng hơn.

SSD có ảnh hưởng tốc độ LLM không?

SSD ảnh hưởng chủ yếu ở:

  • Thời gian tải model.
  • Dung lượng lưu nhiều model.
  • Cài đặt và cập nhật model.

Sau khi model đã nằm trong RAM/VRAM, tốc độ generate token chủ yếu phụ thuộc CPU/GPU và memory bandwidth.

Với máy AI local mới, SSD NVMe 1TB là mức bắt đầu, 2TB hợp lý hơn nếu thường xuyên tải nhiều model 14B–70B.

Cách kiểm tra model đang chạy trên CPU hay GPU

Sau khi chạy model, mở Terminal và nhập:

ollama ps

Ví dụ trạng thái có thể cho thấy:

  • 100% GPU.
  • 100% CPU.
  • Hoặc tỷ lệ CPU/GPU.

Đây là cách thực tế nhất để biết Ollama đang offload model như thế nào trên chính máy của bạn.

Cách giảm RAM và VRAM khi chạy Ollama

1. Chọn model nhỏ hơn

Nếu 32B quá nặng, 14B có thể mang lại trải nghiệm nhanh hơn đáng kể.

2. Dùng quantization thấp hơn

Q4 thường thực dụng cho AI local khi muốn cân bằng chất lượng, memory và tốc độ.

3. Giảm context

Nếu không cần 64K hoặc 128K, đừng cấu hình context quá lớn.

4. Chỉ load model đang sử dụng

Nhiều model đồng thời có thể chiếm rất nhiều RAM/VRAM.

5. Kiểm tra mức GPU offload

Dùng ollama ps để kiểm tra model đang nằm ở CPU hay GPU.

Có nên mua RTX 5090 chỉ để chạy DeepSeek?

Không nhất thiết.

Nếu chỉ chạy:

  • DeepSeek 7B.
  • DeepSeek 8B.
  • DeepSeek 14B.

GPU 12–16GB đã có thể rất phù hợp.

RTX 5090 32GB đáng cân nhắc hơn nếu:

  • Chạy 32B thường xuyên.
  • Cần tốc độ cao.
  • Context lớn.
  • Dùng thêm Stable Diffusion, video AI hoặc Deep Learning.

Không nên mua GPU cao cấp chỉ vì model “AI” nếu workload thực tế chỉ cần vài GB VRAM.

Có nên ưu tiên RAM 128GB hay GPU VRAM lớn?

Nếu mục tiêu là chạy được model lớn với chi phí thấp, RAM hệ thống lớn có thể là phương án kinh tế.

Nếu mục tiêu là tốc độ token cao, VRAM lớn và GPU mạnh thường quan trọng hơn.

Mục tiêu Ưu tiên
Chạy được model lớn tiết kiệm Nhiều RAM
Inference nhanh Nhiều VRAM + GPU mạnh
Cân bằng chi phí RAM đủ lớn + GPU offload

8 sai lầm khi build PC chạy Ollama, DeepSeek

Nên tránh

01. Nghĩ file model 20GB chỉ cần đúng 20GB RAM.

02. Không tính KV cache và context.

03. Chọn GPU chỉ theo CUDA Core mà bỏ qua VRAM.

04. Mặc định model 70B phải chạy hoàn toàn trên GPU.

05. Cấu hình context 128K dù nhu cầu chỉ chat ngắn.

06. Dùng FP16 khi máy chỉ đủ Q4.

07. Không kiểm tra trạng thái CPU/GPU bằng ollama ps.

08. Mua workstation cực đắt trong khi model 7B–14B đã đủ công việc.

Checklist trước khi nâng RAM hoặc VGA

  • ✓ Model cần chạy là 7B, 14B, 32B hay 70B?
  • ✓ Đang dùng Q4, Q8 hay FP16?
  • ✓ Context thực sự cần bao nhiêu?
  • ✓ RAM hiện tại bao nhiêu?
  • ✓ GPU có bao nhiêu VRAM?
  • ✓ Ollama ps đang báo 100% GPU hay CPU/GPU?
  • ✓ Mục tiêu là chạy được hay cần token/giây cao?
  • ✓ Có sử dụng Stable Diffusion hoặc AI khác cùng máy không?
  • ✓ Mainboard có nâng được 64GB/128GB RAM không?
  • ✓ PSU có đủ nếu nâng GPU không?

Câu hỏi thường gặp

Ollama cần tối thiểu bao nhiêu RAM?

Không có một mức cố định cho mọi model. 16GB RAM là mức dễ bắt đầu với model 7B/8B, còn model 14B, 32B và 70B cần nhiều hơn tùy quantization và context.

DeepSeek 32B chạy được với 32GB RAM không?

Có thể trong một số cấu hình Q4 và context vừa phải, nhưng khá sát khi tính thêm hệ điều hành và runtime. 48–64GB RAM thực dụng hơn nếu chạy 32B thường xuyên.

DeepSeek 70B cần bao nhiêu RAM?

Bản Q4 trên Ollama có kích thước khoảng 43GB. 64GB có thể khá sát, trong khi 96–128GB RAM tạo dư địa tốt hơn cho context và hệ điều hành.

GPU 16GB VRAM chạy DeepSeek 32B được không?

Có thể chạy bằng cách offload một phần model lên GPU và phần còn lại trên RAM. Không nên kỳ vọng toàn bộ 32B Q4 cùng context lớn sẽ luôn nằm vừa trong 16GB VRAM.

RTX 5090 32GB chạy DeepSeek 70B được không?

Có thể sử dụng CPU/GPU offload, nhưng 32GB VRAM không đủ để mặc định chứa toàn bộ DeepSeek-R1 70B Q4 khoảng 43GB cộng thêm context và runtime.

Tăng context có làm tốn VRAM không?

Có. Ollama xác nhận context dài hơn làm tăng mức sử dụng memory. Nếu không cần context rất dài, giảm context có thể giúp model chạy nhẹ hơn.

Không có GPU NVIDIA có chạy DeepSeek được không?

Có. Ollama có thể chạy model bằng CPU và RAM. GPU chủ yếu giúp tăng tốc và giảm lượng model phải xử lý bằng CPU khi được hỗ trợ.

Cần build hoặc nâng cấp PC chạy Ollama, DeepSeek tại Buôn Ma Thuột?

Hãy xác định model muốn chạy, quantization, context và tốc độ mong muốn trước khi mua RAM hoặc VGA. Với AI Local, cấu hình tốt không phải máy có GPU đắt nhất, mà là hệ thống cân bằng giữa RAM, VRAM, memory bandwidth và kích thước model thực tế.

Hotline/Zalo: 0922.47.6789
BEZON Showroom: 126–128 Nguyễn Chí Thanh, P. Tân An, TP. Buôn Ma Thuột, Đắk Lắk
Vi Tính BMT: 28–30–32 Hồ Tùng Mậu, P. Tân Tiến, TP. Buôn Ma Thuột, Đắk Lắk
Thời gian tiếp nhận: 08:00–20:00 hằng ngày

Ghi chú kiểm chứng: Dung lượng model không phải tổng memory cần thiết khi inference. RAM/VRAM còn phụ thuộc quantization, context length, KV cache, runtime và mức CPU/GPU offload. Các mức RAM/VRAM trong bài là định hướng thực tế để lựa chọn phần cứng, không phải yêu cầu tuyệt đối của mọi phiên bản model.