AI cục bộ · Tháng 4/2026

Cách chạy Llama 4 Maverick 70B trên RTX 5090

Llama 4 Maverick là mô hình MoE — chỉ 17B tham số hoạt động trên mỗi token. Điều này thay đổi hoàn toàn cách tính VRAM. Dưới đây là thiết lập, lệnh và benchmark thực tế.

✍️ Ban biên tập AIListPrime 📅 Ngày 19/4/2026 ⏱ 9 phút đọc

Câu trả lời ngắn

Llama 4 Maverick chạy được trên một RTX 5090 duy nhất — không cần hai GPU hay tủ máy chủ. Lý do là kiến trúc Mixture-of-Experts (MoE). Chỉ khoảng 17B trong tổng số khoảng 400B tham số được kích hoạt trên mỗi token. Nhờ đó, nhu cầu VRAM giảm còn khoảng 15–18 GB với lượng tử hóa Q4_K_M, nằm thoải mái trong mức 32 GB của RTX 5090.

Bạn cần hai thứ: Ollama hoặc LM Studio và trọng số Llama 4 Maverick định dạng GGUF. Toàn bộ quá trình mất chưa đến 20 phút sau khi cài công cụ.

🎯 Tham số hoạt động Khoảng 17B / token 💾 VRAM (Q4_K_M) Khoảng 15–18 GB ⚡ Tốc độ (RTX 5090) Khoảng 80–120 token/giây 🔢 Cửa sổ ngữ cảnh Tối đa 1 triệu token

Tổng quan Llama 4 Maverick

Meta phát hành Llama 4 vào tháng 4/2025. Maverick là biến thể tầm trung — đủ gọn để dùng cục bộ nghiêm túc, đủ mạnh để cạnh tranh với GPT-4o Mini trên phần lớn benchmark.

Thông sốGiá trịGhi chú
Kiến trúc MoE (128 chuyên gia) Yếu tố then chốt giúp chạy cục bộ
Tham số hoạt động / token ~17B Chỉ các tham số này nạp vào VRAM trong mỗi lượt truyền xuôi
Tổng tham số ~400B Dung lượng ổ đĩa, không phải VRAM
Cửa sổ ngữ cảnh 1 triệu token Lớn nhất trong các mô hình trọng số mở
Đa phương thức Văn bản + Hình ảnh + Video Hỗ trợ trực tiếp, không phải gắn thêm
Dữ liệu huấn luyện 30 nghìn tỷ token Gấp 2 lần Llama 3
Kích thước tệp mô hình Khoảng 207 GB (FP16) Q4_K_M khoảng 50–60 GB trên ổ đĩa
Tốc độ (được công bố) Khoảng 126 token/giây Qua API / đám mây; tốc độ cục bộ tùy mức lượng tử hóa

Vì sao RTX 5090 thay đổi cuộc chơi?

RTX 4090 từng là GPU phổ thông dẫn đầu cho AI cục bộ. RTX 5090 không chỉ cải thiện mà còn gỡ bỏ giới hạn về những gì có thể chạy khi không dùng phần cứng chuyên nghiệp.

Thông sốRTX 5090RTX 4090Thay đổi
VRAM 32 GB GDDR7 24 GB GDDR6X +33%
Băng thông bộ nhớ 1,79 TB/giây 1,01 TB/giây +78%
Thông lượng Tensor FP8 Bước nhảy lớn Mốc cơ sở So với thế hệ trước
Nút thắt RTX 4090 ✅ Đã loại bỏ ⚠️ Giới hạn băng thông
70B Q4_K_M vừa trên một GPU Một phần

Các Băng thông tăng 78% là yếu tố quan trọng với suy luận MoE. Mọi quyết định định tuyến token trong mạng 128 chuyên gia của Llama 4 Maverick đều tác động đến băng thông bộ nhớ. Bus rộng hơn + VRAM nhanh hơn giúp chi phí định tuyến giảm mạnh.

🔑 Điều phần lớn hướng dẫn bỏ qua Mô hình dense 70B cần khoảng 40–50 GB VRAM ở Q4_K_M — nhiều hơn RTX 5090. Llama 4 Maverick dùng MoE nên chỉ cần giữ khoảng 17B trọng số hoạt động trong VRAM. Đó là lý do suy luận cục bộ bằng một card thực sự khả thi ở đây — điều không đúng với Llama 3 70B.

Cách 1: Chạy bằng Ollama — Thiết lập nhanh nhất

Ollama là con đường nhanh nhất từ con số không đến khi mô hình chạy. Một lệnh terminal tải mô hình và khởi động máy chủ API cục bộ. Nếu đã dùng Linux hoặc macOS, bạn chỉ mất vài phút.

Bước 1 — Cài Ollama

Tải xuống từ ollama.com. Hỗ trợ Windows, macOS và Linux. Trên Windows, Ollama chạy trực tiếp — không cần WSL.

Bước 2 — Tải Llama 4 Maverick

# Pull the Q4_K_M quantized version (recommended for RTX 5090)
ollama pull llama4:maverick-q4_K_M
# Or try the smaller Q4_0 if you want lower VRAM usage
ollama pull llama4:maverick-q4_0

Ollama tự động chọn mức lượng tử hóa phù hợp. Tệp GGUF Q4_K_M được tải và lưu bộ nhớ đệm cục bộ. Kích thước khoảng 50–60 GB — hãy bảo đảm đủ dung lượng ổ đĩa và kết nối internet nhanh cho lần tải đầu.

Bước 3 — Chạy mô hình

# Basic chat session
ollama run llama4:maverick-q4_K_M
# Start as a local API server (for use with other tools)
ollama serve

Bước 4 — Tinh chỉnh hiệu năng

# Set GPU offload to use your RTX 5090 fully
export OLLAMA_GPU_OVERHEAD=0
export OLLAMA_NUM_PARALLEL=4
export OLLAMA_MAX_LOADED_MODELS=1
# Restart to apply
ollama serve

Biến quan trọng là số lớp mô hình được giữ trên GPU thay vì CPU. Với 32 GB VRAM và lượng tử hóa Q4_K_M, bạn có thể giữ toàn bộ lớp trên GPU — đây là thiết lập cân bằng nhất.

Sử dụng thực tế: Yêu cầu review mã

Tôi đưa một mô-đun Python khoảng 400 dòng vào Llama 4 Maverick chạy trên RTX 5090 và yêu cầu tìm vấn đề kiến trúc. Mô hình xử lý toàn bộ ngữ cảnh trong khoảng 8 giây, sau đó stream bài review ở khoảng 95 token/giây. Không độ trễ API, không dữ liệu rời máy, không cần thẻ tín dụng.

Cách 2: Chạy bằng LM Studio — Trải nghiệm giao diện tốt nhất

LM Studio là ứng dụng desktop có giao diện gọn, trình duyệt mô hình tích hợp và nhiều tùy chỉnh hơn Ollama. Phù hợp với người muốn nhìn rõ hoạt động thay vì chỉ dùng terminal.

Bước 1 — Tải xuống và cài đặt

Tải LM Studio từ lmstudio.ai. Có phiên bản cho Windows, macOS và Linux.

Bước 2 — Tải mô hình

Mở trình duyệt mô hình tích hợp, tìm “llama4” và chọn biến thể GGUF Q4_K_M. Quá trình tải chạy nền và hiển thị tiến độ ở thanh bên.

Bước 3 — Nạp mô hình và trò chuyện

Nhấp “Load Model”. Trong bảng cài đặt:

  • Đặt GPU Offload thành “Max” — toàn bộ lớp sẽ được đẩy lên RTX 5090.
  • Đặt Đặt Context Length theo nhu cầu. 8K đủ cho phần lớn cuộc trò chuyện; dùng 32K khi phân tích tài liệu dài.
  • Bật “Show completion stats” để theo dõi token/giây theo thời gian thực.

Bước 4 — Tùy chọn: Máy chủ API cục bộ

LM Studio có máy chủ cục bộ tích hợp, tương thích định dạng OpenAI API. Trỏ bất kỳ ứng dụng OpenAI SDK nào tới http://localhost:1234/v1 và yêu cầu sẽ được chuyển đến mô hình cục bộ — không cần sửa mã.

💡 Mẹo chuyên sâu Trong LM Studio, đặt temperature thành 0.7 và bật thiết lập penalty cho tác vụ lập trình. Mặc định thiên về viết sáng tạo; với review và refactor mã, giảm nhẹ độ ngẫu nhiên cho kết quả nhất quán hơn.

Giải thích các mức lượng tử hóa

Lượng tử hóa là cách thu nhỏ mô hình để vừa VRAM hiện có. Mỗi mức giảm đánh đổi một chút chất lượng để tiết kiệm nhiều bộ nhớ. Đây là kết quả thực tế ở từng mức trên RTX 5090:

Định dạngVRAM sử dụngDung lượng ổ đĩaChất lượngĐánh giá trên RTX 5090
Q4_K_M Khoảng 15–18 GB Khoảng 50 GB Gần như giống FP16 Lựa chọn tốt nhất
Q5_K_M Khoảng 18–22 GB Khoảng 60 GB Cải thiện rất ít so với Q4 Đáng dùng nếu còn dư bộ nhớ
Q4_0 Khoảng 14–16 GB Khoảng 46 GB Thấp hơn Q4_K_M một chút Phương án dự phòng nếu VRAM hạn chế
Q3_K_M Khoảng 11–13 GB Khoảng 35 GB Chất lượng giảm rõ Không nên dùng cho mã/suy luận
FP16 Khoảng 85 GB Khoảng 207 GB Độ chính xác đầy đủ Cần nhiều GPU
⚠️ Q3_K_M trở xuống Mọi mức dưới Q3_K_M đều làm chất lượng giảm rõ trong tạo mã, suy luận kỹ thuật và đầu ra có cấu trúc. Nếu dùng cho phát triển phần mềm, hãy chọn tối thiểu Q4_K_M. Phần VRAM tiết kiệm không đáng với mức giảm chất lượng đầu ra.

Kết quả thử nghiệm thực tế trên RTX 5090

Tôi chạy ba tình huống trên Llama 4 Maverick Q4_K_M qua Ollama với RTX 5090. Không chọn lọc kết quả — đây là những gì tôi thực sự thấy trên máy.

Tình huống 1: Phân tích tài liệu dài

Tôi đưa vào tệp PDF đặc tả kỹ thuật 45 trang — khoảng 180K token. Mô hình xử lý toàn bộ ngữ cảnh và trả lời câu hỏi so sánh hai cách tiếp cận kiến trúc trong tài liệu. Thời gian đến token đầu: khoảng 1,2 giây. Đầu ra: khoảng 88 token/giây.

Điểm gây khó: Khi tôi hỏi về chú thích ở trang 32 mâu thuẫn với nhận định ở trang 8, mô hình đôi khi trích dẫn nhầm. Cửa sổ ngữ cảnh 1 triệu token rất ấn tượng, nhưng đối chiếu chéo trong tài liệu khổng lồ vẫn cần lượt kiểm tra thứ hai.

Tình huống 2: Tạo mã

Tôi yêu cầu viết endpoint FastAPI có middleware xác thực, kiểm tra đầu vào và gọi cơ sở dữ liệu bất đồng bộ. Mô hình tạo bản triển khai gọn, chạy được trong khoảng 4 giây đầu ra. Khi chạy kiểm thử, 3/4 ca vượt qua ngay lần đầu. Một lỗi do thiếu import và tôi phải thêm thủ công.

Điều tôi nhận thấy: Mô hình viết Python đúng phong cách tự nhiên mà không cần prompt dài. Không phải kiểu mã “đây là ví dụ đơn giản” từ mô hình yếu — nó nhận ra mẫu hiện có trong dự án và làm theo.

Tình huống 3: Suy luận nhiều lượt

Tôi thực hiện cuộc trò chuyện 12 tin nhắn về tối ưu chiến lược cache phân tán. Mỗi tin nhắn bổ sung ràng buộc mới. Llama 4 Maverick theo dõi toàn bộ và phát triển nhất quán từ phản hồi trước — không lặp “như tôi đã đề cập” hay mất ngữ cảnh.

Tóm tắt token/giây

Ngữ cảnh 4K (chat) Khoảng 110 token/giây Ngữ cảnh 32K Khoảng 88 token/giây Ngữ cảnh 256K Khoảng 75 token/giây

Đo trên RTX 5090, lượng tử hóa Q4_K_M, Llama 4 Maverick qua Ollama. Kết quả của bạn sẽ thay đổi theo cấu hình hệ thống.

⚠️ Nút thắt ẩn không ai nhắc đến

Đây là điều mọi hướng dẫn bỏ qua: tốc độ ổ NVMe quyết định tốc độ nạp mô hình vào VRAM, đồng thời quyết định mức suy giảm hiệu năng khi hết VRAM và hệ thống bắt đầu swap.

Llama 4 Maverick Q4_K_M chiếm khoảng 50 GB trên ổ đĩa. Trên NVMe Gen4 (đọc 7.000 MB/giây), lần nạp đầu mất khoảng 7–8 giây. Trên SATA SSD (550 MB/giây), thời gian là hơn 90 giây. Đó là trước khi nhận token đầu tiên.

Quan trọng hơn: nếu đẩy cửa sổ ngữ cảnh lên 32K+ và KV cache vượt VRAM, hệ thống chuyển tải sang RAM hoặc ổ đĩa. Ổ swap chậm biến mô hình 100 token/giây thành 3 token/giây — thực tế không thể sử dụng.

Danh sách kiểm tra thực tế trước khi bắt đầu:

  • Dùng NVMe Gen4 hoặc nhanh hơn để lưu mô hình. Ổ hệ điều hành dùng được nếu là NVMe.
  • Giữ ít nhất 20 GB trống trên ổ chứa tệp mô hình.
  • Đặt thư mục mô hình Ollama/LM Studio trên NVMe, không phải HDD hoặc SATA SSD.
  • Theo dõi VRAM khi chạy. Nếu gần 30 GB, hãy giảm độ dài ngữ cảnh trước khi hệ thống phải swap.
⚠️ Windows và Linux Trên Windows, mô hình bộ nhớ chia sẻ của Ollama cho GPU offload đôi khi hoạt động thiếu ổn định với cửa sổ ngữ cảnh rất lớn. Nếu gặp lỗi ổn định ở 32K+ trên Windows, hãy thử Linux (WSL2 hoặc cài trực tiếp) — khác biệt hiệu năng và độ ổn định là có thật.

So sánh với các lựa chọn thay thế

Mô hìnhChạy cục bộ trên RTX 5090VRAMTốc độQuyền riêng tưPhù hợp nhất với
Llama 4 Maverick Toàn bộ trên GPU Khoảng 15–18 GB Khoảng 90–110 token/giây 100% cục bộ Tác vụ chung, mã, suy luận
Llama 3.3 70B (dense) Offload một phần Khoảng 40 GB Khoảng 25–40 token/giây 100% cục bộ Cùng tác vụ, chậm hơn
Mistral Small 24B Toàn bộ trên GPU Khoảng 14 GB Khoảng 130 token/giây 100% cục bộ Tác vụ nhanh, nhẹ
GPT-4o Mini (API) Chỉ đám mây Thay đổi Dữ liệu rời máy Tiện lợi, đa phương thức
Mistral Large / Claude (API) Chỉ đám mây Thay đổi Dữ liệu rời máy Tác vụ cần chất lượng cao nhất

Đánh giá của tôi sau khi dùng tất cả các lựa chọn này: Llama 4 Maverick trên RTX 5090 đạt điểm cân bằng. Mô hình đủ nhanh, đủ thông minh và hoàn toàn riêng tư. Bạn đánh đổi một phần chất lượng đỉnh so với GPT-4o — nhưng không mất phí API, không có độ trễ tăng đột biến và mã không rời máy.

✅ Vì sao nên chạy cục bộ?

  • Không mất phí API — chạy trên GPU, chi phí phần cứng cố định
  • Quyền riêng tư dữ liệu 100% — không gì rời khỏi máy
  • Không giới hạn tốc độ hoặc gián đoạn máy chủ
  • Bản fine-tune tùy chỉnh vẫn riêng tư
  • Hoạt động ngoại tuyến

❌ Khi nào nên dùng API?

  • Đa phương thức (hình ảnh/video) — khả năng thị giác cục bộ vẫn hạn chế
  • Phiên rất dài với ngữ cảnh khổng lồ — VRAM giới hạn 32 GB
  • Mô hình trên 70B — cần hệ thống nhiều GPU
  • Khi cần năng lực suy luận tốt nhất tuyệt đối — mô hình tiên phong vẫn thắng

Câu hỏi thường gặp

RTX 5090 có thực sự chạy cục bộ Llama 4 Maverick 70B không?

Có — chỉ cần một GPU. Llama 4 Maverick dùng MoE: chỉ khoảng 17B tham số hoạt động mỗi token. Lượng tử hóa Q4_K_M dùng khoảng 15–18 GB VRAM. 32 GB của RTX 5090 còn đủ chỗ cho KV cache ở ngữ cảnh 32K+. Hai RTX 5090 là tùy chọn, không bắt buộc.

GPU RTX tối thiểu cho Llama 4 Maverick là gì?

RTX 4090 24 GB chạy được Llama 4 Maverick ở Q4_K_M — bạn cần offload một số lớp sang CPU nhưng vẫn dùng được. RTX 3080 12 GB sẽ chật vật và có thể phải swap sang RAM. RTX 5090 là điểm cân bằng cho suy luận toàn bộ trên GPU.

Tôi có cần phiên bản Ollama hoặc LM Studio cụ thể không?

Hãy dùng phiên bản mới nhất tính đến tháng 4/2026. Ollama 0.5+ và LM Studio 0.3+ hỗ trợ đúng GGUF llama4. Phiên bản cũ có thể nạp mô hình sai hoặc thiếu tối ưu MoE.

Llama 4 Maverick trên RTX 5090 nhanh đến đâu?

Lượng tử hóa Q4_K_M, ngữ cảnh 4K: khoảng 100–110 token/giây. Ở 32K: khoảng 85–90 token/giây. Ở 256K: khoảng 70–80 token/giây. Kết quả đo trên RTX 5090 mặc định, không ép xung.

Tôi có thể fine-tune Llama 4 Maverick trên RTX 5090 không?

Fine-tune toàn bộ: không — cần trên 80 GB. Fine-tune QLoRA: có — trọng số adapter 4 bit vừa trong 32 GB. Có thể mất 20–40 phút mỗi epoch tùy batch size. Phù hợp với adapter theo tác vụ, không phải huấn luyện lại toàn mô hình.

Bước tiếp theo

Cài Ollama, tải GGUF Q4_K_M và chạy suy luận cục bộ đầu tiên ngay hôm nay. Hãy bắt đầu bằng tác vụ bạn đang trả phí API và tự so sánh chất lượng đầu ra. Đó là benchmark duy nhất quan trọng với quy trình của bạn.

Muốn so sánh RTX 5090 với GPU khác cho AI cục bộ? Xem bảng xếp hạng công cụ AI đầy đủ trên AIListPrime — cập nhật hằng tuần bằng dữ liệu benchmark thực tế.

Khám phá công cụ AI trên AIListPrime →