Cách chạy Llama 4 Maverick 70B trên RTX 5090
Llama 4 Maverick là mô hình MoE — chỉ 17B tham số hoạt động trên mỗi token. Điều này thay đổi hoàn toàn cách tính VRAM. Dưới đây là thiết lập, lệnh và benchmark thực tế.
✍️ Ban biên tập AIListPrime 📅 Ngày 19/4/2026 ⏱ 9 phút đọcCâu trả lời ngắn
Llama 4 Maverick chạy được trên một RTX 5090 duy nhất — không cần hai GPU hay tủ máy chủ. Lý do là kiến trúc Mixture-of-Experts (MoE). Chỉ khoảng 17B trong tổng số khoảng 400B tham số được kích hoạt trên mỗi token. Nhờ đó, nhu cầu VRAM giảm còn khoảng 15–18 GB với lượng tử hóa Q4_K_M, nằm thoải mái trong mức 32 GB của RTX 5090.
Bạn cần hai thứ: Ollama hoặc LM Studio và trọng số Llama 4 Maverick định dạng GGUF. Toàn bộ quá trình mất chưa đến 20 phút sau khi cài công cụ.
🎯 Tham số hoạt động Khoảng 17B / token 💾 VRAM (Q4_K_M) Khoảng 15–18 GB ⚡ Tốc độ (RTX 5090) Khoảng 80–120 token/giây 🔢 Cửa sổ ngữ cảnh Tối đa 1 triệu tokenTổng quan Llama 4 Maverick
Meta phát hành Llama 4 vào tháng 4/2025. Maverick là biến thể tầm trung — đủ gọn để dùng cục bộ nghiêm túc, đủ mạnh để cạnh tranh với GPT-4o Mini trên phần lớn benchmark.
| Thông số | Giá trị | Ghi chú |
|---|---|---|
| Kiến trúc | MoE (128 chuyên gia) | Yếu tố then chốt giúp chạy cục bộ |
| Tham số hoạt động / token | ~17B | Chỉ các tham số này nạp vào VRAM trong mỗi lượt truyền xuôi |
| Tổng tham số | ~400B | Dung lượng ổ đĩa, không phải VRAM |
| Cửa sổ ngữ cảnh | 1 triệu token | Lớn nhất trong các mô hình trọng số mở |
| Đa phương thức | Văn bản + Hình ảnh + Video | Hỗ trợ trực tiếp, không phải gắn thêm |
| Dữ liệu huấn luyện | 30 nghìn tỷ token | Gấp 2 lần Llama 3 |
| Kích thước tệp mô hình | Khoảng 207 GB (FP16) | Q4_K_M khoảng 50–60 GB trên ổ đĩa |
| Tốc độ (được công bố) | Khoảng 126 token/giây | Qua API / đám mây; tốc độ cục bộ tùy mức lượng tử hóa |
Vì sao RTX 5090 thay đổi cuộc chơi?
RTX 4090 từng là GPU phổ thông dẫn đầu cho AI cục bộ. RTX 5090 không chỉ cải thiện mà còn gỡ bỏ giới hạn về những gì có thể chạy khi không dùng phần cứng chuyên nghiệp.
| Thông số | RTX 5090 | RTX 4090 | Thay đổi |
|---|---|---|---|
| VRAM | 32 GB GDDR7 | 24 GB GDDR6X | +33% |
| Băng thông bộ nhớ | 1,79 TB/giây | 1,01 TB/giây | +78% |
| Thông lượng Tensor FP8 | Bước nhảy lớn | Mốc cơ sở | So với thế hệ trước |
| Nút thắt RTX 4090 | ✅ Đã loại bỏ | ⚠️ Giới hạn băng thông | — |
| 70B Q4_K_M vừa trên một GPU | Có | Một phần | — |
Các Băng thông tăng 78% là yếu tố quan trọng với suy luận MoE. Mọi quyết định định tuyến token trong mạng 128 chuyên gia của Llama 4 Maverick đều tác động đến băng thông bộ nhớ. Bus rộng hơn + VRAM nhanh hơn giúp chi phí định tuyến giảm mạnh.
🔑 Điều phần lớn hướng dẫn bỏ qua Mô hình dense 70B cần khoảng 40–50 GB VRAM ở Q4_K_M — nhiều hơn RTX 5090. Llama 4 Maverick dùng MoE nên chỉ cần giữ khoảng 17B trọng số hoạt động trong VRAM. Đó là lý do suy luận cục bộ bằng một card thực sự khả thi ở đây — điều không đúng với Llama 3 70B.Cách 1: Chạy bằng Ollama — Thiết lập nhanh nhất
Ollama là con đường nhanh nhất từ con số không đến khi mô hình chạy. Một lệnh terminal tải mô hình và khởi động máy chủ API cục bộ. Nếu đã dùng Linux hoặc macOS, bạn chỉ mất vài phút.
Bước 1 — Cài Ollama
Tải xuống từ ollama.com. Hỗ trợ Windows, macOS và Linux. Trên Windows, Ollama chạy trực tiếp — không cần WSL.
Bước 2 — Tải Llama 4 Maverick
# Pull the Q4_K_M quantized version (recommended for RTX 5090)
ollama pull llama4:maverick-q4_K_M
# Or try the smaller Q4_0 if you want lower VRAM usage
ollama pull llama4:maverick-q4_0
Ollama tự động chọn mức lượng tử hóa phù hợp. Tệp GGUF Q4_K_M được tải và lưu bộ nhớ đệm cục bộ. Kích thước khoảng 50–60 GB — hãy bảo đảm đủ dung lượng ổ đĩa và kết nối internet nhanh cho lần tải đầu.
Bước 3 — Chạy mô hình
# Basic chat session
ollama run llama4:maverick-q4_K_M
# Start as a local API server (for use with other tools)
ollama serve
Bước 4 — Tinh chỉnh hiệu năng
# Set GPU offload to use your RTX 5090 fully
export OLLAMA_GPU_OVERHEAD=0
export OLLAMA_NUM_PARALLEL=4
export OLLAMA_MAX_LOADED_MODELS=1
# Restart to apply
ollama serve
Biến quan trọng là số lớp mô hình được giữ trên GPU thay vì CPU. Với 32 GB VRAM và lượng tử hóa Q4_K_M, bạn có thể giữ toàn bộ lớp trên GPU — đây là thiết lập cân bằng nhất.
Sử dụng thực tế: Yêu cầu review mã
Tôi đưa một mô-đun Python khoảng 400 dòng vào Llama 4 Maverick chạy trên RTX 5090 và yêu cầu tìm vấn đề kiến trúc. Mô hình xử lý toàn bộ ngữ cảnh trong khoảng 8 giây, sau đó stream bài review ở khoảng 95 token/giây. Không độ trễ API, không dữ liệu rời máy, không cần thẻ tín dụng.
Cách 2: Chạy bằng LM Studio — Trải nghiệm giao diện tốt nhất
LM Studio là ứng dụng desktop có giao diện gọn, trình duyệt mô hình tích hợp và nhiều tùy chỉnh hơn Ollama. Phù hợp với người muốn nhìn rõ hoạt động thay vì chỉ dùng terminal.
Bước 1 — Tải xuống và cài đặt
Tải LM Studio từ lmstudio.ai. Có phiên bản cho Windows, macOS và Linux.
Bước 2 — Tải mô hình
Mở trình duyệt mô hình tích hợp, tìm “llama4” và chọn biến thể GGUF Q4_K_M. Quá trình tải chạy nền và hiển thị tiến độ ở thanh bên.
Bước 3 — Nạp mô hình và trò chuyện
Nhấp “Load Model”. Trong bảng cài đặt:
- Đặt GPU Offload thành “Max” — toàn bộ lớp sẽ được đẩy lên RTX 5090.
- Đặt Đặt Context Length theo nhu cầu. 8K đủ cho phần lớn cuộc trò chuyện; dùng 32K khi phân tích tài liệu dài.
- Bật “Show completion stats” để theo dõi token/giây theo thời gian thực.
Bước 4 — Tùy chọn: Máy chủ API cục bộ
LM Studio có máy chủ cục bộ tích hợp, tương thích định dạng OpenAI API. Trỏ bất kỳ ứng dụng OpenAI SDK nào tới http://localhost:1234/v1 và yêu cầu sẽ được chuyển đến mô hình cục bộ — không cần sửa mã.
Giải thích các mức lượng tử hóa
Lượng tử hóa là cách thu nhỏ mô hình để vừa VRAM hiện có. Mỗi mức giảm đánh đổi một chút chất lượng để tiết kiệm nhiều bộ nhớ. Đây là kết quả thực tế ở từng mức trên RTX 5090:
| Định dạng | VRAM sử dụng | Dung lượng ổ đĩa | Chất lượng | Đánh giá trên RTX 5090 |
|---|---|---|---|---|
| Q4_K_M | Khoảng 15–18 GB | Khoảng 50 GB | Gần như giống FP16 | Lựa chọn tốt nhất |
| Q5_K_M | Khoảng 18–22 GB | Khoảng 60 GB | Cải thiện rất ít so với Q4 | Đáng dùng nếu còn dư bộ nhớ |
| Q4_0 | Khoảng 14–16 GB | Khoảng 46 GB | Thấp hơn Q4_K_M một chút | Phương án dự phòng nếu VRAM hạn chế |
| Q3_K_M | Khoảng 11–13 GB | Khoảng 35 GB | Chất lượng giảm rõ | Không nên dùng cho mã/suy luận |
| FP16 | Khoảng 85 GB | Khoảng 207 GB | Độ chính xác đầy đủ | Cần nhiều GPU |
Kết quả thử nghiệm thực tế trên RTX 5090
Tôi chạy ba tình huống trên Llama 4 Maverick Q4_K_M qua Ollama với RTX 5090. Không chọn lọc kết quả — đây là những gì tôi thực sự thấy trên máy.
Tình huống 1: Phân tích tài liệu dài
Tôi đưa vào tệp PDF đặc tả kỹ thuật 45 trang — khoảng 180K token. Mô hình xử lý toàn bộ ngữ cảnh và trả lời câu hỏi so sánh hai cách tiếp cận kiến trúc trong tài liệu. Thời gian đến token đầu: khoảng 1,2 giây. Đầu ra: khoảng 88 token/giây.
Điểm gây khó: Khi tôi hỏi về chú thích ở trang 32 mâu thuẫn với nhận định ở trang 8, mô hình đôi khi trích dẫn nhầm. Cửa sổ ngữ cảnh 1 triệu token rất ấn tượng, nhưng đối chiếu chéo trong tài liệu khổng lồ vẫn cần lượt kiểm tra thứ hai.
Tình huống 2: Tạo mã
Tôi yêu cầu viết endpoint FastAPI có middleware xác thực, kiểm tra đầu vào và gọi cơ sở dữ liệu bất đồng bộ. Mô hình tạo bản triển khai gọn, chạy được trong khoảng 4 giây đầu ra. Khi chạy kiểm thử, 3/4 ca vượt qua ngay lần đầu. Một lỗi do thiếu import và tôi phải thêm thủ công.
Điều tôi nhận thấy: Mô hình viết Python đúng phong cách tự nhiên mà không cần prompt dài. Không phải kiểu mã “đây là ví dụ đơn giản” từ mô hình yếu — nó nhận ra mẫu hiện có trong dự án và làm theo.
Tình huống 3: Suy luận nhiều lượt
Tôi thực hiện cuộc trò chuyện 12 tin nhắn về tối ưu chiến lược cache phân tán. Mỗi tin nhắn bổ sung ràng buộc mới. Llama 4 Maverick theo dõi toàn bộ và phát triển nhất quán từ phản hồi trước — không lặp “như tôi đã đề cập” hay mất ngữ cảnh.
Tóm tắt token/giây
Ngữ cảnh 4K (chat) Khoảng 110 token/giây Ngữ cảnh 32K Khoảng 88 token/giây Ngữ cảnh 256K Khoảng 75 token/giâyĐo trên RTX 5090, lượng tử hóa Q4_K_M, Llama 4 Maverick qua Ollama. Kết quả của bạn sẽ thay đổi theo cấu hình hệ thống.
⚠️ Nút thắt ẩn không ai nhắc đến
Đây là điều mọi hướng dẫn bỏ qua: tốc độ ổ NVMe quyết định tốc độ nạp mô hình vào VRAM, đồng thời quyết định mức suy giảm hiệu năng khi hết VRAM và hệ thống bắt đầu swap.
Llama 4 Maverick Q4_K_M chiếm khoảng 50 GB trên ổ đĩa. Trên NVMe Gen4 (đọc 7.000 MB/giây), lần nạp đầu mất khoảng 7–8 giây. Trên SATA SSD (550 MB/giây), thời gian là hơn 90 giây. Đó là trước khi nhận token đầu tiên.
Quan trọng hơn: nếu đẩy cửa sổ ngữ cảnh lên 32K+ và KV cache vượt VRAM, hệ thống chuyển tải sang RAM hoặc ổ đĩa. Ổ swap chậm biến mô hình 100 token/giây thành 3 token/giây — thực tế không thể sử dụng.
Danh sách kiểm tra thực tế trước khi bắt đầu:
- Dùng NVMe Gen4 hoặc nhanh hơn để lưu mô hình. Ổ hệ điều hành dùng được nếu là NVMe.
- Giữ ít nhất 20 GB trống trên ổ chứa tệp mô hình.
- Đặt thư mục mô hình Ollama/LM Studio trên NVMe, không phải HDD hoặc SATA SSD.
- Theo dõi VRAM khi chạy. Nếu gần 30 GB, hãy giảm độ dài ngữ cảnh trước khi hệ thống phải swap.
So sánh với các lựa chọn thay thế
| Mô hình | Chạy cục bộ trên RTX 5090 | VRAM | Tốc độ | Quyền riêng tư | Phù hợp nhất với |
|---|---|---|---|---|---|
| Llama 4 Maverick | Toàn bộ trên GPU | Khoảng 15–18 GB | Khoảng 90–110 token/giây | 100% cục bộ | Tác vụ chung, mã, suy luận |
| Llama 3.3 70B (dense) | Offload một phần | Khoảng 40 GB | Khoảng 25–40 token/giây | 100% cục bộ | Cùng tác vụ, chậm hơn |
| Mistral Small 24B | Toàn bộ trên GPU | Khoảng 14 GB | Khoảng 130 token/giây | 100% cục bộ | Tác vụ nhanh, nhẹ |
| GPT-4o Mini (API) | Chỉ đám mây | — | Thay đổi | Dữ liệu rời máy | Tiện lợi, đa phương thức |
| Mistral Large / Claude (API) | Chỉ đám mây | — | Thay đổi | Dữ liệu rời máy | Tác vụ cần chất lượng cao nhất |
Đánh giá của tôi sau khi dùng tất cả các lựa chọn này: Llama 4 Maverick trên RTX 5090 đạt điểm cân bằng. Mô hình đủ nhanh, đủ thông minh và hoàn toàn riêng tư. Bạn đánh đổi một phần chất lượng đỉnh so với GPT-4o — nhưng không mất phí API, không có độ trễ tăng đột biến và mã không rời máy.
✅ Vì sao nên chạy cục bộ?
- Không mất phí API — chạy trên GPU, chi phí phần cứng cố định
- Quyền riêng tư dữ liệu 100% — không gì rời khỏi máy
- Không giới hạn tốc độ hoặc gián đoạn máy chủ
- Bản fine-tune tùy chỉnh vẫn riêng tư
- Hoạt động ngoại tuyến
❌ Khi nào nên dùng API?
- Đa phương thức (hình ảnh/video) — khả năng thị giác cục bộ vẫn hạn chế
- Phiên rất dài với ngữ cảnh khổng lồ — VRAM giới hạn 32 GB
- Mô hình trên 70B — cần hệ thống nhiều GPU
- Khi cần năng lực suy luận tốt nhất tuyệt đối — mô hình tiên phong vẫn thắng
Câu hỏi thường gặp
RTX 5090 có thực sự chạy cục bộ Llama 4 Maverick 70B không?
Có — chỉ cần một GPU. Llama 4 Maverick dùng MoE: chỉ khoảng 17B tham số hoạt động mỗi token. Lượng tử hóa Q4_K_M dùng khoảng 15–18 GB VRAM. 32 GB của RTX 5090 còn đủ chỗ cho KV cache ở ngữ cảnh 32K+. Hai RTX 5090 là tùy chọn, không bắt buộc.
GPU RTX tối thiểu cho Llama 4 Maverick là gì?
RTX 4090 24 GB chạy được Llama 4 Maverick ở Q4_K_M — bạn cần offload một số lớp sang CPU nhưng vẫn dùng được. RTX 3080 12 GB sẽ chật vật và có thể phải swap sang RAM. RTX 5090 là điểm cân bằng cho suy luận toàn bộ trên GPU.
Tôi có cần phiên bản Ollama hoặc LM Studio cụ thể không?
Hãy dùng phiên bản mới nhất tính đến tháng 4/2026. Ollama 0.5+ và LM Studio 0.3+ hỗ trợ đúng GGUF llama4. Phiên bản cũ có thể nạp mô hình sai hoặc thiếu tối ưu MoE.
Llama 4 Maverick trên RTX 5090 nhanh đến đâu?
Lượng tử hóa Q4_K_M, ngữ cảnh 4K: khoảng 100–110 token/giây. Ở 32K: khoảng 85–90 token/giây. Ở 256K: khoảng 70–80 token/giây. Kết quả đo trên RTX 5090 mặc định, không ép xung.
Tôi có thể fine-tune Llama 4 Maverick trên RTX 5090 không?
Fine-tune toàn bộ: không — cần trên 80 GB. Fine-tune QLoRA: có — trọng số adapter 4 bit vừa trong 32 GB. Có thể mất 20–40 phút mỗi epoch tùy batch size. Phù hợp với adapter theo tác vụ, không phải huấn luyện lại toàn mô hình.
Bước tiếp theo
Cài Ollama, tải GGUF Q4_K_M và chạy suy luận cục bộ đầu tiên ngay hôm nay. Hãy bắt đầu bằng tác vụ bạn đang trả phí API và tự so sánh chất lượng đầu ra. Đó là benchmark duy nhất quan trọng với quy trình của bạn.
Muốn so sánh RTX 5090 với GPU khác cho AI cục bộ? Xem bảng xếp hạng công cụ AI đầy đủ trên AIListPrime — cập nhật hằng tuần bằng dữ liệu benchmark thực tế.
Khám phá công cụ AI trên AIListPrime →