SẮC CHỈNH KỸ THUẬT · ĐƯỢC XÁC MINH NGÀY 11 THÁNG 8 NĂM 2026

Bạn có thể chạy Llama 4 Maverick trên RTX 5090 không? Giới hạn thực tế

Hướng dẫn trước đây đã xử lý sai Llama 4 Maverick giống như mẫu 70B hoàn toàn phù hợp với 15–18GB VRAM. Thẻ mô hình của Meta cho biết Maverick là mô hình hỗn hợp của các chuyên gia với 17B tham số được kích hoạt và tổng tham số là 400B. Các tham số được kích hoạt mô tả tính toán trên mỗi mã thông báo; điều đó không có nghĩa là chỉ phải lưu trữ trọng số 17B.

Nghiên cứu dựa trên nguồn chính thức

Trang này thay thế phiên bản cũ có thông tin lỗi thời hoặc tuyên bố thiếu căn cứ.

Thông tin đã xác minh

01

Meta liệt kê Llama 4 Maverick dưới dạng 17B tham số được kích hoạt, 128 chuyên gia và tổng số 400B tham số với cửa sổ ngữ cảnh 1M.

02

Meta phân phối trọng số BF16 và FP8 và cho biết trọng số FP8 chính thức vừa vặn trên một đơn vị Máy chủ H100 DGX, không phải GPU dành cho người tiêu dùng 32GB.

03

Việc lượng tử hóa của bên thứ ba có thể sử dụng tính năng giảm tải RAM, CPU hoặc ổ đĩa của hệ thống, nhưng điều đó khác với việc giữ mô hình hoàn chỉnh trong RTX 5090 VRAM.

04

Các lệnh Ollama cũ, xác nhận quyền sở hữu 15–18 GB và điểm chuẩn 80–120 mã thông báo mỗi giây không được hỗ trợ bởi bằng chứng có thể tái tạo và đã được hỗ trợ đã xóa.

Một quyết định triển khai cục bộ thực tế

  1. Hãy sử dụng model nhỏ hơn nếu bạn cần hiệu suất GPU đơn có thể dự đoán được trên VRAM 32 GB.
  2. Nếu thử nghiệm lượng tử hóa cộng đồng, hãy xác minh kích thước tệp chính xác, hỗ trợ thời gian chạy, yêu cầu RAM, độ dài ngữ cảnh và tốc độ đo được trước khi tải xuống.
  3. Hãy coi kết quả điểm chuẩn là dành riêng cho cấu hình: lượng tử hóa, phân chia giảm tải, độ dài lời nhắc và băng thông bộ nhớ, tất cả đều thay đổi hiệu suất.
Xác minh dữ liệu · 2026-08-11

Nguồn chính thức đã kiểm tra