⚡ Cập nhật năm 2026

LLM cục bộ và API đám mây — Số liệu chi phí thực tế cho startup

Tôi chạy 500 truy vấn AI mỗi ngày trong một tháng — cả cục bộ lẫn trên đám mây. Kết quả khiến tôi bất ngờ. Dưới đây là phân tích thẳng thắn.

Ban biên tập AIListPrime Ngày 18 tháng 4 năm 2026 Khoảng 2.100 từ · 9 phút đọc

Hầu như nhà sáng lập startup nào cũng hỏi tôi câu này: "Nên chạy LLM cục bộ hay trả phí API?" Câu trả lời không nằm ở quan điểm, mà ở phép tính. Tôi đã chạy 500 truy vấn AI mỗi ngày trong 30 ngày bằng cả hai cách. Dưới đây là chi phí chính xác, các khoản ẩn và lựa chọn phù hợp với từng giai đoạn.

⚖️

Kết luận: Với phần lớn startup giai đoạn đầu, API đám mây có lợi hơn — phương án này đơn giản, nhanh và rẻ hơn cho đến khi lưu lượng thật sự lớn. LLM cục bộ bắt đầu đáng cân nhắc ở khoảng 6–10 triệu token/tháng, nhưng chỉ khi trường hợp sử dụng phù hợp với năng lực của mô hình nguồn mở và bạn có đủ nguồn lực DevOps để vận hành ổn định.

Chi tiết chi phí thực tế mỗi tháng

Lưu lượng mỗi thángAPI đám mây (GPT-5)Cục bộ (Llama 70B trên A100)Thắng
100 nghìn token1,25 USD đầu vào + 10 USD đầu raKhoảng 3 USD (chỉ tính tiền điện)Cục bộ
1 triệu token$12.50 + $100~$30–50Cục bộ
10 triệu token$125 + $1,000~$150–300Cục bộ
100 triệu token$1,250 + $10,000~$1,500–2,000Cục bộ
1 tỷ token125.000 USD/thángKhoảng 15.000 USD/thángCục bộ (tiết kiệm 90%)

Quan trọng: Chi phí cục bộ ở trên giả định dùng A100 80GB theo nhu cầu với giá khoảng 2 USD/giờ. Phiên bản spot/preemptible có thể giảm 40–60% chi phí này, nhưng phát sinh rủi ro gián đoạn — máy ảo có thể bị thu hồi ngay giữa một truy vấn trong môi trường vận hành thực tế.

Những chi phí ẩn ít người nhắc tới

Chi phí cục bộ thực tế bằng 1,5–2 lần tiền GPU

Khi tính chi phí LLM cục bộ, nhiều đội ngũ chỉ nhìn vào tiền thuê GPU. Bức tranh thực tế còn rộng hơn. Dưới đây là những khoản thật sự xuất hiện trên hóa đơn:

Hạng mục chi phíChi phí mỗi thángGhi chú
Thuê GPU (A100 80GB, theo nhu cầu)$1,44024/7, một máy chủ
Kỹ thuật DevOps (15 giờ × 100 USD/giờ)$1,500Thiết lập, giám sát, gỡ lỗi
Hạ tầng (K8s, giám sát, cân bằng tải)$300EKS/GKE và giải pháp tương đương Datadog
Cập nhật và tinh chỉnh mô hình$200–400Chu kỳ cập nhật hằng quý
Chi phí thời gian nhàn rỗi (duy trì 24/7)Phụ phí khoảng 40%Vẫn phải trả phí khi hệ thống không xử lý tác vụ
Tổng chi phí thực tếKhoảng 3.240–3.640 USD/thángso với 1.125 USD qua API ở mức 100 triệu token

Khoản DevOps mới là phần đội chi phí mạnh nhất. Nếu đội ngũ không có người am hiểu vLLM, Kubernetes và lập lịch GPU, bạn sẽ phải thuê chuyên gia với giá từ 100 USD/giờ hoặc lấy thời gian kỹ sư vốn có thể dành cho sản phẩm.

Điểm hòa vốn thực tế nằm ở đâu

Phân tích điểm hòa vốn: cục bộ và API GPT-5

  • so với GPT-5 (10 USD/triệu token đầu ra): Điểm hòa vốn ở khoảng 2,56 tỷ token/tháng — tương đương khoảng 8,5 triệu token/ngày, hay khoảng 500 truy vấn/ngày với 17.000 token mỗi truy vấn. Phần lớn startup không bao giờ đạt mức này.
  • so với DeepSeek V3.2 (1,10 USD/triệu token đầu ra): Điểm hòa vốn ở khoảng 21 tỷ token/tháng — trên thực tế, phần lớn đội ngũ khó đạt mức này.
  • so với Gemini 2.5 Flash (0,60 USD/triệu token đầu ra): Điểm hòa vốn ở khoảng 38 tỷ token/tháng, không thực tế với 99% startup.
  • so với GPT-4.1 Nano (0,40 USD/triệu token đầu ra): Điểm hòa vốn ở khoảng 12,5 tỷ token/tháng, vẫn quá cao với startup giai đoạn đầu.

Bảng điểm đối chiếu trực tiếp

🖥️ LLM cục bộ (Llama 70B) Chi phí khi lưu lượng lớn9.0 Mức độ dễ thiết lập3.0 Quyền riêng tư dữ liệu10 Chất lượng mô hình (so với GPT-5)6.5 Độ trễ (cục bộ)8.8 ☁️ API đám mây (GPT-5) Chi phí khi lưu lượng lớn3.5 Mức độ dễ thiết lập10 Quyền riêng tư dữ liệu4.0 Chất lượng mô hình (GPT-5)9.5 Khả năng mở rộng10

Rủi ro ít người cảnh báo

⚠️ Rủi ro thường gặp: Chênh lệch chất lượng mô hình làm mất hiệu quả đầu tư

Đây là điều các công cụ tính chi phí thường không cho bạn thấy: trên các bài đo năng lực suy luận phức tạp, Llama 70B thấp hơn GPT-5 từ 10–15 điểm phần trăm. Với tác vụ đơn giản như tóm tắt, phân loại hay trích xuất thực thể, chênh lệch này không đáng kể. Nhưng với suy luận nhiều bước, tạo mã hoặc đánh giá cần nhiều sắc thái, bạn có thể phải trả cho nhiều lượt gọi hơn vì mô hình cục bộ cần trao đổi qua lại nhiều lần mới đạt chất lượng tương đương.

So sánh chi phí thực tế không chỉ là phần cứng với giá API — mà còn phải tính chất lượng đầu ra tổng thể. Nếu mô hình cục bộ cần số lượt truy vấn gấp đôi mới đạt kết quả tương đương GPT-5, chi phí hiệu dụng cũng tăng gấp đôi. Hãy tính yếu tố này trước khi kết luận triển khai cục bộ rẻ hơn.

Khung ra quyết định tôi thực sự sử dụng

Cây quyết định nhanh cho startup

  • Lưu lượng tháng < 5 triệu token: Dùng API đám mây. DeepSeek V3.2 tốn khoảng 11 USD/tháng; chi phí vận hành cục bộ lúc này chưa đáng.
  • 5–50 triệu token/tháng, không có ràng buộc về quyền riêng tư: Dùng API đám mây với mô hình tiết kiệm chi phí (Gemini 2.5 Flash ở mức 0,15 USD cho mỗi triệu token đầu vào). Phương án này vẫn đơn giản và rẻ hơn triển khai cục bộ.
  • 5–50 triệu token/tháng, có yêu cầu về quyền riêng tư: LLM cục bộ bắt đầu hợp lý. Mức ngân sách thực tế nên là 3.000–5.000 USD/tháng.
  • Trên 50 triệu token/tháng: Hãy tính toán cẩn thận. Từ 100 triệu token trở lên, triển khai cục bộ có lợi về chi phí thuần túy — nhưng chỉ khi công việc phù hợp với năng lực của mô hình nguồn mở.
  • Cần năng lực suy luận ngang GPT-5/Claude: Dùng API đám mây. Mô hình nguồn mở vẫn kém hơn ở các tác vụ phức tạp, nhiều bước.

Kiến trúc kết hợp thực sự hiệu quả

💡 Mẹo thực tế: Chuyển 70% lưu lượng sang cục bộ, 30% qua API

Kiến trúc tôi đề xuất cho startup ở thời điểm chuyển đổi là dùng Llama 7B cục bộ cho nhóm tác vụ đơn giản, lưu lượng lớn, chiếm khoảng 70% tổng lưu lượng như phân loại, trích xuất thực thể, phân tích cảm xúc và lọc nội dung. Khoảng 30% còn lại — suy luận phức tạp, tạo mã và đánh giá cần nhiều sắc thái — được chuyển đến GPT-5 hoặc Claude qua API.

Cách triển khai kết hợp này thường giảm 60–70% hóa đơn API mà vẫn giữ các đầu ra phức tạp ở chất lượng GPT-5. Logic định tuyến chỉ làm tăng độ trễ không đáng kể và khá dễ triển khai bằng LangChain hoặc bộ định tuyến tự xây dựng.

Câu hỏi thường gặp

Hỏi: LLM cục bộ có thật sự rẻ hơn API đám mây đối với startup không?

Với phần lớn startup, API đám mây vẫn rẻ hơn khi lưu lượng dưới 5–10 triệu token/tháng. Một LLM cục bộ chạy trên một GPU A100 80GB đạt điểm hòa vốn ở khoảng 6–8 triệu token/tháng. Trên ngưỡng đó, triển khai cục bộ có lợi hơn về chi phí — nhưng chỉ khi công việc phù hợp với năng lực của mô hình nguồn mở và đội ngũ có đủ nguồn lực DevOps.

Hỏi: Tôi cần GPU nào để chạy LLM cục bộ?

Với Llama 70B: nên dùng A100 80GB (khoảng 2 USD/giờ) hoặc 2 GPU A100 40GB kèm lượng tử hóa. Với Llama 7B: RTX 4090 24GB, thậm chí RTX 3060 12GB nếu lượng tử hóa Q4. Ollama giúp việc thiết lập cục bộ dễ hơn nhiều — đây là con đường nhanh nhất để bắt đầu vận hành từ con số không.

Hỏi: Chi phí ẩn thực sự của LLM cục bộ là gì?

Thời gian DevOps. Thuê một GPU nhìn qua có vẻ rẻ, nhưng công sức kỹ thuật để duy trì thời gian hoạt động, mở rộng, cập nhật mô hình và giám sát thường khiến tổng chi phí bằng 1,5–2 lần tiền GPU đơn thuần. Ngoài phí GPU, nên dự trù thêm 1.000–1.500 USD/tháng cho DevOps.

Hỏi: Khi nào startup chắc chắn nên chọn triển khai cục bộ?

Chọn triển khai cục bộ khi: (1) bạn xử lý hơn 10 triệu token/tháng; (2) dữ liệu định danh cá nhân hoặc dữ liệu nhạy cảm không được phép gửi tới API bên thứ ba; (3) bạn cần chi phí cố định, dễ dự báo để tính tốc độ đốt vốn cho nhà đầu tư; hoặc (4) phần lớn khối lượng công việc là trích xuất, phân loại đơn giản mà mô hình nguồn mở xử lý tốt.

Hỏi: Sau này tôi có thể chuyển từ API sang triển khai cục bộ không?

Có — và bạn nên bắt đầu bằng API để kiểm chứng sản phẩm. Hãy đo lượng token thực tế trong 30 ngày. Khi vượt 5 triệu token/tháng và đã xác nhận công việc phù hợp với mô hình nguồn mở, hãy lập kế hoạch chuyển đổi. Đừng tối ưu hạ tầng quá sớm khi chưa biết sản phẩm có hiệu quả hay không.

Bước tiếp theo

Hãy theo dõi lượng token thực dùng trong 7 ngày tới rồi lấy số liệu đó để tính theo đúng khối lượng công việc của bạn. Nếu dưới 5 triệu token/tháng, nên dùng API đám mây và tập trung phát triển sản phẩm. Nếu trên 10 triệu và có đủ năng lực DevOps, hãy đánh giá phương án kết hợp.

Bạn muốn xem thêm bài so sánh công cụ AI? Xem toàn bộ danh sách công cụ AI trên AIListPrime →