Bài viết

Tôi thấy rất nhiều team mua GPU với một niềm tin khá đơn giản: model open-weight tải về miễn phí, vậy tự chạy chắc chắn rẻ hơn gọi OpenAI hay Anthropic. Phép tính này nghe hợp lý nếu ta chỉ nhìn vào hóa đơn API tháng này và giá một chiếc GPU hôm nay.
Nhưng server không vận hành bằng niềm tin. Nó chạy bằng điện, VRAM, hệ thống làm mát, bản vá phần mềm, người trực khi service lỗi, và thời gian kỹ sư không làm sản phẩm vì đang truy tìm lỗi CUDA. Khi đưa các khoản đó vào Tổng chi phí sở hữu, hay TCO, câu chuyện đổi hẳn.
Điểm cần hiểu ngay: “local” không phải một lựa chọn đồng nhất. Một máy cá nhân chạy model 7B khác hoàn toàn một cụm 4 đến 8 GPU phục vụ sản phẩm có tải liên tục. Tương tự, “Cloud API” không chỉ có GPT-4.1 hay Claude 4 Opus. Hosted API cho Llama 4 Maverick, Qwen 3 235B và DeepSeek-V3 đang có mức giá thấp hơn rất nhiều.
Vì vậy, câu hỏi đúng không phải là “local hay API rẻ hơn?”. Câu hỏi đúng là: với model cần dùng, chất lượng cần đạt, số token thực tế mỗi ngày, rủi ro dữ liệu và năng lực vận hành hiện có, hạ tầng nào tạo chi phí thấp nhất trong 36 tháng?
GPU không phải tài sản rẻ vì giá mua cao. GPU đắt vì bạn mua kèm trách nhiệm vận hành nó mỗi ngày.
Nếu đang cân nhắc mua phần cứng, tôi khuyên đọc thêm bài AI mã nguồn mở hay AI cloud: đừng mua GPU trước khi tính 36 tháng. Sai lầm phổ biến nhất vẫn là lấy giá GPU chia cho số tháng sử dụng, rồi bỏ qua toàn bộ phần còn lại.

Cloud API có lợi thế lớn nhất là biến chi phí hạ tầng thành chi phí theo mức dùng. Bạn không cần đoán tải sáu tháng tới, không cần mua dư GPU để chịu peak traffic, cũng không cần dựng quy trình thay card hoặc xử lý máy chủ chết lúc nửa đêm.
Với nhóm frontier model, mức giá phân tầng rất rõ. GPT-4.1 có giá 2 USD input và 8 USD output cho mỗi triệu token. Claude 4 Sonnet là 3 USD input và 15 USD output. Claude 4 Opus lên đến 15 USD input và 75 USD output. Ở đầu còn lại, GPT-4.1 mini có giá 0,40 USD input và 1,60 USD output cho mỗi triệu token.
Đây là lý do không thể lấy giá Claude 4 Opus làm đại diện cho “giá API”. Một Workflow phân loại, trích xuất dữ liệu hay trả lời FAQ có thể không cần model đắt nhất. Nếu đội kỹ thuật mặc định gửi mọi prompt vào model frontier, chi phí tăng trước khi kiến trúc sản phẩm được tối ưu.
Hosted API cho model open-weight còn làm bài toán local khó hơn. Together.ai và Fireworks.ai phục vụ các model như Llama 4 Maverick, Qwen 3 235B hoặc DeepSeek-V3 với mức giá từ 0,15 đến 0,50 USD input và 0,40 đến 1,20 USD output cho mỗi triệu token. Với mức giá ấy, chi phí vận hành một GPU local rất dễ vượt giá API nếu tải chưa đủ lớn.
Các tác vụ không cần phản hồi đồng bộ có thể dùng Batch API để giảm 50% chi phí. Đây là chi tiết nhiều team bỏ qua khi tính ROI cho local. Job tóm tắt dữ liệu ban đêm, đánh giá tài liệu, enrichment CRM hay chạy benchmark không cần trả lời trong vài trăm mili-giây. Đem chúng sang batch trước khi mua server là bước hợp lý hơn nhiều.
Prompt caching cũng quan trọng nếu ứng dụng lặp lại system prompt, knowledge base hoặc ngữ cảnh dài. Nó làm chi phí input giảm đáng kể khi tỉ lệ lặp context cao. Một RAG có prompt dài nhưng trả lời ngắn sẽ chịu cấu trúc chi phí rất khác chatbot có hội thoại ngắn và output dài.
Cloud không vô tội. Egress network và payload overhead có thể chiếm 5% đến 15% tổng bill. Hệ thống production cần rate limit handler, backoff, retry logic, theo dõi lỗi và cơ chế chuyển provider. Với yêu cầu data residency hoặc zero-retention, doanh nghiệp có thể gặp markup 20% đến 40%.
Nhưng tôi vẫn đánh giá các khoản này dễ kiểm soát hơn việc nuôi hạ tầng local khi team chưa có MLOps. Cloud có bill rõ ràng, có quota và có dashboard. Local có nhiều chi phí “không xuất hóa đơn”: service tụt throughput, model load lại lâu, GPU nóng, cache hỏng, người dùng chờ mà không biết tại sao.
Đừng gộp một chiếc PC RTX với cụm H200 vào cùng một nhận định. Dưới đây là cách nhìn thực dụng hơn theo lượng token mỗi ngày.
Ở nhóm cá nhân hoặc team nhỏ, một PC dùng RTX 5090 32GB VRAM có chi phí thiết bị từ 3.350 USD, bao gồm card có MSRP 1.999 USD và linh kiện. Một Apple Mac Studio M4 Ultra 192GB unified memory có giá thiết bị khoảng 6.150 USD.
Con số hấp dẫn nhất thường là giá model bằng 0 USD. Nhưng TCO không dừng ở đó. Với khấu hao phần cứng 36 tháng, riêng phần này là 93 USD mỗi tháng. Điện năng cho tải 8 giờ mỗi ngày, ở mức 0,12 USD/kWh, là khoảng 190 USD mỗi năm. Thêm 2 đến 4 giờ bảo trì MLOps mỗi tháng, chi phí nhân sự có thể vào khoảng 150 đến 300 USD mỗi tháng.
Kết quả: TCO năm đầu của cấu hình light có thể lên tới khoảng 6.457 USD, tương đương 35,37 USD mỗi triệu token theo mô hình phân tích này. Con số ấy cao hơn mức 1.260 USD mỗi năm khi dùng OpenAI API và cao hơn mức 360 USD mỗi năm của open-weight API hosted.
Nói thẳng: nếu bạn chạy dưới 1 triệu token mỗi ngày, mua máy chỉ vì “API đắt” thường là quyết định cảm tính. Local ở tier này đáng khi bạn cần privacy, latency, môi trường thử nghiệm hoặc đơn giản là muốn học hạ tầng. Đừng bán nó như một dự án tiết kiệm tiền.
Đây là vùng xám thú vị nhất, nơi các startup SaaS hay bắt đầu nghiêm túc nhìn vào local. Một workstation dual RTX 5090 có chi phí khoảng 6.900 USD. Máy chủ dùng AMD MI325X 256GB HBM3e có mức đầu tư 19.000 đến 24.000 USD.
Tại mức 5 triệu token mỗi ngày, TCO 12 tháng của dàn dual-5090 là khoảng 18.387 USD. Trong đó, phần cứng và khấu hao là 1.917 USD mỗi năm, điện khoảng 570 USD mỗi năm, còn MLOps từ 8 đến 15 giờ mỗi tháng có thể lên đến 9.000 USD mỗi năm.
So với 12.600 USD mỗi năm của OpenAI trong giả định này, local vẫn tốn hơn năm đầu. Điểm đảo chiều xuất hiện vào khoảng tháng 18 đến 24, khi phần cứng đã được hấp thụ tốt hơn. TCO 36 tháng của local là khoảng 32.870 USD, thấp hơn 37.800 USD của OpenAI.
Nhưng hãy để ý điều kiện so sánh: đó là so với proprietary API. Nếu workload của bạn dùng được hosted API cho model open-weight, điểm hòa vốn không còn nằm ở 2 hay 3 triệu token/ngày. Nó có thể bị đẩy lên 15 đến 20 triệu token mỗi ngày.
Cụm production dùng 4 đến 8 NVIDIA H200, mỗi GPU có 141GB HBM3e, hoặc AMD MI325X, có chi phí hạ tầng từ 130.000 đến 310.000 USD, mức trung bình khoảng 200.000 USD. Đây không còn là chuyện dựng một máy trong văn phòng. Nó là dự án hạ tầng.
Cụm này tiêu thụ 3,2kW đến 4,5kW liên tục 24/7. Tiền điện khoảng 5.680 USD mỗi năm tại Mỹ hoặc hơn 12.000 USD mỗi năm tại EU. MLOps chuyên trách, ở mức 30 đến 60 giờ mỗi tháng, có chi phí khoảng 36.000 USD mỗi năm.
Ở tải 50 triệu token mỗi ngày, TCO 36 tháng của local được ước tính khoảng 391.707 USD, tương đương 7,15 USD mỗi triệu token. Mức so sánh được đưa ra là 378.000 USD với OpenAI và 540.000 USD với Claude Sonnet. Đây là chỗ tôi sẽ không lặp lại khẩu hiệu “local tiết kiệm 60-80%” một cách vô điều kiện, vì mức tiết kiệm phụ thuộc model API, cơ cấu input/output và tải duy trì. Dữ liệu cũng cho thấy local chưa mặc định thắng OpenAI ở mọi giả định.
Giá điện quyết định trực tiếp giá mỗi token. Cụm chạy liên tục không chỉ tiêu thụ điện cho GPU. Hạ tầng làm mát và overhead PUE cũng ăn vào ngân sách. Team ở Mỹ và team ở EU không có cùng một điểm hòa vốn, dù dùng cùng cấu hình.
Sai lầm thường gặp là lấy công suất danh nghĩa nhân với giờ chạy rồi dừng lại. Production còn có tải nền, peak, retry, model warming, monitoring và phần hạ tầng phụ trợ. Nếu máy mua về chỉ chạy thưa thớt, chi phí cố định ấy phân bổ lên từng token rất tệ.
Khấu hao phần cứng trong 36 tháng giúp bảng tính có trật tự, nhưng năng lực model và nhu cầu VRAM không chờ bảng tính hoàn tất. Một hệ thống mua để chạy model hiện tại có thể thiếu bộ nhớ khi sản phẩm cần context dài hơn, concurrency cao hơn hoặc model lớn hơn.
Tôi không nói cứ mua GPU là lỗi thời ngay. Tôi nói hãy coi rủi ro lỗi thời là chi phí thật. Nếu buộc nâng cấp sớm, toàn bộ luận điểm “local sẽ lời ở năm thứ ba” có thể mất nền tảng.
Người sáng lập thường nói “team mình tự lo được”. Có thể đúng, nhưng thời gian của team không miễn phí. 2 đến 4 giờ mỗi tháng ở tier light, 8 đến 15 giờ ở tier medium, hay 30 đến 60 giờ ở tier heavy đều phải quy thành chi phí cơ hội hoặc chi phí nhân sự.
Danh sách việc không ngắn: cập nhật CUDA, kiểm tra driver, nâng cấp vLLM, xử lý lỗi inference server, giám sát latency, kiểm soát queue, vá bảo mật, backup cấu hình, điều tra downtime. Nếu AI Agent xử lý một luồng kinh doanh quan trọng, downtime không chỉ là server im lặng; nó là Workflow của khách hàng bị dừng.
Bài AI Doanh Nghiệp 2026: Kiến Trúc Agentic và Cuộc Chiến Chủ Quyền Số phân tích kỹ hơn phần sovereignty và orchestration. Hai khái niệm này nghe có vẻ lớn lao, nhưng cuối cùng vẫn quay về câu hỏi rất đời: khi hệ thống hỏng, ai chịu trách nhiệm khôi phục?
Với model 7B hoặc 8B, điểm hòa vốn local nằm ở khoảng 500.000 đến 1 triệu token mỗi ngày. Dưới 500.000 token, Cloud API rẻ hơn tuyệt đối theo phân tích này.
Với model 70B, local có thể hòa vốn so với proprietary API ở khoảng 2 đến 3 triệu token mỗi ngày. Nhưng khi so với hosted open-weight API, ngưỡng hòa vốn tăng lên 15 đến 20 triệu token mỗi ngày.
Đây là mental model tôi dùng: local chỉ hợp lý khi tải cơ sở đủ lớn và đủ ổn định. “Tải cơ sở” là lượng token xuất hiện đều đặn, không phải peak đẹp nhất trong slide pitch deck. Peak thì cloud xử lý giỏi hơn vì bạn trả tiền khi peak thực sự xảy ra.
Đừng quên serving stack thay đổi phép toán. Ollama phù hợp dev cá nhân, ở khoảng 10 đến 20 request mỗi giây. Khi chạy production, chuyển sang vLLM hoặc TGI, tận dụng PagedAttention, Continuous Batching, FP8 hoặc AWQ, có thể tăng throughput từ 20% đến 40-100%. Một GPU dùng stack kém không phải tài sản; nó là chi phí nhàn rỗi.
Chi phí không phải biến số duy nhất. Local inference có Time-to-First-Token khoảng 20 đến 80ms, trong khi Cloud API qua Internet là 200 đến 500ms+. Chênh lệch này rất đáng tiền với code auto-complete, voice AI, giao diện tương tác real-time và Agentic Workflow có nhiều vòng gọi model.
Data sovereignty là lý do mạnh hơn cả giá. Ngành y tế, tài chính, pháp lý và R&D có thể buộc phải chạy on-premise vì HIPAA, GDPR, chính sách nội bộ hoặc bí mật IP. Chi phí trung bình của một vụ vi phạm dữ liệu được nêu ở mức 4 triệu USD+. Khi rủi ro đủ lớn, API rẻ hơn vài cent mỗi triệu token không còn là yếu tố quyết định.
Local cũng cho phép fine-tuning và thử nghiệm tự do hơn. Nhưng “open-weight” không đồng nghĩa “miễn phí” hay “vô điều kiện”. Giấy phép, quyền thương mại và chi phí triển khai vẫn cần đọc kỹ. Tôi đã viết riêng về chuyện đó trong bài AI mở không miễn phí: Cuộc chiến giành quyền thu tiền ở lớp triển khai.
Với startup early-stage, tôi nghiêng mạnh về API. Lý do không phải local dở, mà vì early-stage cần học nhu cầu khách hàng trước. Chất lượng model, prompt, UX, tool calling và thiết kế RAG thường tạo khác biệt lớn hơn việc sở hữu GPU.
Với SaaS đã có tải 1 đến 10 triệu token mỗi ngày, hãy đo usage theo model, input/output ratio, latency và tỷ lệ cache. Sau đó chạy thử local ở một Workflow có tải ổn định, ít rủi ro nhất. Đừng di trú toàn bộ hệ thống chỉ vì benchmark nội bộ đẹp.
Với doanh nghiệp lớn có tải nền cao, yêu cầu dữ liệu nghiêm ngặt và đội MLOps, kiến trúc Hybrid AI là lựa chọn có lý nhất: local-first cho tải thường nhật; Cloud API cho burst traffic, fallback và frontier reasoning. Cách làm này tránh mua phần cứng cho peak hiếm gặp, nhưng vẫn giữ quyền kiểm soát trên dữ liệu và latency ở các luồng quan trọng.
Tôi sẽ triển khai theo bốn bước: đo token thật; phân loại Workflow theo latency và độ nhạy dữ liệu; pilot một model open-weight với serving stack production; cuối cùng mới đưa routing Hybrid vào vận hành. Không có bước nào nên bắt đầu bằng việc đặt mua GPU.
Với model 7B/8B, ngưỡng hòa vốn nằm ở khoảng 500.000 đến 1 triệu token mỗi ngày. Với model 70B, ngưỡng là 2 đến 3 triệu token mỗi ngày nếu so với proprietary API. Nếu đối thủ là hosted open-weight API giá thấp, ngưỡng có thể lên 15 đến 20 triệu token mỗi ngày.
Vì nhiều bảng tính chỉ tính GPU và điện. Thực tế còn có thời gian cập nhật driver, vận hành vLLM hoặc TGI, theo dõi throughput, xử lý downtime, backup và bảo mật. Ở tier medium, chi phí MLOps được ước tính khoảng 9.000 USD mỗi năm.
Mac Studio M4 Ultra 192GB unified memory là lựa chọn đáng cân nhắc cho nhu cầu local cá nhân hoặc team nhỏ, đặc biệt khi cần bộ nhớ lớn trong một máy. Nhưng ở tải dưới 1 triệu token mỗi ngày, TCO năm đầu vẫn không cạnh tranh với Cloud API chỉ xét riêng chi phí token.
Theo tôi, chưa nên nếu startup chưa có tải ổn định hoặc chưa có người vận hành hạ tầng. Hãy dùng API để xác nhận sản phẩm, sau đó đo lượng token nền. Local phù hợp hơn khi số liệu đã chứng minh rằng tải đủ đều và yêu cầu latency hoặc dữ liệu thực sự cần on-premise.
Điểm hòa vốn local sẽ bị đẩy cao hơn. Đây là rủi ro cốt lõi của việc lấy lợi ích năm thứ ba để biện minh cho khoản đầu tư hôm nay. Hardware là chi phí cố định, còn API có thể giảm giá, thêm cache hoặc giảm 50% qua Batch API cho workload phù hợp.
Nguồn tham khảo: Chạy AI local 2026: Khi nào đáng, khi nào không — So chi phí thật TCO với Cloud API
Bài viết là góc nhìn cá nhân của tác giả, mang tính tham khảo — không phải tin tức báo chí.
Đừng bỏ lỡ bài viết tiếp theo. Đăng ký để nhận trong inbox.

Tác giả
Tôi là Cường Nguyễn - Founder của AI Ops Solutions.
Tôi từng là Logistics Operations Manager và đồng sáng lập thương hiệu CATCA - #1 Shopee ngành Pet Care.