Bài viết

Thị trường Local LLM đang dịch chuyển rõ từ thuê API mô hình kín sang tự vận hành mô hình Open-Weights. Theo Layer3 Labs, các họ mô hình như Meta Llama, Mistral, Alibaba Qwen, DeepSeek, Google Gemma và Microsoft Phi-4 là những lựa chọn đáng chú ý cho doanh nghiệp muốn giữ AI trong hạ tầng của mình.
Đây không phải cuộc đua tải một model về máy rồi gọi là “AI private”. Điểm đáng tiền nằm ở quyền kiểm soát: dữ liệu đi đâu, chi phí tăng ra sao và doanh nghiệp có thể chỉnh mô hình đến mức nào.
Local LLM và self-hosting hấp dẫn các tổ chức có dữ liệu nhạy cảm, yêu cầu privacy hoặc compliance trong y tế theo HIPAA và lĩnh vực pháp lý. Khi mô hình chạy tại edge hoặc on-premise, dữ liệu nội bộ không cần mặc định đi qua API của nhà cung cấp bên ngoài.
Lợi ích thứ hai là chi phí dự đoán được. Thay vì phụ thuộc giá token API và hóa đơn biến động theo lưu lượng sử dụng, doanh nghiệp quy chi phí về hạ tầng vận hành của chính mình. Lợi ích thứ ba là quyền fine-tuning độc lập, phù hợp với dữ liệu, quy trình và thuật ngữ chuyên ngành riêng.
Tôi cho rằng đây là lý do thực dụng nhất để xem xét Open-Weights: doanh nghiệp mua quyền tự chủ, không chỉ mua một chatbot thông minh hơn.
“Open-weights” không đồng nghĩa mọi mô hình đều có mức mở như nhau. Mistral sử dụng Apache 2.0; DeepSeek có giấy phép MIT. Đây là nhóm dễ tiếp cận hơn cho các đội muốn triển khai và tùy biến nội bộ theo điều kiện giấy phép tương ứng.
Ở phía khác, Llama và Gemma đi kèm Community license. Vì vậy, doanh nghiệp không nên chỉ nhìn benchmark hay số parameter trước khi chọn model. Cần đọc giấy phép trước khi thiết kế sản phẩm, nhất là khi dự án hướng tới triển khai thương mại dài hạn.
Layer3 Labs nêu hai cái tên mới từ Mỹ. Thinking Machines Lab, do cựu CTO OpenAI Mira Murati sáng lập, phát hành MoE Inkling với 975B parameter tổng, nhưng chỉ 41B parameter active mỗi query, theo chuẩn Apache 2.0.
Arcee AI cũng ra mắt Trinity Large: MoE 400B parameter, 13B active, được huấn luyện với chi phí khoảng 20 triệu USD trên 2.048 chip Nvidia Blackwell B300. Model này dùng giấy phép OpenMDW 1.1 của Linux Foundation.
Thông điệp từ các model MoE là rõ ràng: quy mô tổng rất lớn không nhất thiết đồng nghĩa mọi query đều phải trả giá tính toán như nhau. Nhưng phần cứng, bộ nhớ và vận hành vẫn là bài toán thật; đừng biến Local LLM thành một dự án mua GPU theo cảm hứng.
Nguồn tham khảo: Layer3 Labs
Bài viết là góc nhìn cá nhân của tác giả, mang tính tham khảo — không phải tin tức báo chí.
Đừng bỏ lỡ bài viết tiếp theo. Đăng ký để nhận trong inbox.

Tác giả
Tôi là Cường Nguyễn - Founder của AI Ops Solutions.
Tôi từng là Logistics Operations Manager và đồng sáng lập thương hiệu CATCA - #1 Shopee ngành Pet Care.