Bài viết

Theo The Decoder, ngày 27/08/2026, Zhipu AI (Z.ai) đã công bố GLM-5.3-Flash, danh tính thật của model thử nghiệm ẩn danh ox-alpha từng gây chú ý trên OpenRouter và OpenCode. Đây là model phát hành theo giấy phép MIT, cho phép cộng đồng dùng, sửa đổi và triển khai khá tự do.
Thông số của GLM-5.3-Flash rất đáng gờm: kiến trúc Mixture-of-Experts với 320 tỷ tham số, nhưng chỉ kích hoạt 18 tỷ tham số cho mỗi token; cửa sổ ngữ cảnh tới 1 triệu token; hỗ trợ native multimodal. Z.ai niêm yết API ở mức 0,15 USD/triệu input token và 0,50 USD/triệu output token. So với GLM-5.3 bản đầy đủ, chi phí mỗi tác vụ là 0,09 USD, thấp hơn khoảng 7,5 lần mức 0,68 USD.

Điểm hấp dẫn nhất không phải nhãn “open source”, mà là tỷ lệ hiệu năng trên chi phí. Trên Artificial Analysis Intelligence Index, GLM-5.3-Flash đạt 57 điểm, ngang GPT-5.6 Terra, Muse Spark 1.2 và Claude Opus 4.8; chỉ kém GLM-5.3 đầy đủ 3 điểm. Với tác vụ agentic, model đạt Elo 1770 trên GDPval-AA v2. Đây là loại số liệu buộc các đội kỹ thuật phải thử nghiệm thật, thay vì mặc định API đắt tiền luôn cho kết quả tốt hơn.
Điểm thứ hai còn nhạy cảm hơn: Z.ai nói hạ tầng inference của họ xử lý 100 nghìn tỷ token mỗi ngày trên hơn 100.000 chip AI nội địa Trung Quốc, không phụ thuộc Nvidia hay CUDA. Họ dùng hệ thống phục vụ tự phát triển trên SGLang và dùng agent GLM-5.3 để tối ưu tự động. Đây chưa phải lời tuyên bố rằng chip Trung Quốc đã đánh bại Nvidia ở mọi mặt. Nhưng nó là bằng chứng vận hành ở quy mô lớn: phần mềm, sparse MoE và tối ưu serving có thể bù một phần khoảng cách phần cứng.
Với startup, GLM-5.3-Flash mở ra một lựa chọn hợp lý cho AI Agent cần đọc kho tài liệu lớn, xử lý codebase hoặc chạy nhiều vòng tool calling. Context 1M token giảm áp lực phải cắt nhỏ tài liệu quá sớm. Giá token thấp giúp đội ngũ có dư địa thử prompt, đánh giá workflow và chạy batch processing mà không biến hóa đơn API thành rào cản sản phẩm.
Với doanh nghiệp có dữ liệu nhạy cảm, trọng số mở và hỗ trợ vLLM/Ollama tạo đường đi cho self-host on-premise. Dù vậy, đừng nhìn giá input rồi vội vàng thay toàn bộ model hiện có. GLM-5.3-Flash dùng khoảng 90% output token cho reasoning nội bộ, nên các workflow dài, prompt lộn xộn hoặc context nhồi nhét vẫn có thể đốt ngân sách. Cần đo riêng tỷ lệ hoàn thành tác vụ, latency, số token đầu ra và chi phí trên mỗi ticket xử lý xong.
Tôi đánh giá đây là cú ra mắt tốt và đáng tin hơn nhiều màn quảng cáo benchmark đơn lẻ. Zhipu AI đã chọn đúng chiến trường: không cố bán GLM-5.3-Flash như model mạnh nhất tuyệt đối, mà đưa hiệu năng sát nhóm frontier xuống mức giá đủ thấp để kỹ sư dám triển khai. Việc vận hành không dựa vào Nvidia càng khiến sản phẩm này có ý nghĩa chiến lược, vì nó phá giả định rằng AI chất lượng cao luôn phải đi qua CUDA.
Nhưng cộng đồng Việt không nên biến nó thành khẩu hiệu “model Trung Quốc thay thế mọi thứ”. Benchmark không thay thế evaluation trên dữ liệu tiếng Việt, tài liệu nội bộ hay luồng Agent thật. Khuyến nghị cụ thể: hãy dựng một pilot GLM-5.3-Flash cho một quy trình có thể đo được, như phân loại và trích xuất thông tin từ tài liệu; chạy song song với model đang dùng trong một tập tác vụ cố định, rồi quyết định dựa trên chi phí mỗi kết quả đạt chuẩn. Đó là cách tận dụng làn sóng model Flash mà không cược mù quáng.
Model được phát hành theo giấy phép MIT. Đây là giấy phép rất cởi mở cho việc sử dụng và triển khai, nhưng doanh nghiệp vẫn cần kiểm tra kỹ nguồn trọng số, điều khoản dịch vụ API và chính sách dữ liệu của hạ tầng mình chọn.
Có thể triển khai theo hướng self-host nhờ trọng số mở và hỗ trợ vLLM/Ollama theo thông tin công bố. Tuy nhiên, model có quy mô 320B tổng tham số; kiến trúc MoE chỉ kích hoạt 18B mỗi token không đồng nghĩa mọi hạ tầng nhỏ đều chạy được thuận lợi.
Nên thử trước khi bạn cần context dài, Agent chạy nhiều lượt hoặc cần kiểm soát chi phí inference. Nếu tác vụ đòi hỏi độ chính xác rất cao, hãy benchmark trực tiếp với model hiện tại trên dữ liệu và tiêu chí chấm điểm của chính bạn.
Nguồn tham khảo: The Decoder
Bài viết là góc nhìn cá nhân của tác giả, mang tính tham khảo — không phải tin tức báo chí.
Đừng bỏ lỡ bài viết tiếp theo. Đăng ký để nhận trong inbox.

Tác giả
Tôi là Cường Nguyễn - Founder của AI Ops Solutions.
Tôi từng là Logistics Operations Manager và đồng sáng lập thương hiệu CATCA - #1 Shopee ngành Pet Care.