Bài viết


Qwen3.6 là dòng model multimodal, hybrid-thinking mã nguồn mở của Alibaba, gồm hai bản Qwen3.6-27B và Qwen3.6-35B-A3B. Theo tài liệu của Unsloth, chúng phục vụ chat, coding, vision và AI Agent, hỗ trợ context tới 256K cùng 201 ngôn ngữ.
Điểm khiến giới kỹ thuật phải nhìn kỹ không nằm ở một khẩu hiệu “model mới mạnh hơn”. Bản 27B có thể chạy ở cấu hình 4-bit với khoảng 18GB bộ nhớ; bản 35B-A3B cần khoảng 23GB. Mức này mở đường cho đội ngũ kỹ thuật triển khai AI nội bộ trên hạ tầng nhỏ hơn nhiều so với hình dung quen thuộc về frontier model.
Unsloth cũng công bố kết quả MTP: Qwen3.6-27B tạo khoảng 160 tokens/giây, còn 35B-A3B đạt 240 tokens/giây trên RTX 6000. Con số tăng tốc được nêu là 1,4–2,2 lần mà không đổi độ chính xác theo tài liệu.
Cuộc đua AI đang tách làm hai mặt trận. Một bên là model khổng lồ chạy trên cloud, chất lượng tổng quát cao và phụ thuộc API. Bên kia là model mở, đủ gọn để doanh nghiệp tự kiểm soát dữ liệu, workflow và chi phí inference. Qwen3.6 đang đánh thẳng vào mặt trận thứ hai.
Ở định dạng NVFP4 trên GPU Blackwell, Unsloth cho biết bản 27B nhanh hơn khoảng 2,5 lần với 24GB VRAM; 35B-A3B nhanh hơn 1,7 lần với 32GB VRAM. Nếu các cấu hình này vận hành ổn định trên workload thật, rào cản để dựng coding assistant hoặc chatbot tài liệu nội bộ sẽ giảm đáng kể.
Bảng benchmark cũng rất đẹp: Qwen3.6-27B đạt 86,25 MMLU-Pro, 86,34 GPQA và 93,12 AIME 2025 trong bản Unsloth. Bản 35B-A3B lần lượt đạt 85,85, 86,74 và 92,29. Dù vậy, đây là số liệu do nguồn triển khai công bố, chưa phải một phép đối đầu độc lập, đầy đủ với GPT, Claude hay Gemini. Đừng biến một bảng điểm thành bản án chung cuộc cho cả thị trường.
Qwen3.6 hợp với các bài toán cần dữ liệu ở lại trong hệ thống: chatbot hỏi đáp tài liệu nội bộ, trợ lý coding đọc repository, workflow xử lý ảnh và văn bản, hoặc AI Agent gọi công cụ trong mạng doanh nghiệp. Context 256K đặc biệt hữu ích khi cần nạp tài liệu dài hay nhiều file mã nguồn vào một phiên làm việc.
Tốc độ 160–240 tokens/giây nghe rất hấp dẫn, song cần hiểu đúng: trải nghiệm production còn phụ thuộc prompt dài hay ngắn, số người dùng đồng thời, công cụ gọi qua API, cache và giới hạn GPU. Agent chậm thường không chết vì model sinh token; nó chết ở khâu truy xuất dữ liệu, gọi tool lỗi hoặc vòng lặp suy luận thiếu kiểm soát.
Vì thế, đừng chọn model chỉ vì tên lớn hay benchmark cao. Hãy đo chi phí trên mỗi tác vụ hoàn tất: một pull request được sửa đúng, một hóa đơn được trích xuất chuẩn, hay một câu trả lời có dẫn nguồn đúng quyền truy cập.
Tôi đánh giá cao hướng đi của Qwen3.6: đưa một model multimodal có context dài vào vùng phần cứng mà nhiều team có thể chạm tới. Đó là lợi thế có giá trị hơn nhiều lời quảng bá về “AI thông minh nhất”, vì quyền kiểm soát dữ liệu và khả năng tùy biến mới quyết định model có sống được trong doanh nghiệp hay không.
Nhưng tôi không mua luận điểm Qwen3.6 đã vượt GPT, Claude hay Gemini. Nguồn hiện có chưa đưa ra bộ benchmark đối đầu độc lập và toàn diện để kết luận như vậy. Benchmark tốt là vé vào sân; chất lượng ổn định ở tác vụ dài, gọi tool, xử lý tiếng Việt và chống lỗi mới quyết định ai thắng.
Khuyến nghị thực dụng: hãy thử Qwen3.6 bằng một dự án có tiêu chí nghiệm thu rõ ràng, chẳng hạn giao model xử lý 10 issue tồn đọng trong repository, yêu cầu tạo patch, chạy test và ghi rõ lý do thay đổi. So sánh tỷ lệ hoàn tất, thời gian phản hồi, chi phí GPU và tỷ lệ phải sửa tay với model API đang dùng. Số liệu nội bộ đó đáng tin hơn mọi biểu đồ marketing.
Chưa đủ dữ liệu để khẳng định. Unsloth công bố các điểm MMLU-Pro, GPQA và AIME 2025 cao, nhưng nguồn không có bảng so sánh độc lập, đầy đủ với các model frontier trên cùng điều kiện đánh giá.
Theo tài liệu Unsloth, Qwen3.6-27B cần khoảng 18GB bộ nhớ ở cấu hình 4-bit, còn Qwen3.6-35B-A3B cần khoảng 23GB. Nhu cầu thực tế vẫn phụ thuộc runtime, context, lượng người dùng đồng thời và cấu hình triển khai.
Unsloth cho biết MTP tăng tốc khoảng 1,4–2,2 lần mà không thay đổi độ chính xác. Dù vậy, đội triển khai nên tự kiểm tra trên dữ liệu và workflow của mình trước khi đưa vào production.
Nguồn tham khảo: Qwen 3.6 đối đầu AI frontier: Mạnh đến đâu?
Bài viết là góc nhìn cá nhân của tác giả, mang tính tham khảo — không phải tin tức báo chí.
Đừng bỏ lỡ bài viết tiếp theo. Đăng ký để nhận trong inbox.

Tác giả
Tôi là Cường Nguyễn - Founder của AI Ops Solutions.
Tôi từng là Logistics Operations Manager và đồng sáng lập thương hiệu CATCA - #1 Shopee ngành Pet Care.