Bài viết

Ngày 17-18/08/2026, chuyên gia lượng tử hóa LLM mã nguồn mở bartowski, được Red Hat tài trợ và LTT Labs hỗ trợ GPU, công bố bộ dữ liệu hiệu chuẩn imatrix v6 cho llama.cpp và GGUF. Theo Hugging Face, đây là lời giải cho một lỗi khó chịu của Local AI: model nén xuống mức cực thấp vẫn có thể trả lời, nhưng âm thầm mất năng lực gọi công cụ.
Điểm đáng chú ý không nằm ở việc làm model “thông minh hơn”. imatrix v6 giúp giữ lại đúng phần trí thông minh mà quy trình lượng tử hóa thường vô tình xóa đi.
Nghiên cứu thử nghiệm trên 7 model, gồm Qwen3.8-27B, Qwen3.6-35B-A3B, Mistral-Small-4-119B và Qwen3-Next-80B-A3B. Kết quả cho thấy tại các mức lượng tử hóa rất thấp như Q2_K và IQ2, model MoE thiếu imatrix phù hợp có thể tụt tới 28 điểm phần trăm trên benchmark gọi công cụ BFCL: từ 82% xuống 54%.
Đây không phải lỗi benchmark nhỏ. Một AI Agent local không gọi đúng tool thì dù phần hội thoại nghe có vẻ trôi chảy, nó vẫn hỏng ở tác vụ thực dụng nhất: dùng API, chạy workflow hay điều phối công cụ.
Với kiến trúc MoE, các expert không được kích hoạt đồng đều. Nhiều expert chỉ xuất hiện khi model gặp cấu trúc thẻ chat hoặc tool calling đặc thù. Một corpus tool thuần tiếng Anh từng bỏ sót 18 trên 512 expert ở model 80B, khiến dữ liệu hiệu chuẩn không nhìn thấy đầy đủ hành vi thật của model trước khi nén.
imatrix v6 dùng tỷ lệ 2:3 giữa văn bản đa ngôn ngữ, mã nguồn và dữ liệu hội thoại có định dạng tool. Cách trộn này nhắm trực diện vào expert coverage, thay vì chỉ nhồi thêm văn bản phổ thông rồi hy vọng model giữ được năng lực agentic.
Theo tôi, đây là chi tiết mà nhiều bản GGUF cộng đồng từng xem nhẹ: quantization không chỉ là bài toán giảm VRAM, mà là bài toán chọn đúng dữ liệu để đo giá trị của từng trọng số.
Với người tự host LLM, imatrix v6 mở ra khả năng chạy model lớn ở mức nén mạnh hơn mà ít phải đánh đổi năng lực suy luận và tool calling. Điều này đặc biệt có giá trị cho máy cá nhân, thiết bị edge và các triển khai bị giới hạn VRAM.
Tôi đánh giá đây là một nâng cấp thực dụng hơn nhiều so với các cuộc đua benchmark hào nhoáng. Local AI chỉ thật sự hữu ích khi model nhỏ gọn vẫn làm được việc, thay vì chỉ trả lời hay trong cửa sổ chat.
Nguồn tham khảo: Hugging Face
Bài viết là góc nhìn cá nhân của tác giả, mang tính tham khảo — không phải tin tức báo chí.
Đừng bỏ lỡ bài viết tiếp theo. Đăng ký để nhận trong inbox.

Tác giả
Tôi là Cường Nguyễn - Founder của AI Ops Solutions.
Tôi từng là Logistics Operations Manager và đồng sáng lập thương hiệu CATCA - #1 Shopee ngành Pet Care.