Bài viết

Theo báo cáo từ NVIDIA Developer, Meta vừa chính thức gia nhập cuộc đua AI nguồn mở với sự ra mắt của Muse Glimmer. Đây là mô hình dense 30 tỷ tham số (30B) được thiết kế đặc biệt cho các tác nhân AI (AI Agent) hoạt động cục bộ. Với cửa sổ ngữ cảnh lên tới 120K+, Muse Glimmer không chỉ dành cho trò chuyện đơn thuần mà còn tập trung vào các luồng công việc phức tạp, yêu cầu sự nhất quán và logic đa bước.
Thay vì sử dụng kiến trúc Mixture-of-Experts (MoE), Muse Glimmer duy trì kiến trúc dense truyền thống, kích hoạt toàn bộ tham số cho mỗi token xử lý. Điều này giúp mô hình đảm bảo tính ổn định trong việc thực thi hướng dẫn, độ trễ dự đoán được và hiệu suất vượt trội trong các nhiệm vụ quản lý tri thức hoặc lập trình dự án.
Đáng chú ý, khi vận hành trên nền tảng NVIDIA, đặc biệt là dòng Blackwell Ultra, Muse Glimmer đạt tốc độ ấn tượng lên tới 20.000 token/giây trên một GPU duy nhất. Con số này cho phép các doanh nghiệp và nhà phát triển duy trì các “AI Agent không ngủ” mà không cần phụ thuộc vào API từ đám mây, đảm bảo dữ liệu nhạy cảm được bảo mật tuyệt đối bên trong hạ tầng cục bộ.

Khả năng triển khai linh hoạt là điểm nhấn của giải pháp này. Từ máy trạm cá nhân trang bị GeForce RTX 5090 cho đến các hệ thống workstation DGX Spark hay thiết bị biên Jetson, Muse Glimmer đều cho thấy sự tương thích tối ưu. NVIDIA cũng cung cấp sẵn các container NIM và thư viện NeMo để người dùng có thể tinh chỉnh mô hình (fine-tuning) một cách dễ dàng với LoRA hoặc SFT mà không cần chuyển đổi định dạng phức tạp.
Nguồn tham khảo: Run Local Agentic AI Workflows with Meta’s Muse Glimmer on NVIDIA
Bài viết là góc nhìn cá nhân của tác giả, mang tính tham khảo — không phải tin tức báo chí.
Đừng bỏ lỡ bài viết tiếp theo. Đăng ký để nhận trong inbox.

Tác giả
Tôi là Cường Nguyễn - Founder của AI Ops Solutions.
Tôi từng là Logistics Operations Manager và đồng sáng lập thương hiệu CATCA - #1 Shopee ngành Pet Care.