Bài viết

NVIDIA vừa công bố loạt cập nhật cho hệ sinh thái Local AI, từ LLM và AI Agent chạy trên RTX GPU, DGX Spark, DGX Station đến Jetson. Theo NVIDIA, các bản tối ưu mới giúp mô hình Open Source đạt tốc độ cao ngay trên phần cứng cục bộ, thay vì mặc định phải gửi tác vụ lên cloud.
Đây là tín hiệu đáng chú ý: Local AI đang rời khỏi vùng thử nghiệm của dân kỹ thuật để tiến gần hơn tới một lựa chọn triển khai thực dụng cho nhóm phát triển, doanh nghiệp và người dùng cần giữ dữ liệu tại chỗ.
NVIDIA đã kích hoạt hỗ trợ day-zero cho Qwen3.8-27B, mô hình open-weights được tối ưu multi-token prediction (MTP) qua llama.cpp, Ollama, LM Studio Bionic và Unsloth. Trên một card GeForce RTX 5090, mô hình đạt 131 tokens/giây.
Ở hướng AI Agent chạy liên tục, Meta Muse Glimmer là mô hình dense open-weights 30B, hỗ trợ context hơn 120K và đạt hơn 200 tokens/giây trên RTX 5090. Tốc độ này nhắm thẳng vào coding agent và các workflow offline, nơi dữ liệu riêng tư không nên bị đẩy ra API của bên thứ ba.
Tôi cho rằng tốc độ không phải toàn bộ câu chuyện. Giá trị lớn hơn là cộng đồng có thêm lựa chọn thực sự để tự vận hành agent, kiểm soát dữ liệu và giảm mức phụ thuộc vào một nhà cung cấp cloud.
NVIDIA cũng giới thiệu Nemotron 3.5 Lightning, mô hình MoE mã nguồn mở 30B với tốc độ tạo token được tăng 4 lần. Đi kèm là thư viện định tuyến NeMo Switchyard, được NVIDIA mô tả có thể cắt chi phí tính toán benchmark tới 2/3 so với Opus 4.8.
Đây là mảnh ghép cần thiết cho AI Agent: không phải mọi yêu cầu đều đáng dùng một model đắt tiền. Routing tốt sẽ chọn model phù hợp theo tác vụ, thay vì biến agent thành cỗ máy đốt GPU.
Unsloth Desktop ra mắt như ứng dụng desktop mã nguồn mở đầu tiên kết hợp huấn luyện và inference mô hình cục bộ. Điều này thu hẹp khoảng cách giữa việc tải một model về chạy thử và tự tinh chỉnh nó cho dữ liệu, quy trình riêng.
Điểm tôi đánh giá cao là NVIDIA đang đẩy đồng thời phần cứng, runtime và cộng đồng công cụ Open Source. Dù vậy, Local AI vẫn cần người dùng hiểu rõ giới hạn VRAM, độ chính xác model và chi phí điện; đây chưa phải phép màu thay thế cloud cho mọi nhu cầu.
Nguồn tham khảo: NVIDIA
Bài viết là góc nhìn cá nhân của tác giả, mang tính tham khảo — không phải tin tức báo chí.
Đừng bỏ lỡ bài viết tiếp theo. Đăng ký để nhận trong inbox.

Tác giả
Tôi là Cường Nguyễn - Founder của AI Ops Solutions.
Tôi từng là Logistics Operations Manager và đồng sáng lập thương hiệu CATCA - #1 Shopee ngành Pet Care.