Bài viết

NVIDIA đang gom nhiều mảnh ghép Open Source & Local AI thành một thông điệp rõ ràng: AI Agent không nhất thiết phải gửi dữ liệu và tác vụ lên cloud. Theo NVIDIA, Perplexity đã giới thiệu Portable Computer, ứng dụng tác vụ cá nhân chạy cục bộ trên NVIDIA DGX Spark, dùng các model open-weights gồm Qwen 3.8 27B và Nemotron 3.5 Lightning đã tinh chỉnh.
Đây không phải tin “AI chạy offline” cho có. Khi model lớn đạt tốc độ đủ dùng trên phần cứng cá nhân, Local AI bắt đầu có cơ hội thành lựa chọn thực tế cho dữ liệu nhạy cảm và quy trình cần kiểm soát chặt.
Portable Computer của Perplexity được thiết kế như một ứng dụng tác vụ cá nhân chạy ngay trên DGX Spark. Hướng đi này cho phép AI Agent xử lý công việc cục bộ, với riêng tư hoàn toàn và không bị giới hạn token theo mô tả của NVIDIA.
Điểm đáng chú ý nằm ở lựa chọn model: Qwen 3.8 27B đảm nhiệm nền tảng open-weights, trong khi Nemotron 3.5 Lightning là lớp model đã được tinh chỉnh. Perplexity đang thử một hướng khác với mô hình chatbot web quen thuộc: đem trải nghiệm agent tới thiết bị do người dùng hoặc doanh nghiệp trực tiếp vận hành.
NVIDIA cho biết Qwen3.8-27B đạt 131 tokens/giây trên GeForce RTX 5090 nhờ cơ chế Multi-Token Prediction (MTP). Con số này quan trọng vì model 27B thường bị xem là quá nặng với nhu cầu chạy tại máy.
Meta Muse Glimmer 30B còn vượt 200 tokens/giây trên RTX 5090 qua llama.cpp và vLLM. Song song đó, Cosmos 3 Edge 4B nhắm vào robotics và edge, mở rộng Local AI ra ngoài laptop hay máy bàn.
Theo tôi, tốc độ không tự động khiến Local AI thắng cloud. Nhưng nó xóa một trong các lý do lớn nhất để bỏ cuộc sớm: trải nghiệm chậm đến mức không thể dùng hằng ngày.
Hệ sinh thái cũng đang bớt rời rạc. Unsloth Desktop là ứng dụng desktop mã nguồn mở hỗ trợ cả fine-tuning lẫn inference cục bộ, hướng tới quy trình train và run riêng tư trên một máy. NeMo Switchyard, bộ công cụ điều hướng mã nguồn mở của NVIDIA, được giới thiệu có thể giảm tới 2/3 chi phí suy luận so với chạy model cloud.
Tôi cho rằng đây mới là phần đáng theo dõi nhất. Model open-weights đã nhiều; thứ thị trường thiếu là đường triển khai đủ đơn giản để đội kỹ thuật nhỏ không phải tự ghép từng mảnh hạ tầng.
Nguồn tham khảo: NVIDIA
Bài viết là góc nhìn cá nhân của tác giả, mang tính tham khảo — không phải tin tức báo chí.
Đừng bỏ lỡ bài viết tiếp theo. Đăng ký để nhận trong inbox.

Tác giả
Tôi là Cường Nguyễn - Founder của AI Ops Solutions.
Tôi từng là Logistics Operations Manager và đồng sáng lập thương hiệu CATCA - #1 Shopee ngành Pet Care.