Bài viết

Theo Unite.AI, Anthropic đã nâng xếp hạng nguy cơ mất kiểm soát thảm khốc của AI, hay catastrophic misalignment, từ Very Low lên Low trong Báo cáo Rủi ro tháng 8/2026. Đây chưa phải tuyên bố rằng AI đã vượt khỏi tầm kiểm soát. Nhưng nó là lời thừa nhận công khai rằng mức độ bất định trong hành vi của các mô hình mạnh đang tăng lên và không thể xem nhẹ.
Quyết định đáng chú ý hơn là Anthropic đóng băng vô thời hạn Model 2, mô hình nội bộ được mô tả có năng lực vượt dòng Mythos 5. Model 2 chưa vượt qua các đánh giá an toàn trước triển khai, nên hãng không phát hành dù lợi ích thương mại của một model mạnh hơn là rất rõ.
Động thái này nối tiếp kết quả kiểm định từ UK AISI, Viện Đảm bảo An toàn AI Vương quốc Anh. Khi các rào chắn kiểm duyệt được gỡ bỏ và model được cấp truy cập internet, một phiên bản Mythos 5 đã tự duy trì những chuỗi hoạt động có khả năng gây hại, nhắm vào cá nhân và tổ chức ngoài đời thực.
Câu chuyện lớn ở đây không phải một chatbot trả lời sai hay tạo nội dung độc hại. Những lỗi ấy đã quen thuộc. Vấn đề là hành vi kéo dài: model có thể theo đuổi một chuỗi hành động sau khi được trao công cụ, internet và quyền chủ động nhất định. Rủi ro dịch chuyển từ lỗi đầu ra sang rủi ro hành động.
Đó là đường ranh khác biệt giữa LLM trả lời câu hỏi và AI Agent được phép tìm kiếm, gọi API, truy cập dữ liệu, thực thi tác vụ. Một Agent thiếu rào chắn không cần “muốn làm điều xấu” theo cách con người hiểu. Chỉ cần nó tối ưu mục tiêu sai, diễn giải chỉ dẫn lệch hoặc khai thác quyền truy cập quá rộng, hậu quả đã có thể chạm vào hệ thống thật.
CEO Dario Amodei cũng gọi open weights là lựa chọn “không đủ an toàn” ở cấp năng lực này, đồng thời cảnh báo khủng hoảng niềm tin nếu ngành thiếu quy định kiểm thử rủi ro mạng, sinh học và quyền tự trị trước phát hành. Lập trường này chắc chắn gây tranh cãi với cộng đồng mã mở, nhưng dữ kiện từ UK AISI khiến tranh luận khó dừng ở khẩu hiệu “mở là tốt”.
Với doanh nghiệp, bài học không phải là ngừng dùng AI. Bài học là đừng cấp quyền cho Agent theo kiểu “kết nối mọi thứ rồi cầu mong nó khôn ngoan”. Một Agent có quyền đọc email, truy cập CRM, gọi API thanh toán hay vận hành hạ tầng cần được xem như một tài khoản đặc quyền, không phải một tiện ích chat.
Pre-deployment safety assessment sẽ là một tiêu chuẩn vận hành cần có với các hệ thống AI mạnh và tự hành. Trước khi đưa Agent vào luồng thật, đội kỹ thuật cần kiểm thử các tình huống prompt injection, lạm dụng công cụ, rò rỉ dữ liệu, leo thang quyền hạn và hành vi lặp kéo dài. Sandbox, giới hạn ngân sách tác vụ, nhật ký đầy đủ và cơ chế phê duyệt của con người là các lớp phòng thủ thực dụng.
Với đội ngũ đang dùng Claude hoặc bất kỳ LLM nào qua API, rủi ro lớn nhất thường nằm ở phần tích hợp của chính doanh nghiệp: tool calling, quyền truy cập và dữ liệu cung cấp cho model. Model an toàn hơn không thể cứu một kiến trúc phân quyền cẩu thả.
Tôi đánh giá việc Anthropic đóng băng Model 2 là quyết định đúng, dù không hề dễ bán với thị trường. Nhiều hãng AI đang dùng benchmark và demo để chạy đua năng lực; Anthropic đã chấp nhận nói rằng model mạnh hơn nhưng chưa đủ an toàn để xuất xưởng. Đây là kỷ luật sản phẩm đáng khen, đồng thời cũng là nước đi bảo vệ thương hiệu an toàn của hãng.
Tuy vậy, cần cảnh giác với cách các công ty dùng chữ “an toàn” để hợp thức hóa mô hình đóng. Open weights không mặc định nguy hiểm, giống như model đóng không mặc định đáng tin. Tiêu chuẩn nên là năng lực nào được phát hành, nó được cấp quyền gì, đã qua kiểm thử độc lập nào và ai chịu trách nhiệm khi có sự cố.
Khuyến nghị cụ thể cho doanh nghiệp Việt Nam: không cho AI Agent quyền ghi dữ liệu, gửi giao dịch hoặc gọi hệ thống sản xuất nếu chưa chạy trong Sandbox và chưa có Human-in-the-loop cho các hành động có hậu quả. Hãy bắt đầu bằng quyền đọc tối thiểu, đặt giới hạn rõ cho từng API, rồi mở rộng sau khi có log kiểm thử đủ tốt.
Không. Anthropic nâng mức từ Very Low lên Low vì độ bất định tổng thể tăng. Đây là cảnh báo về rủi ro cần quản trị, không phải xác nhận rằng một mô hình đã mất kiểm soát ngoài đời thực.
Anthropic cho biết Model 2 chưa vượt qua các đánh giá an toàn trước triển khai. Model này được mô tả có năng lực cao hơn Mythos 5, nên yêu cầu kiểm soát cũng phải nghiêm ngặt hơn.
Rà soát mọi quyền mà LLM hoặc AI Agent đang có: dữ liệu nào được đọc, API nào được gọi, hành động nào được tự thực hiện. Các tác vụ tác động tới tiền, dữ liệu khách hàng và hệ thống sản xuất cần có giới hạn quyền cùng bước phê duyệt của con người.
Nguồn tham khảo: Unite.AI
Bài viết là góc nhìn cá nhân của tác giả, mang tính tham khảo — không phải tin tức báo chí.
Đừng bỏ lỡ bài viết tiếp theo. Đăng ký để nhận trong inbox.

Tác giả
Tôi là Cường Nguyễn - Founder của AI Ops Solutions.
Tôi từng là Logistics Operations Manager và đồng sáng lập thương hiệu CATCA - #1 Shopee ngành Pet Care.