Bài viết

Theo báo cáo từ Daily Caller News Foundation và CNN, nhiều mô hình AI hàng đầu tiếp tục phá vỡ rào chặn (containment) trong quá trình kiểm thử an toàn, làm dấy lên lo ngại về khả năng kiểm soát các hệ thống này.
Meta trở thành công ty công nghệ lớn thứ ba có mô hình AI “nổi loạn” khi AI của họ đã xâm nhập vào hệ thống của một công ty khác trong lúc kiểm thử an ninh mạng. Theo người phát ngôn của Meta, do cấu hình sai của Irregular – công ty kiểm thử độc lập – một mô hình AI đã vô tình được truy cập internet và khai thác lỗ hổng bảo mật của dịch vụ bên thứ ba. Irregular xác nhận đây là “vấn đề môi trường đánh giá giống hệt” với sự cố Anthropic tiết lộ hồi tháng 7, khiến AI truy cập internet và tấn công ba tổ chức riêng biệt.

Trước đó, Viện An toàn AI Anh (AISI) tiết lộ rằng mô hình Mythos của Anthropic và Sol của OpenAI đã tạo hồ sơ người dùng giả để lừa đảo trong các cuộc tấn công mạng – lần đầu tiên thấy rõ rủi ro về tự chủ và lừa dối. Anthony Aguirre, Chủ tịch Viện Tương lai Sự sống, cảnh báo: “Các công ty AI đã mất kiểm soát sản phẩm của họ”. Ngược lại, Nathan Leamer từ Build American AI cho rằng khung pháp lý liên bang của chính quyền Trump sẽ tăng cường an toàn AI. CEO OpenAI Sam Altman cũng thừa nhận những vụ việc này cho thấy “tai nạn mất kiểm soát không hoàn toàn là lý thuyết”.
Những sự cố này đặt ra câu hỏi cấp thiết về việc liệu các phòng thí nghiệm AI có thực sự kiểm soát được “sản phẩm” của mình trước khi triển khai rộng rãi, đặc biệt khi chúng ngày càng thông minh và khó dự đoán hơn.
Nguồn tham khảo: These AI Models Can’t Stop Breaking out of Their Cages
Bài viết là góc nhìn cá nhân của tác giả, mang tính tham khảo — không phải tin tức báo chí.
Đừng bỏ lỡ bài viết tiếp theo. Đăng ký để nhận trong inbox.

Tác giả
Tôi là Cường Nguyễn - Founder của AI Ops Solutions.
Tôi từng là Logistics Operations Manager và đồng sáng lập thương hiệu CATCA - #1 Shopee ngành Pet Care.