Bài viết

Theo TechCrunch, tranh chấp về việc huấn luyện LLM bằng sách có bản quyền đang được định hình bởi một ranh giới pháp lý rất cụ thể: mô hình học từ tác phẩm không đồng nghĩa với việc doanh nghiệp được quyền lấy dữ liệu từ mọi nguồn.
Phán quyết trong vụ Anthropic là tiền lệ đáng chú ý. Công ty phải nộp 1,5 tỷ USD, nhưng trọng tâm của án phạt không phải hành vi huấn luyện AI trên sách bản quyền, mà là việc lấy sách từ các “shadow libraries” — các thư viện lậu trực tuyến.
Thẩm phán William Alsup cho rằng cách LLM tiếp nhận khối lượng dữ liệu khổng lồ có thể tương tự một người đọc say mê để học viết và tạo ra tác phẩm mới, thay vì sao chép trực tiếp nguyên tác. Lập luận này nghiêng về học thuyết Fair Use, đặc biệt khi việc sử dụng dữ liệu mang tính biến đổi, hay transformative use.
Tuy vậy, phán quyết không phải giấy phép trắng cho các hãng AI. Anthropic bị phạt vì nguồn dữ liệu bất hợp pháp. Đây là điểm các công ty công nghệ dễ cố tình làm mờ: mục đích huấn luyện có thể được tranh luận dưới Fair Use, còn cách doanh nghiệp thu thập bản sao tác phẩm là một câu chuyện pháp lý khác.
Tôi cho rằng đây là thông điệp chính sách hợp lý nhất hiện nay: luật cần phân biệt rõ việc máy học từ tri thức với hành vi xây kho dữ liệu từ nội dung vi phạm bản quyền.
Luật sư sở hữu trí tuệ Cathy Gellis và chuyên gia Jason Henderson của JWL International chỉ ra Đạo luật Bản quyền Mỹ chưa được cập nhật từ năm 1976, tức khoảng 50 năm. Vì thế, tòa án đang phải áp dụng các nguyên tắc cũ cho hoạt động mà nhà làm luật khi đó chưa thể hình dung: mô hình xử lý và rút ra quy luật từ lượng văn bản rất lớn.
Điểm nhạy cảm nằm ở cạnh tranh trực tiếp. Một LLM tổng quát học quy luật ngôn ngữ khác với một hệ thống sao chép hoặc tái tạo tác phẩm để thay thế thị trường của sách gốc. Chính sách tốt phải buộc doanh nghiệp chứng minh được ranh giới này, thay vì chỉ treo biển “AI” lên mọi hoạt động khai thác nội dung.
Tiền lệ Thaler v. Perlmutter củng cố nguyên tắc rằng tác phẩm được AI tạo ra hoàn toàn không được cấp quyền bảo hộ tác giả. Với doanh nghiệp, điều này tạo thế kẹt rõ ràng: dữ liệu đầu vào có thể vướng bản quyền, trong khi đầu ra thuần AI lại không được độc quyền tác giả.
Theo tôi, các hãng AI nên ngừng coi kiện tụng là chi phí vận hành. Họ cần cơ chế truy xuất nguồn dữ liệu và thỏa thuận cấp phép minh bạch nếu muốn xây sản phẩm bền vững.
Nguồn tham khảo: TechCrunch
Bài viết là góc nhìn cá nhân của tác giả, mang tính tham khảo — không phải tin tức báo chí.
Đừng bỏ lỡ bài viết tiếp theo. Đăng ký để nhận trong inbox.

Tác giả
Tôi là Cường Nguyễn - Founder của AI Ops Solutions.
Tôi từng là Logistics Operations Manager và đồng sáng lập thương hiệu CATCA - #1 Shopee ngành Pet Care.