Bài viết

Theo TechStartups, Amazon sẽ đóng nền tảng crowdsourcing Mechanical Turk (MTurk) vào ngày 30/09/2026. Đây là dấu chấm hết cho dịch vụ ra mắt từ năm 2005, từng là nơi doanh nghiệp thuê đám đông xử lý các Human Intelligence Tasks (HITs): dán nhãn ảnh, bóc băng, khảo sát và kiểm duyệt nội dung.
Quyết định này không xuất hiện đơn lẻ. Từ ngày 30/07/2026, Amazon đã ngừng nhận đăng ký mới cho MTurk, cùng hai dịch vụ liên quan là SageMaker Ground Truth và Amazon Augmented AI. Sau 21 năm, một biểu tượng của thời kỳ Machine Learning cần lao động click chuột giá rẻ đang rút lui.
MTurk từng có hơn 500.000 lao động tham gia. Jeff Bezos gọi mô hình này là “artificial artificial intelligence”: dùng trí tuệ con người phân tán để xử lý phần việc máy chưa làm được. Nhưng AI hiện đã đủ giỏi để làm lung lay chính thị trường từng nuôi nó.
Mechanical Turk không đơn thuần là một website thuê người làm việc lặt vặt. Nó là một mắt xích quan trọng của chuỗi cung ứng dữ liệu AI đời đầu. Nhiều pipeline huấn luyện từng dựa vào lượng lớn nhãn do đám đông tạo ra, bởi mô hình cần ví dụ được con người phân loại trước khi học cách phân loại.
Vấn đề là mô hình đó hỏng từ cả hai đầu. Các tác vụ phân loại cơ bản giờ có thể được LLM và synthetic data xử lý nhanh hơn, rẻ hơn. Còn chất lượng dữ liệu crowdsourcing giảm khi worker dùng chính AI để hoàn thành các tác vụ vốn được giao nhằm huấn luyện AI. Một vòng lặp dữ liệu như vậy dễ đưa lỗi, suy luận bịa đặt và câu trả lời sao chép vào tập train.
Thị trường vì thế tách làm hai. Việc đơn giản đi về phía tự động hóa và dữ liệu tổng hợp. Việc khó, cần hiểu chuyên ngành hoặc đánh giá sắc thái, đi về các đơn vị chuyên biệt như Scale AI, Mercor và Prolific. Amazon đóng MTurk là tín hiệu rõ ràng: nhãn rẻ, số lượng lớn không còn là lợi thế cạnh tranh bền vững.
Đội ngũ còn dùng MTurk có thời gian ngắn để kiểm kê và di chuyển pipeline trước ngày 30/09. Đừng chỉ đổi nhà cung cấp rồi giữ nguyên quy trình. Cần tách dữ liệu thành ba lớp: tác vụ lặp lại có thể dùng LLM hoặc synthetic data; tác vụ cần người kiểm tra; và tác vụ rủi ro cao cần chuyên gia theo domain phê duyệt.
Với dữ liệu dùng cho RLHF hoặc RLAIF, điểm cần kiểm soát là nguồn gốc câu trả lời. Mỗi nhãn nên có tiêu chí chấm rõ ràng, cơ chế lấy mẫu kiểm tra và khả năng truy vết ai hoặc hệ thống nào đã tạo ra nó. Một benchmark đẹp nhưng được tạo từ dữ liệu nhiễm AI không đáng tin hơn một bảng Excel được tô màu.
Doanh nghiệp cũng phải tính lại chi phí human-in-the-loop. Dùng đám đông cho mọi việc từng tiện, nhưng hiện dễ biến thành chi phí kiểm lỗi. Hãy ưu tiên tự động hóa khâu có quy tắc rõ, dành ngân sách con người cho các ca mơ hồ, ngoại lệ và quyết định ảnh hưởng trực tiếp tới khách hàng.
Tôi đánh giá việc Amazon khai tử MTurk là hợp lý, dù nó phơi bày một sự thật khó nghe: mô hình lao động gán nhãn giá rẻ đã hết thời. Amazon không đóng một công cụ hữu ích; họ đang rời khỏi một phân khúc mà tốc độ, giá rẻ và chất lượng không còn đi cùng nhau. Cố níu MTurk bằng một giao diện mới cũng không giải quyết được nghịch lý worker dùng AI để dạy AI.
Điểm đáng chê là Amazon đồng thời siết cửa với SageMaker Ground Truth và Amazon Augmented AI, khiến khách hàng phải tự gánh bài toán chuyển đổi trong thời gian gấp. Nhưng đây cũng là cú hích cần thiết: doanh nghiệp Việt Nam nên bỏ tư duy Crowd-in-the-loop và xây Expert-in-the-loop. Giá trị nằm ở người hiểu nghiệp vụ, biết phát hiện ngoại lệ và dám chịu trách nhiệm với nhãn dữ liệu.
Khuyến nghị cụ thể: trước ngày 30/09, hãy lập ngay một bảng phân loại toàn bộ tác vụ gán nhãn đang chạy, chọn một pipeline có rủi ro cao để thử nghiệm RLAIF song song với vòng duyệt của chuyên gia nội bộ. Đo tỷ lệ lỗi và thời gian xử lý trước khi ký hợp đồng outsource mới. Đừng mua dữ liệu rẻ nếu không mua được khả năng kiểm chứng.
Amazon dự kiến đóng MTurk vào ngày 30/09/2026. Nền tảng đã ngừng nhận đăng ký mới từ ngày 30/07/2026.
Các tác vụ phân loại cơ bản có thể chuyển sang LLM và synthetic data. Những việc cần phán đoán chuyên ngành, đánh giá chất lượng hoặc xử lý nội dung nhạy cảm cần chuyên gia hoặc nhà cung cấp chuyên biệt như Scale AI, Mercor và Prolific.
Hãy xuất dữ liệu, kiểm kê các tích hợp MTurk, phân loại tác vụ theo mức rủi ro và thử pipeline thay thế có kiểm tra chất lượng. Đặc biệt, cần truy vết nguồn nhãn để tránh đưa dữ liệu do AI tạo thiếu kiểm soát vào quá trình huấn luyện.
Nguồn tham khảo: TechStartups
Bài viết là góc nhìn cá nhân của tác giả, mang tính tham khảo — không phải tin tức báo chí.
Đừng bỏ lỡ bài viết tiếp theo. Đăng ký để nhận trong inbox.

Tác giả
Tôi là Cường Nguyễn - Founder của AI Ops Solutions.
Tôi từng là Logistics Operations Manager và đồng sáng lập thương hiệu CATCA - #1 Shopee ngành Pet Care.