Tác Nhân AI Có Thay Thế Freelancer? 4 Năm Bằng Chứng Nói Gì (ChatGPT, Claude, Upwork, Jobbit)
Bốn năm bằng chứng nói gì về tác nhân AI và công việc freelance: những tác vụ nào đã bị thay thế, người lao động vẫn chiếm ưu thế ở đâu, và doanh nghiệp nên phân chia công việc giữa tác nhân AI và con người như thế nào.

Mọi chủ doanh nghiệp hiện đang đặt ra một biến thể của cùng một câu hỏi: công việc nào có thể giao cho tác nhân AI, và công việc nào vẫn cần một con người? Lần này, câu hỏi đã có một phòng thí nghiệm. Kể từ cuối năm 2022, các nền tảng freelance trực tuyến vốn là nơi hàng triệu người viết, dịch giả, nhà thiết kế và lập trình viên hoạt động, cũng đã trở thành nơi diễn ra một thí nghiệm tự nhiên về điều gì xảy ra khi một sản phẩm thay thế đủ năng lực cho công việc tri thức thường nhật xuất hiện chỉ sau một đêm, với chi phí biên gần như bằng không, vào một thị trường nơi mọi công việc đều được đăng tải, định giá và ghi dấu thời gian.
Nghiên cứu tình huống này xử lý thí nghiệm đó theo cách một học giả sẽ xử lý bất kỳ tập hợp bằng chứng nào khác: chính xác thì điều gì đã được đo lường, đo lường tốt đến đâu, kết quả cho thấy điều gì, và chúng chưa thể cho thấy điều gì. Nghiên cứu này dựa trên các nghiên cứu bình duyệt và bài báo làm việc từ các nhà nghiên cứu tại Stanford, MIT, Harvard Business School, University of Chicago và UCLA, các thí nghiệm thực địa ngẫu nhiên bên trong BCG và Alibaba, các đánh giá năng lực từ METR và OpenAI, cùng dữ liệu riêng của các nền tảng từ Upwork và Fiverr. Giai đoạn được bao phủ trải dài từ tháng 11 năm 2022, khi ChatGPT được phát hành, đến tháng 8 năm 2026, khi nghiên cứu gần đây nhất trong số này được cập nhật.
Câu trả lời ngắn gọn cho tiêu đề là cho đến nay, các tác nhân AI đã thay thế tác vụ chứ không phải freelancer, và sự thay thế này diễn ra hẹp, nhanh và không đồng đều. Câu trả lời dài hơn hữu ích hơn, vì nó cho doanh nghiệp biết ranh giới hiện đang nằm ở đâu và cách làm việc ở cả hai phía của ranh giới đó.
Tóm tắt các phát hiện
Năm kết luận đứng vững trước một cách đọc hoài nghi về bằng chứng.
Thứ nhất, sự thay thế là có thật và tập trung. Trong vòng tám tháng kể từ khi ChatGPT ra mắt, số lượng tin đăng cho công việc viết và lập trình dễ bị tự động hóa trên một nền tảng toàn cầu hàng đầu đã giảm khoảng 21% so với công việc thâm dụng lao động thủ công, và các công cụ tạo ảnh đã cắt giảm khoảng 17% số tin đăng cho công việc hình ảnh. Trên Upwork, bằng cấp và danh tiếng đã trở nên kém khả năng dự đoán hơn một cách rõ rệt về việc ai được thuê trong các danh mục chịu tác động của AI, trong khi giá cả trở nên có khả năng dự đoán cao hơn.
Thứ hai, tác động lên thị trường lao động rộng hơn vẫn còn nhỏ. Nghiên cứu chính xác nhất, dựa trên hồ sơ hành chính của Đan Mạch, loại trừ khả năng có tác động lên thu nhập hoặc số giờ làm việc lớn hơn 2% sau hai năm kể từ ChatGPT. Ngoại lệ thì rõ rệt: tại Hoa Kỳ, tỷ lệ việc làm của người lao động từ 22 đến 25 tuổi trong các ngành nghề chịu tác động AI nhiều nhất hiện thấp hơn khoảng 19% so với mức lẽ ra phải có nếu theo kịp tốc độ của nhóm ít chịu tác động hơn.
Thứ ba, mức tăng năng suất từ việc làm việc cùng AI là lớn nhưng không đồng đều. Mức tăng lớn nhất thuộc về người lao động ít kinh nghiệm hơn khi làm các tác vụ thường nhật, và có thể trở thành tiêu cực đối với chuyên gia khi làm các tác vụ nằm ngoài năng lực của công cụ. Trong một thử nghiệm nghiêm ngặt, các lập trình viên giàu kinh nghiệm làm việc chậm hơn 19% khi dùng công cụ AI trong khi tin rằng họ đã nhanh hơn 20%.
Thứ tư, các tác nhân AI đã chuyển mình từ trợ lý thành người lao động. Độ dài của tác vụ mà một hệ thống tiên tiến có thể hoàn thành đã tăng gấp đôi sau mỗi vài tháng, và các giám khảo chuyên gia chấm điểm mù nay đánh giá sản phẩm đầu ra của các mô hình tốt nhất là ngang bằng hoặc tốt hơn sản phẩm của một chuyên gia trong gần một nửa số trường hợp. Nhưng một khi tính cả thời gian kiểm tra và sửa lỗi, mức tiết kiệm đo được sụt giảm từ khoảng chín mươi lần xuống còn từ 12% đến 39%, và ngay cả những tác nhân AI công sở tốt nhất đôi khi vẫn mắc những sai lầm nhỏ với hậu quả không thể khắc phục.
Thứ năm, phản ứng hợp lý, và cũng là phản ứng mà các nền tảng đang hội tụ về, là một sự phân công lao động: tác nhân AI đảm nhận công việc số hóa thường nhật, có thể kiểm tra được; con người đảm nhận việc phán đoán, trách nhiệm giải trình, sự hiện diện và bất cứ điều gì không thể đảo ngược; cùng với một sự chuyển giao có chủ đích giữa hai bên.
Luận điểm: vì sao các nền tảng freelance là phòng thí nghiệm phù hợp
Các nhà kinh tế học lao động thường làm việc với các cuộc khảo sát hàng năm và các mã ngành nghề rộng. Các nền tảng freelance trực tuyến cung cấp một thứ hiếm hơn: công việc được chia nhỏ thành từng tác vụ riêng lẻ, mỗi tác vụ có ngày đăng, giá cả, danh mục, người mua, người bán và kết quả. Khi một công nghệ xuất hiện có thể thực hiện một số tác vụ đó, sự thay đổi sẽ hiện rõ trong vòng vài tuần qua dòng chảy tin đăng, qua việc ai giành được hợp đồng và với mức giá nào. Thị trường này cũng áp dụng công cụ mới ngay lập tức, vì không có chu kỳ mua sắm nào giữa một freelancer và một tab trình duyệt.
Chính những đặc điểm đó cũng khiến phòng thí nghiệm này không hoàn hảo. Các nền tảng chỉ ghi nhận nhu cầu được đăng tải, không phải toàn bộ nhu cầu; một khách hàng nay tự làm công việc nội bộ bằng tác nhân AI sẽ biến mất khỏi dữ liệu thay vì xuất hiện như một trường hợp thay thế. Các danh mục cũng thay đổi, nên sự sụt giảm trong mục "viết lách" có thể một phần chỉ là được dán nhãn lại thành "biên tập nội dung AI". Hầu hết các bộ dữ liệu lớn đều là của Mỹ, và các freelancer trên nền tảng không đại diện cho toàn bộ lực lượng lao động. Những giới hạn này quan trọng đối với việc diễn giải, và sẽ được quay lại bên dưới, nhưng chúng không khiến bằng chứng trở nên vô dụng. Chúng khiến bằng chứng này trở thành một chỉ báo sớm hơn là một cuộc tổng điều tra.
Mức độ quan trọng ở đây không hề nhỏ. IPSE ước tính lực lượng freelancer tại Anh vào khoảng 2,05 triệu người, tương đương khoảng một nửa trong số 4,2 triệu người tự kinh doanh cá nhân của cả nước, sử dụng một định nghĩa giới hạn trong ba nhóm ngành nghề có kỹ năng cao nhất. Đó chính xác là những ngành nghề mà các nghiên cứu về khả năng áp dụng AI xếp hạng cao nhất.
Dòng thời gian bằng chứng, 2022 đến 2026
| Năm | Nghiên cứu | Bối cảnh và thiết kế | Phát hiện chính |
|---|---|---|---|
| 2023 đến 2024 | Hui, Reshef và Zhou, Organization Science | Nền tảng freelance lớn, phương pháp khác biệt trong khác biệt quanh thời điểm ChatGPT và các mô hình tạo ảnh | Freelancer chịu tác động mất cả việc làm lẫn thu nhập; thành tích quá khứ tốt không bảo vệ được họ |
| 2023 | Dell'Acqua và cộng sự, Harvard Business School cùng BCG | Thử nghiệm ngẫu nhiên, 758 nhà tư vấn, GPT-4 | Trong phạm vi năng lực của công cụ: hoàn thành nhiều hơn 12,2% tác vụ, nhanh hơn 25,1%, chất lượng cao hơn 40%. Ngoài phạm vi đó: khả năng đúng thấp hơn 19 điểm phần trăm |
| 2024 đến 2025 | Demirci, Hannane và Zhu, Management Science | Nền tảng toàn cầu hàng đầu, tin đăng việc làm | Tin đăng viết lách và lập trình dễ tự động hóa giảm 21% trong vòng tám tháng; tin đăng hình ảnh giảm 17% |
| 2025 | Brynjolfsson, Li và Raymond, Quarterly Journal of Economics | 5.179 nhân viên hỗ trợ khách hàng, triển khai theo từng giai đoạn | Năng suất tăng trung bình 14%, tăng 34% với người mới, gần như không đổi với chuyên gia |
| 2025 | Humlum và Vestergaard, NBER, sửa đổi năm 2026 | Đan Mạch, khảo sát mức độ áp dụng liên kết với hồ sơ hành chính | Tác động lên thu nhập và số giờ làm việc trong phạm vi 2% sau hai năm; công việc được tái cấu trúc thay vào đó |
| 2025 | METR | Thử nghiệm ngẫu nhiên, 16 lập trình viên giàu kinh nghiệm, 246 tác vụ thực tế | Chậm hơn 19% khi dùng công cụ AI; người tham gia tin rằng họ đã nhanh hơn 20% |
| 2025 | OpenAI, GDPval | 44 ngành nghề, chấm điểm mù bởi chuyên gia | Sản phẩm của mô hình tốt nhất thắng hoặc hòa 47,6% số lần; mức tiết kiệm giảm còn 12% đến 39% khi tính cả thời gian kiểm tra |
| 2025 đến 2026 | Brynjolfsson, Chandar và Chen, Stanford | Hồ sơ lương ADP đến tháng 6 năm 2026 | Người lao động 22 đến 25 tuổi trong ngành nghề chịu tác động thấp hơn 19% so với nhóm cùng lứa; không có tình trạng thay thế trên toàn bộ nền kinh tế |
| 2026 | Siddiq và Zhang, UCLA | 2,26 triệu hợp đồng Upwork, 2021 đến 2026 | Bằng cấp và danh tiếng có khả năng dự đoán việc tuyển dụng thấp hơn 7,8% trong các danh mục chịu tác động; giá cả có khả năng dự đoán cao hơn |
| 2026 | Wang và cộng sự, Alibaba | Thí nghiệm thực địa ngẫu nhiên, AI tác nhân có người giám sát | Cuộc trò chuyện ngắn hơn nhưng đánh giá thấp hơn khi tác nhân AI xử lý; con người xử lý tốt hơn các lỗi kỹ thuật so với các lỗi cảm xúc |
| 2026 | Styles và Miller, WorkBench revisited | Bộ đánh giá tác nhân công sở, 2024 so với 2026 | Tỷ lệ hoàn thành tác vụ từ 43% lên 98%; hành động gây hại từ 26% xuống 1,9%, không phải bằng không |
| 2026 | Upwork, Future Workforce Index | Khảo sát 2.400 lao động có kỹ năng tại Mỹ cùng dữ liệu nền tảng | Công việc liên quan AI trả lương cao hơn 34% mỗi giờ; công việc AI tạo sinh đơn giản trả thấp hơn 13% mỗi hợp đồng so với một năm trước |
Phát hiện 1: sự thay thế là có thật, nhanh và hẹp
Bằng chứng nghiêm ngặt sớm nhất đến từ Xiang Hui, Oren Reshef và Luofeng Zhou, với nghiên cứu về một nền tảng lao động trực tuyến lớn được công bố trên Organization Science năm 2024 và sau đó giành Giải thưởng Olin của Washington University cho nghiên cứu có tác động thực tiễn. So sánh các freelancer trong những ngành nghề chịu tác động của ChatGPT, DALL-E 2 và Midjourney với những freelancer trong các ngành nghề ít chịu tác động hơn, họ phát hiện sự sụt giảm ở cả số lượng công việc lẫn thu nhập hàng tháng của nhóm chịu tác động. Phát hiện gây xáo trộn giới nghiên cứu nhất là phát hiện về chất lượng. Các freelancer có đánh giá quá khứ tốt và bề dày thành tích lâu năm không được bảo vệ; nếu có khác biệt, các tác giả báo cáo bằng chứng gợi ý rằng những người có thành tích hàng đầu còn bị ảnh hưởng nặng nề hơn. Cách diễn giải hợp lý nhất là trong công việc văn bản và hình ảnh thường nhật, một sản phẩm xuất sắc của con người và một sản phẩm chấp nhận được của máy móc đã trở thành sản phẩm thay thế gần như tương đương trong mắt người mua, nên khoản phụ trội cho sự xuất sắc bị xói mòn trước tiên.
Ozge Demirci, Jonas Hannane và Xinrong Zhu sau đó đã đo lường trực tiếp phía cầu. Sử dụng các tin đăng từ một nền tảng freelance toàn cầu hàng đầu, trong một bài báo công bố trên Management Science năm 2025, họ phát hiện số tin đăng cho công việc viết lách và lập trình dễ tự động hóa giảm 21% so với công việc thâm dụng lao động thủ công trong vòng tám tháng kể từ khi ChatGPT ra mắt, và số tin đăng tạo hình ảnh giảm 17% sau khi các mô hình tạo ảnh xuất hiện. Hai kết quả phụ quan trọng không kém kết quả chính. Những tin đăng còn lại trong các danh mục chịu tác động phức tạp hơn và trả lương cao hơn, và sự cạnh tranh cho chúng trở nên gay gắt hơn. Nói cách khác, sự thay thế không làm rỗng cả danh mục; nó loại bỏ phần đáy của danh mục đó.
Vì sao viết lách, dịch thuật và công việc hình ảnh bị ảnh hưởng trước tiên? Phân tích 200.000 cuộc trò chuyện Bing Copilot được ẩn danh của Microsoft Research, công bố năm 2025, đã phác họa cơ chế này. Những ngành nghề có khả năng áp dụng AI cao nhất là những ngành nghề mà công việc bao gồm thu thập, tạo ra và truyền đạt thông tin; thông dịch viên và biên dịch viên đứng đầu danh sách, với 98% hoạt động công việc của họ trùng lặp với các tác vụ mà trợ lý AI đã thực hiện tốt. Khả năng áp dụng không đồng nghĩa với sự thay thế, và các tác giả cẩn thận nói rõ điều này, nhưng bảng xếp hạng đó dự đoán gần như chính xác những danh mục freelance nào mà các nghiên cứu trên nền tảng phát hiện đang thu hẹp lại.
Bằng chứng gần đây nhất, và đối với độc giả trong giới doanh nghiệp là bằng chứng đáng chú ý nhất, đến từ Auyon Siddiq và Niuniu Zhang tại UCLA Anderson. Bài báo làm việc năm 2026 của họ, "Human Capital, AI, and Labor Commoditization" (Vốn con người, AI và sự hàng hóa hóa lao động), theo dõi gần 50.000 freelancer trên Upwork đã hoạt động trước thời ChatGPT qua 21 quý từ đầu năm 2021 đến đầu năm 2026, bao phủ 2,26 triệu hợp đồng đã hoàn thành. Thay vì đếm số công việc, họ đặt câu hỏi điều gì dự đoán được ai sẽ được thuê. Trong các danh mục chịu tác động AI nhiều hơn như dịch thuật và viết lách, trọng số dự đoán kết hợp của phần tự giới thiệu, bằng cấp và danh tiếng của một freelancer đã giảm khoảng 7,8% so với các danh mục ít chịu tác động hơn như nhiếp ảnh, còn trọng số của giá cả thì tăng lên. Đến năm cuối cùng, các thước đo vốn con người đã mất khoảng 10,1% tầm quan trọng của chúng còn giá cả đã tăng thêm khoảng 1,8%. Lợi thế mà các freelancer giàu kinh nghiệm nắm giữ đã thu hẹp 6,2% rồi sau đó 10,3%, và trong công việc chịu tác động nhiều nhất, các freelancer giá rẻ hơn giành được nhiều hơn 7,9% số hợp đồng. Tổng nhu cầu trong các lĩnh vực chịu tác động giảm khoảng 7%. Từ mà các tác giả dùng cho hiện tượng này là hàng hóa hóa: khi người mua có thể lấy được một bản nháp đầu tiên tạm ổn từ một mô hình, thứ họ sẵn sàng trả tiền cho một con người sẽ chuyển từ "bạn là ai" sang "bao nhiêu tiền".
Phát hiện 2: tác động tổng thể vẫn còn nhỏ, với một ngoại lệ rõ rệt
Nếu bằng chứng từ các nền tảng là toàn bộ câu chuyện, thì đến giờ số liệu thống kê quốc gia hẳn đã phải thể hiện điều đó. Phần lớn là không, và những nghiên cứu không tìm thấy tác động lớn lại nằm trong số những nghiên cứu được thiết kế tốt nhất.
Anders Humlum và Emilie Vestergaard đã liên kết các khảo sát về mức độ áp dụng quy mô lớn với hồ sơ lao động hành chính của Đan Mạch, bao phủ 25.000 người lao động và 7.000 nơi làm việc trong mười một ngành nghề chịu tác động. Bài báo làm việc của NBER của họ, lần đầu lưu hành năm 2025 và sửa đổi vào tháng 3 năm 2026, ghi nhận việc áp dụng nhanh chóng: hầu hết người sử dụng lao động trong các ngành nghề chịu tác động đã khởi động các sáng kiến chatbot, người lao động báo cáo có lợi ích về năng suất, và các tác vụ mới liên quan đến AI trở nên phổ biến. Tuy nhiên, các ước tính khác biệt trong khác biệt về thu nhập và số giờ ghi nhận lại là những giá trị null chính xác, loại trừ khả năng có tác động lớn hơn 2% sau hai năm kể từ ChatGPT, ở cả cấp độ người lao động lẫn nơi làm việc. Thứ đã thay đổi là cấu trúc công việc: người sử dụng lao động hấp thụ công nghệ này thông qua việc tái cấu trúc tác vụ, bao gồm các tác vụ mới trong tạo nội dung, giám sát AI và tích hợp AI, và những người áp dụng đã dịch chuyển sang các ngành nghề trả lương cao hơn nơi các công cụ này hữu ích hơn, dù với số lượng quá nhỏ để làm thay đổi các giá trị trung bình. Phiên bản trước đó của bài báo ước tính mức tiết kiệm thời gian tự báo cáo dưới 3% số giờ làm việc, chỉ bằng một phần nhỏ so với mức tăng, thường trên 15%, được ghi nhận bởi các thử nghiệm có kiểm soát trong cùng những ngành nghề đó. Khoảng cách giữa những gì AI có thể làm trong một thử nghiệm và những gì nó thay đổi trên bảng lương là câu đố trung tâm của mảng tài liệu nghiên cứu này, và Đan Mạch là nơi khoảng cách đó được đo lường rõ ràng nhất.
Budget Lab tại Yale đi đến một kết luận tương tự đối với Hoa Kỳ bằng một con đường khác. Theo dõi cơ cấu ngành nghề của việc làm và áp dụng phương pháp khác biệt trong khác biệt tổng hợp cho các ngành nghề chịu tác động AI, các bản cập nhật năm 2025 và 2026 của họ không tìm thấy dấu vết rõ ràng nào của AI. Đầu năm 2026 cho thấy tỷ lệ sa thải thấp nhưng tỷ lệ tuyển dụng cũng thấp, và các tác giả lập luận rằng một công nghệ có tác động lan rộng sẽ cần nhiều thời gian hơn khoảng ba năm kể từ ChatGPT để những tác động đó bộc lộ.
Ngoại lệ này được ghi nhận bởi Erik Brynjolfsson, Bharat Chandar và Ruyu Chen tại Digital Economy Lab của Stanford, với bài báo "Canaries in the Coal Mine?" (Chim hoàng yến trong mỏ than?) sử dụng hồ sơ lương ADP bao phủ hàng triệu người lao động Mỹ. Trong bản cập nhật tháng 8 năm 2026, với dữ liệu đến tháng 6 năm 2026, tỷ lệ việc làm của người lao động từ 22 đến 25 tuổi trong các ngành nghề chịu tác động AI cao thấp hơn khoảng 19% so với mức lẽ ra phải có nếu theo kịp những người lao động cùng độ tuổi trong các ngành nghề ít chịu tác động hơn, tăng so với khoảng cách 15% một năm trước đó. Về mặt tuyệt đối, việc làm của nhóm tuổi đó trong hai nhóm ngũ phân vị chịu tác động nhiều nhất giảm khoảng 11% từ tháng 11 năm 2022 đến tháng 6 năm 2026, trong khi việc làm ở ba nhóm ngũ phân vị ít chịu tác động nhất tăng khoảng 10%. Người lao động giàu kinh nghiệm không cho thấy khoảng cách tương tự, và các tác giả nói rõ rằng họ không thấy tình trạng thay thế lan rộng trên toàn bộ nền kinh tế. Sự sụt giảm tập trung ở các ngành nghề nơi việc sử dụng AI tự động hóa công việc thay vì bổ trợ cho nó.
Các kết quả này nhất quán với nhau một khi ta ngừng kỳ vọng AI sẽ hành xử giống như một cuộc suy thoái. Sự thay thế ở cấp độ tác vụ xuất hiện đầu tiên ở nơi các hợp đồng ngắn nhất và được định giá lại thường xuyên nhất: các công việc freelance và tuyển dụng cấp đầu vào. Thị trường freelance là con chim hoàng yến vì nó được định giá lại mỗi tuần; bảng lương là mỏ than, và bầu không khí ở đó cho đến nay thay đổi ít nhất.
Phát hiện 3: mức tăng từ hỗ trợ lớn nhưng không đồng đều, và biên giới thì lởm chởm
Phần bổ sung cho sự thay thế là sự hỗ trợ, và ở đây bằng chứng thực nghiệm mạnh mẽ khác thường vì việc ngẫu nhiên hóa là khả thi.
Brynjolfsson, Danielle Li và Lindsey Raymond đã nghiên cứu việc triển khai theo từng giai đoạn một trợ lý AI tạo sinh cho 5.179 nhân viên hỗ trợ khách hàng, trong một bài báo công bố trên Quarterly Journal of Economics năm 2025. Số vấn đề được giải quyết mỗi giờ tăng trung bình 14%, với mức tăng 34% cho các nhân viên mới và có kỹ năng thấp hơn, và ít thay đổi đối với những nhân viên giàu kinh nghiệm, kỹ năng cao. Công cụ này dường như đã mã hóa các thực hành của những nhân viên giỏi nhất và truyền lại cho những người mới nhất, giúp họ đi nhanh hơn trên đường cong kinh nghiệm.
Fabrizio Dell'Acqua và cộng sự tại Harvard Business School, phối hợp cùng BCG, đã ngẫu nhiên hóa 758 nhà tư vấn quản lý qua các tác vụ thực tế có và không có GPT-4, trong một nghiên cứu nay đã công bố trên Organization Science. Với mười tám tác vụ nằm trong năng lực của mô hình, các nhà tư vấn dùng AI hoàn thành nhiều hơn 12,2% tác vụ, nhanh hơn 25,1%, với chất lượng được các giám khảo chấm mù đánh giá cao hơn 40%. Với một tác vụ được cố ý chọn để nằm ngoài năng lực đó, các nhà tư vấn dùng AI có khả năng đạt được câu trả lời đúng thấp hơn 19 điểm phần trăm. Cụm từ mà các tác giả dùng cho ranh giới này, biên giới công nghệ lởm chởm, đã trở thành cách mô tả chuẩn cho vấn đề: năng lực của công cụ không chạy theo những đường nét mà người dùng có thể nhìn thấy, và người dùng rất kém trong việc nhận biết mình đang ở phía nào của ranh giới đó.
Một thí nghiệm thực địa bên trong hoạt động dịch vụ khách hàng của Alibaba, do Xiao Ni, Tianjun Feng, Lauren Xiaoyuan Lu và các đồng tác giả thực hiện, đã tái hiện quy luật phân bố này ở quy mô lớn: 5.940 nhân viên mới, khoảng 2,56 triệu cuộc trò chuyện, 390.000 đánh giá của khách hàng. Những người có thành tích thấp cải thiện nhiều nhất ở cả tốc độ lẫn chất lượng; những người có thành tích cao nhất chỉ tăng tốc độ đôi chút và mất điểm chất lượng trên cả thước đo chủ quan lẫn khách quan. Sự hỗ trợ giúp nâng đáy có thể lại hạ trần.
Sau đó là thử nghiệm ngẫu nhiên của METR về các lập trình viên mã nguồn mở giàu kinh nghiệm, công bố vào tháng 7 năm 2025, kết quả cảnh báo được trích dẫn nhiều nhất trong giai đoạn này và xứng đáng được trình bày chính xác. Mười sáu lập trình viên đã thực hiện 246 tác vụ thực tế trong các kho mã nguồn họ duy trì, trung bình hơn 22.000 sao và một triệu dòng mã, với các tác vụ được ngẫu nhiên cho phép hoặc không cho phép dùng công cụ AI, chủ yếu là Cursor với Claude 3.5 và 3.7 Sonnet. Khi dùng AI, họ mất thời gian lâu hơn 19%. Trước khi thử nghiệm, họ đã dự đoán sẽ nhanh hơn 24%; sau đó họ ước tính rằng mình đã nhanh hơn 20%. Khoảng cách nhận thức này quan trọng không kém kết quả về năng suất. Nó cho thấy rằng mức tăng tự báo cáo, vốn là nền tảng của hầu hết các khảo sát ngành, bị thổi phồng lên chính xác ở nơi trình độ chuyên môn cao nhất. Những hàm ý cụ thể đối với công việc phần mềm được bàn đến trong bài AI có thay thế lập trình viên phần mềm không?
Một bài tổng quan năm 2025 của R. Maria del Rio-Chanona, Ekkehard Ernst, Rossana Merola, Daniel Samaan và Ole Teutloff đã tổng hợp các mạch nghiên cứu này lại xuyên suốt tài liệu: mức tăng năng suất khoảng 20% đến 60% trong các thử nghiệm có kiểm soát và 15% đến 30% trong các thí nghiệm thực địa, lớn hơn đối với người mới làm các tác vụ đơn giản, pha trộn kết quả ở các tác vụ phức tạp, cùng với dữ liệu dấu vết số cho thấy sự thay thế trong viết lách và dịch thuật song song với nhu cầu tăng lên đối với kỹ năng AI và bằng chứng nhẹ nhưng đang gia tăng về nhu cầu giảm đối với người mới.
Phát hiện 4: tác nhân AI đã chuyển từ trợ lý sang người lao động, và khoảng cách độ tin cậy là cả câu chuyện
Mọi điều nói ở trên đều liên quan đến AI với vai trò trợ lý cho một con người vẫn tham gia vào từng bước. Sự thay đổi kể từ năm 2025 là các hệ thống nay thực hiện công việc nhiều bước với con người chỉ kiểm tra ở cuối, hoặc không kiểm tra chút nào, và điều đó làm thay đổi loại bằng chứng nào thực sự quan trọng.
Thước đo chân trời thời gian của METR đặt câu hỏi một hệ thống có thể hoàn thành với tỷ lệ thành công 50% một tác vụ dài đến mức nào, tính theo thời gian mà một chuyên gia con người sẽ cần. Trong bản sửa đổi phương pháp luận tháng 1 năm 2026, với bộ tác vụ mở rộng lên 228 tác vụ bao gồm 31 tác vụ kéo dài tám giờ trở lên, thời gian tăng gấp đôi trong dài hạn được ước tính vào khoảng 196 ngày, với tốc độ tăng gấp đôi nhanh hơn là 131 ngày kể từ năm 2023 và 89 ngày kể từ năm 2024. Mô hình tốt nhất được đo tại thời điểm đó, Claude Opus 4.5, có chân trời 50% vào khoảng 320 phút, với khoảng tin cậy rộng từ khoảng ba đến mười hai giờ. Các tác giả nói rõ rằng ngưỡng thành công 50% là khá dễ dãi đối với công việc thực tế, rằng xu hướng này nhạy cảm với thành phần tác vụ, và rằng hầu hết các tác vụ dài sử dụng thời gian ước tính của con người chứ không phải thời gian đo thực tế. Với những lưu ý đó, xu hướng vẫn rõ ràng không thể nhầm lẫn: độ dài của công việc số hóa có thể được giao phó đã và đang tăng trưởng theo cấp số nhân.
Đánh giá GDPval của OpenAI, phát hành cuối năm 2025, kiểm tra xem công việc được giao phó đó có thực sự tốt hay không. Các tác vụ được viết bởi các chuyên gia trong 44 ngành nghề thuộc chín lĩnh vực, trung bình 14 năm kinh nghiệm, và được chấm bằng cách so sánh cặp mù bởi chuyên gia với sản phẩm của con người. Mô hình tốt nhất, Claude Opus 4.1, tạo ra sản phẩm được chấm tốt hơn hoặc ngang bằng sản phẩm của chuyên gia trong 47,6% số trường hợp. Con số mà một doanh nghiệp nên ghi nhớ lại là một con số khác. Phép so sánh đơn giản giữa thời gian máy móc và thời gian con người cho ra tỷ lệ gần chín mươi lần, nhưng một khi bài báo tính đến việc một con người phải kiểm tra và, khi cần, làm lại công việc, mức tiết kiệm ước tính giảm xuống còn từ 1,12 đến 1,39 lần tùy theo chiến lược. Chi phí đã chuyển sang khâu kiểm tra. Đó chính là cơ chế mà Dell'Acqua phát hiện ở các nhà tư vấn và METR phát hiện ở các lập trình viên, nay được đo lường ở cấp độ sản phẩm đầu ra.
Các bộ đánh giá công sở cho thấy cả tốc độ tiến bộ lẫn phần dư sót lại. TheAgentCompany, từ Carnegie Mellon, đã thả các tác nhân AI vào một công ty phần mềm mô phỏng với các phiên bản thực của GitLab, OwnCloud, Plane và RocketChat cùng 175 tác vụ; tác nhân tốt nhất hoàn thành khoảng một phần tư số tác vụ khi ra mắt vào cuối năm 2024 và khoảng 30% trong năm 2025. Olly Styles và Sam Miller đã xem lại bộ đánh giá WorkBench của họ vào tháng 6 năm 2026 và báo cáo rằng tỷ lệ hoàn thành của tác nhân tốt nhất đã tăng từ 43% với GPT-4 vào tháng 3 năm 2024 lên 98% với Claude Fable 5, trong khi tỷ lệ các lượt chạy có hành động gây hại ngoài ý muốn giảm từ 26% xuống 1,9%. Họ cũng báo cáo rằng các mô hình tiên tiến vẫn mắc những lỗi cơ bản đôi khi gây ra thiệt hại không thể khắc phục. Hai phần trăm là một con số rất tốt; nhưng đó cũng là khoảng một trong số năm mươi lượt chạy làm điều gì đó không nên làm.
Thí nghiệm thực địa năm 2026 của Alibaba, của Yiwei Wang, Chuan Zhu, Tianjun Feng, Lauren Xiaoyuan Lu và Bingxin Jia, là bằng chứng ngẫu nhiên đầu tiên về AI tác nhân có con người tham gia trong một hoạt động dịch vụ trực tiếp. Những người lao động thuộc nhóm can thiệp giám sát một tác nhân AI xử lý các cuộc trò chuyện khách hàng đủ điều kiện trong khi họ tự tay xử lý phần còn lại. Thời lượng trò chuyện trung bình giảm xuống với tác động hạn chế đến việc khách hàng quay lại với cùng vấn đề, nhưng các cuộc trò chuyện do tác nhân AI xử lý nhận được đánh giá thấp hơn đáng kể. Sự can thiệp của con người khắc phục tình huống tốt hơn nhiều khi lỗi mang tính kỹ thuật, một vấn đề chưa được giải quyết, so với khi lỗi mang tính cảm xúc, một khách hàng bực bội, và hiệu quả nhất khi can thiệp sớm. Những người lao động đang giám sát cũng chú ý nhiều hơn đến các cuộc trò chuyện mà họ vẫn tự xử lý, một hiệu ứng lan tỏa tích cực. Đây là bằng chứng trực tiếp nhất từ trước đến nay về cách thiết kế sự chuyển giao giữa tác nhân AI và con người: theo dõi sớm, can thiệp vào các sự việc thực tế, và đừng để cảm xúc cho máy móc xử lý.
Dữ liệu về mức độ áp dụng xác nhận sự dịch chuyển này không chỉ giới hạn trong phòng thí nghiệm. Economic Index tháng 3 năm 2026 của Anthropic báo cáo rằng 49% ngành nghề đã có ít nhất một phần tư tác vụ được thực hiện bằng Claude, và công việc lập trình đã dịch chuyển từ sử dụng dạng trò chuyện sang các quy trình API tự động, với tỷ trọng lập trình tăng 14% trong API và giảm 18% trong sản phẩm trò chuyện kể từ tháng 8 năm 2025. Đóng góp của Lightcast cho Stanford AI Index 2026 phát hiện kỹ năng AI xuất hiện trong 2,5% tổng số tin tuyển dụng tại Mỹ, và tin tuyển dụng đề cập đến nhóm kỹ năng "AI tác nhân" tăng từ 0,06% năm 2024 lên 0,23% năm 2025, tương đương khoảng 90.000 tin đăng. Và UpBench, một bộ đánh giá năm 2025 được xây dựng từ các công việc thực tế, đã hoàn thành trên sàn Upwork, có các freelancer chuyên gia phân rã mỗi công việc thành các tiêu chí nghiệm thu có thể kiểm chứng để chấm điểm tác nhân AI theo đó. Việc chấm điểm tác nhân AI bằng chính tiêu chí mà một khách hàng sẽ áp dụng cho một freelancer là một tín hiệu cho thấy phía cung sẽ đi về đâu.
Cơ chế: vì sao mô hình này lại như vậy
Bốn cơ chế giải thích phần lớn những gì bằng chứng cho thấy, và đáng để nêu ra vì chúng dự đoán điều gì sẽ xảy ra tiếp theo.
Cơ chế thứ nhất là sự hàng hóa hóa năng lực thường nhật. Khi một mô hình tạo ra một bản nháp chấp nhận được của một mô tả sản phẩm, một bản dịch hay một mô-đun mẫu, mức sẵn lòng chi trả của người mua cho bằng cấp của một con người trong danh mục đó giảm xuống, và giá cả trở thành biến số quyết định. Siddiq và Zhang đo lường chính xác sự dịch chuyển này, còn Demirci và cộng sự cho thấy hình ảnh phản chiếu của nó: công việc vẫn thuộc về con người trở nên phức tạp hơn, được trả lương cao hơn, và bị cạnh tranh nhiều hơn.
Cơ chế thứ hai là chi phí kiểm chứng đóng vai trò ràng buộc quyết định. Sản xuất đã trở nên rẻ; kiểm tra thì chưa. Sự sụt giảm của GDPval từ chín mươi lần xuống dưới 1,4 lần khi tính cả khâu kiểm tra, các chuyên gia bị chậm lại trong nghiên cứu của METR, và biên giới lởm chởm, tất cả đều mô tả cùng một nền kinh tế. Ai có thể kiểm chứng một sản phẩm đầu ra với chi phí thấp sẽ nắm được phần lợi ích; ai không thể sẽ phải trả giá bằng việc làm lại hoặc bằng những lỗi không bị phát hiện. Đây là lý do vì sao lợi ích chảy về phía người mới với các tác vụ dễ kiểm tra và bị đình trệ đối với chuyên gia trong các tác vụ mà việc kiểm tra tốn kém ngang với việc tự làm.
Cơ chế thứ ba là khoảng trống học nghề. Những tác vụ mà một tác nhân AI làm tốt chính là những tác vụ mà các công ty trước đây thường giao cho nhân viên mới vào nghề và freelancer mới vào nghề để họ học hỏi. Brynjolfsson, Li và Raymond cho thấy sự hỗ trợ giúp người mới nhiều nhất; Brynjolfsson, Chandar và Chen cho thấy các công ty dù vậy vẫn thuê ít người mới hơn. Cả hai điều này đều có thể đúng cùng lúc: một công ty cần ít nhân viên mới hơn để tạo ra cùng một sản lượng sẽ thuê ít nhân viên mới hơn, dù mỗi người trong số họ có năng suất cao hơn. Chi phí dài hạn, một nguồn cung người có kinh nghiệm mỏng đi, chưa thể hiện rõ trong bất kỳ bộ dữ liệu nào và là biến số chưa được đo lường quan trọng nhất trong lĩnh vực này.
Cơ chế thứ tư là sự bền vững của các tác vụ bổ trợ mang tính con người. Nhóm so sánh của Demirci về công việc thâm dụng lao động thủ công đã không sụt giảm. Thí nghiệm của Alibaba cho thấy các lỗi mang tính cảm xúc kháng cự lại sự khắc phục của máy móc. Trách nhiệm giải trình, sự hiện diện, công việc thể chất và các mối quan hệ vẫn thuộc về con người vì những lý do không liên quan gì đến năng lực của mô hình mà liên quan hoàn toàn đến những gì một khách hàng sẽ chấp nhận.
Một độc giả hoài nghi nên cân nhắc thêm hai cách giải thích thay thế bên cạnh những cơ chế trên. Sự sụt giảm ở cấp đầu vào tại Hoa Kỳ trùng hợp với lãi suất cao hơn và việc đảo ngược tình trạng tuyển dụng thời đại dịch trong ngành công nghệ, những yếu tố độc lập cũng tác động đến cùng một nhóm nhân khẩu học; các tác giả của Stanford xử lý vấn đề này bằng các so sánh trong cùng công ty và bằng cách đối chiếu ngành nghề mang tính tự động hóa với ngành nghề mang tính bổ trợ, nhưng yếu tố gây nhiễu này không thể bị loại trừ hoàn toàn. Và mọi thước đo "mức độ chịu tác động" đều tự nó bắt nguồn từ một mô hình, nên các nghiên cứu phần nào cũng đang kiểm định các giả định của bộ phân loại đó. Các thiết chế thương lượng tập thể của Đan Mạch cũng có thể làm giảm bớt các phản ứng về tiền lương vốn sẽ xuất hiện nhanh hơn trong một thị trường lao động lỏng lẻo hơn.
Các nền tảng đã phản ứng như thế nào
Các sàn giao dịch đã đọc được cùng những tín hiệu đó và hành động. Vào tháng 4 năm 2025, giám đốc điều hành Micha Kaufman của Fiverr đã viết thư cho nhân viên rằng "AI đang đến để lấy công việc của các bạn", kể cả công việc của chính ông, và thúc giục họ thành thạo các công cụ như Cursor và Legora; vào tháng 9 năm 2025 công ty đã cắt giảm khoảng 250 vị trí, gần 30% lực lượng lao động của mình, để trở thành cái mà họ gọi là một công ty ưu tiên AI, sau khi đã ra mắt các công cụ sáng tạo Fiverr Go vào tháng 2 năm đó. Upwork đã biến trợ lý của mình, Uma, thành cái mà họ mô tả là một tác nhân làm việc luôn hoạt động, thực hiện các hành động thay mặt cho khách hàng và freelancer, và Future Workforce Index 2026 của họ định hình lại freelancer thành công như một "người điều phối AI" kết nối các công cụ với chuyên môn ngành và áp dụng khả năng phán đoán. Cùng báo cáo đó đưa ra tín hiệu về giá chỉ trong một câu: freelancer làm công việc liên quan AI kiếm được nhiều hơn 34% mỗi giờ so với những người không làm, công việc phức tạp được AI hỗ trợ chứng kiến thu nhập tăng 45% so với cùng kỳ năm trước, trong khi công việc AI tạo sinh và sản xuất sáng tạo tăng 90% về số hợp đồng khởi tạo khi thu nhập mỗi hợp đồng giảm 13%. Khối lượng dịch chuyển về phía đơn giản; tiền bạc dịch chuyển về phía phức tạp.
Jobbit, nền tảng nơi nghiên cứu tình huống này được đăng tải, được thiết kế xoay quanh sự phân công lao động mà bằng chứng chỉ ra, chứ không nghiêng về một trong hai phía. Tác nhân AI đảm nhận công việc số hóa có thể kiểm tra được: xây dựng và triển khai một trang web hay ứng dụng web, soạn thảo tài liệu và bài thuyết trình, thực hiện nghiên cứu, thiết lập tự động hóa, tạo hình ảnh và video. Người dùng có thể quan sát nó làm việc trong trình duyệt của tác nhân và giành quyền kiểm soát vào bất kỳ lúc nào, đây chính là mô hình can thiệp sớm mà thí nghiệm của Alibaba nhận thấy hiệu quả nhất. Đối với công việc mà một tác nhân AI làm kém hoặc không nên tự mình thực hiện, các công việc mang tính vật lý và tại chỗ, việc rà soát bởi chuyên gia có trách nhiệm giải trình, bất cứ điều gì khách hàng cần một con người thực hiện, nền tảng này sẽ chuyển đến một mạng lưới con người được kiểm duyệt tại pro.jobbit.uk. Jobbit chưa công bố dữ liệu thử nghiệm của riêng mình, và nghiên cứu này không đưa ra bất kỳ tuyên bố nào về kết quả đo lường được trên nền tảng đó; tuyên bố ở đây chỉ là về sự phù hợp giữa một thiết kế và bằng chứng. Độc giả muốn tìm hiểu cơ chế hoạt động có thể bắt đầu với bài tác nhân AI thực chất là gì, hướng dẫn quan sát và giành quyền kiểm soát trình duyệt của tác nhân, và danh sách thực tế các trường hợp sử dụng AI cho doanh nghiệp nhỏ.
Doanh nghiệp nên làm gì với bằng chứng này
Các phát hiện này chuyển hóa thành một quy tắc phân công mà một chủ doanh nghiệp có thể áp dụng mà không cần đọc bất kỳ bài nghiên cứu nào.
Hãy giao cho tác nhân AI công việc thường nhật và có thể kiểm tra được: các bản nháp đầu tiên, bản tóm tắt, tài liệu tóm lược nghiên cứu, tài liệu chuẩn, một trang web hay công cụ nội bộ mà bạn có thể duyệt qua và kiểm tra trong một buổi chiều. Đây là nơi mọi nghiên cứu đều tìm thấy mức tăng lớn nhất, đặc biệt là ở những nơi doanh nghiệp hiện đang thực hiện tác vụ đó chậm chạp hoặc không thực hiện chút nào, vì hiệu ứng người mới áp dụng cho doanh nghiệp cũng nhiều như đối với con người. Một trình tự khởi đầu thực tế được trình bày trong bài cách tự động hóa doanh nghiệp của bạn với tác nhân AI.
Hãy giữ một con người ở công việc mang tính không thể đảo ngược, cảm xúc, thể chất hoặc đòi hỏi trách nhiệm giải trình: bất cứ điều gì gửi tiền, xóa dữ liệu, tiếp xúc với một khách hàng đang bực bội, hoặc đòi hỏi ai đó phải đứng ra chịu trách nhiệm cho kết quả. Thí nghiệm của Alibaba và phần dư sót lại của WorkBench đều chỉ theo cùng một hướng.
Hãy tính cả thời gian kiểm tra vào giá trước khi kết luận rằng một tác nhân AI rẻ hơn. Phép tính trung thực của GDPval, một mức tiết kiệm từ 12% đến 39% chứ không phải chín mươi lần, là con số nên dùng để lập kế hoạch. Nếu không ai trong doanh nghiệp có thể kiểm tra sản phẩm đầu ra, thì mức tiết kiệm đó không có thật; câu trả lời trong trường hợp đó là để tác nhân AI làm công việc và một chuyên gia con người kiểm tra lại, đây chính là sự sắp xếp mà dữ liệu freelance cho thấy người mua đã sẵn sàng trả thêm tiền để có được.
Hãy lường trước rằng biên giới này sẽ lởm chởm và sẽ dịch chuyển. Một tác vụ mà tác nhân AI không thể làm được vào tháng 1 có thể trở nên thường nhật vào tháng 9, nhưng điều ngược lại thì không đúng. Hãy thử nghiệm, ghi lại những gì đã được kiểm tra và những gì đã thất bại, và điều chỉnh lại sự phân chia mỗi quý.
Quy tắc thực hành rút ra từ bốn năm bằng chứng: hãy giao những gì thường nhật và có thể kiểm tra được, giữ một con người ở những gì không thể đảo ngược hoặc mang tính cảm xúc, và coi thời gian kiểm tra là một phần của chi phí.
Hạn chế và câu hỏi còn bỏ ngỏ
Hầu hết các bộ dữ liệu lớn đều là của Mỹ, và dữ liệu nền tảng đo lường nhu cầu được đăng tải chứ không phải toàn bộ công việc được thực hiện. Các thước đo mức độ chịu tác động bắt nguồn từ mô hình, và kết quả phần nào kế thừa các giả định của bộ phân loại đó. Các khung thời gian quan sát còn ngắn: hai năm ở Đan Mạch, dưới bốn năm ở Hoa Kỳ, và luận điểm của các tác giả Yale rằng các tác động lan rộng có thể cần nhiều thời gian hơn là điều đáng cân nhắc. Các bộ đánh giá không phải là công việc thực tế; các tác vụ của GDPval là những sản phẩm đầu ra khép kín và WorkBench là một văn phòng tổng hợp, trong khi công việc thực tế bị gián đoạn, mơ hồ và mang tính chính trị nội bộ. Năng lực AI đang thay đổi đủ nhanh để bất kỳ con số nào trong nghiên cứu này cũng chỉ là một lát cắt tại một thời điểm, và những nghiên cứu có khả năng bị thay thế nhiều nhất chính là các con số về năng lực, chứ không phải các con số về lao động. Cuối cùng, tác động quan trọng nhất cho thập kỷ tới, liệu một đường ống học nghề mỏng đi có làm suy giảm nguồn cung chuyên gia giàu kinh nghiệm hay không, vẫn chưa thể đo lường được chút nào.
Kết luận
Tác nhân AI có thay thế freelancer không? Cho đến nay, chúng thay thế tác vụ, và chúng làm điều đó ở nơi sản phẩm đầu ra của một tác vụ có thể được tạo ra và đánh giá như một việc thường nhật. Điều đó đã đủ để thu hẹp thị trường cho công việc viết lách, dịch thuật và hình ảnh mang tính hàng hóa, làm suy yếu khoản phụ trội tuyển dụng cho bằng cấp trong các danh mục đó, và cắt giảm mạnh việc tuyển dụng cấp đầu vào trong các ngành nghề chịu tác động, trong khi để lại thu nhập và số giờ làm việc trên toàn bộ nền kinh tế về cơ bản không đổi. Freelancer phát đạt trong dữ liệu là người bán khả năng phán đoán, trách nhiệm giải trình và khả năng chỉ đạo cũng như kiểm tra công việc của máy móc; doanh nghiệp được hưởng lợi là doanh nghiệp học được cách giao phó việc thường nhật và kiểm tra lại nó, đồng thời giữ một con người ở mọi thứ không thể hoàn tác. Thị trường không đánh mất một trong hai phía của giao dịch. Nó đang tái cấu trúc xoay quanh sự chuyển giao giữa hai bên, và những nền tảng giúp sự chuyển giao đó trở nên dễ dàng là những nền tảng mà bằng chứng đang nghiêng về.
Câu hỏi thường gặp
Tác nhân AI có thay thế freelancer không?
Không phải với tư cách một danh mục nghề nghiệp. Bằng chứng tốt nhất từ năm 2022 đến 2026 cho thấy AI thay thế các tác vụ cụ thể, chủ yếu là viết lách thường nhật, dịch thuật, tạo hình ảnh và lập trình đơn giản, nơi tin đăng việc làm giảm khoảng một phần năm so với công việc thủ công trong vòng vài tháng kể từ ChatGPT. Nhu cầu đối với công việc phức tạp trong cùng những danh mục đó lại tăng cả về lương lẫn mức độ cạnh tranh, và dữ liệu quốc gia không cho thấy tình trạng thay thế trên toàn bộ nền kinh tế. Những người thua thiệt rõ ràng nhất là người lao động cấp đầu vào trong các ngành nghề chịu tác động, không phải các freelancer giàu kinh nghiệm.
Những công việc freelance nào bị ảnh hưởng nhiều nhất bởi AI?
Viết lách, dịch thuật, biên tập nội dung, sản xuất hình ảnh và thiết kế, và lập trình thường nhật. Các nghiên cứu về Upwork và các nền tảng khác phát hiện những danh mục này mất tin đăng và chứng kiến bằng cấp trở nên kém quan trọng hơn còn giá cả trở nên quan trọng hơn khi khách hàng thuê người. Công việc mang tính vật lý, tại chỗ, dựa trên quan hệ, hoặc đòi hỏi trách nhiệm giải trình cho kết quả, cho đến nay phần lớn không bị ảnh hưởng.
Dùng tác nhân AI có rẻ hơn thuê một freelancer không?
Đối với công việc thường nhật, có thể kiểm tra được, thường là có, nhưng ở mức thấp hơn nhiều so với những gì các phép so sánh nổi bật gợi ý. Đánh giá GDPval của OpenAI phát hiện các mô hình tạo ra sản phẩm chuyên nghiệp nhanh hơn khoảng chín mươi lần tính theo con số thô, nhưng một khi tính cả việc con người kiểm tra và sửa lỗi, mức tiết kiệm giảm xuống còn khoảng 12% đến 39%. Nếu không ai trong doanh nghiệp có thể kiểm tra sản phẩm đầu ra, lựa chọn thực tế là để một tác nhân AI tạo ra công việc và một chuyên gia con người kiểm tra lại.
Doanh nghiệp nhỏ vẫn nên giao công việc gì cho con người?
Bất cứ điều gì không thể đảo ngược, mang tính cảm xúc, thể chất hoặc đòi hỏi trách nhiệm giải trình: thanh toán và xóa dữ liệu, khách hàng đang bực bội, công việc tại chỗ, và những kết quả mà ai đó phải đứng ra chịu trách nhiệm. Một thí nghiệm thực địa năm 2026 tại Alibaba phát hiện các cuộc trò chuyện dịch vụ do tác nhân AI xử lý nhanh hơn nhưng được đánh giá thấp hơn, và sự can thiệp của con người khắc phục các lỗi kỹ thuật tốt hơn nhiều so với các lỗi cảm xúc. Các nền tảng như Jobbit kết hợp một tác nhân AI cho các tác vụ số hóa với một mạng lưới con người dành riêng cho phần còn lại này.
Vì sao các nghiên cứu lại bất đồng về AI và việc làm?
Phần lớn là vì chúng đo lường những thứ khác nhau. Các thí nghiệm có kiểm soát đo lường những gì AI có thể làm trên các tác vụ được chọn lọc và tìm thấy mức tăng lớn; dữ liệu nền tảng đo lường nhu cầu cho các danh mục tác vụ cụ thể và tìm thấy sự sụt giảm cục bộ rõ rệt; dữ liệu bảng lương và hành chính đo lường việc làm và thu nhập trên toàn bộ nền kinh tế và cho đến nay tìm thấy rất ít thay đổi. Bức tranh tổng thể trở nên nhất quán một khi sự thay thế ở cấp độ tác vụ, sự hỗ trợ không đồng đều và sự điều chỉnh tổng thể chậm chạp được đọc cùng nhau.