Preparing your workspace
Jobbit
Case Studies31 min read

Pinapalitan Ba ng mga AI Agent ang mga Freelancer? Ano ang Sinasabi ng 4 na Taon ng Ebidensya (ChatGPT, Claude, Upwork, Jobbit)

Ano ang sinasabi ng apat na taong ebidensya tungkol sa mga AI agent at freelance na trabaho: aling mga gawain ang napalitan, saan pa rin nananalo ang tao, at paano dapat hatiin ng isang negosyo ang trabaho sa pagitan ng mga agent at tao.

Pinapalitan Ba ng mga AI Agent ang mga Freelancer? Ano ang Sinasabi ng 4 na Taon ng Ebidensya (ChatGPT, Claude, Upwork, Jobbit)
Read in:

Halos lahat ng may-ari ng negosyo ay nagtatanong ngayon ng sariling bersyon ng parehong tanong: aling gawain ang maaaring ipasa sa isang AI agent, at alin ang kailangan pa rin ng tao? Sa pagkakataong ito, may laboratoryo na para sa tanong na ito. Simula sa huling bahagi ng 2022, ang mga online freelance platform na pinagtatrabahuhan ng milyun-milyong manunulat, tagasalin, designer at developer ay naging tahanan din ng isang natural na eksperimento tungkol sa kung ano ang mangyayari kapag dumating nang bigla ang isang mahusay na kapalit para sa routine na knowledge work, sa halos zero na marginal cost, sa isang merkado kung saan ang bawat trabaho ay pinopost, pinepresyuhan, at may time stamp.

Tinitingnan ng case study na ito ang eksperimentong iyon sa paraang gagawin ng isang scholar sa kahit anong ibang koleksyon ng ebidensya: kung ano nga ba ang sinukat, gaano kahusay, ano ang ipinapakita ng mga resulta, at ano ang hindi pa nito naipapakita. Kumukuha ito mula sa mga peer-reviewed na pag-aaral at working paper ng mga mananaliksik sa Stanford, MIT, Harvard Business School, University of Chicago at UCLA, sa mga randomised field experiment sa loob ng BCG at Alibaba, sa mga capability evaluation mula sa METR at OpenAI, at sa sariling datos ng mga platform mula sa Upwork at Fiverr. Sinasaklaw ang panahon mula Nobyembre 2022, nang ilabas ang ChatGPT, hanggang Agosto 2026, nang na-update ang pinakabago sa mga pag-aaral na ito.

Ang maikling sagot sa tanong sa titulo ay ang mga agent, sa ngayon, ay pumapalit sa mga gawain sa halip na sa mga freelancer, at ang pagpapalit na ito ay makitid, mabilis, at hindi pantay. Mas kapaki-pakinabang ang mahabang sagot, dahil sinasabi nito sa isang negosyo kung nasaan ang hangganan sa ngayon at paano magtrabaho sa magkabilang panig nito.

Buod ng mga Natuklasan

Limang konklusyon ang nananatiling matatag kahit sa mapanuring pagbasa ng ebidensya.

Una, tunay at puro sa ilang lugar ang pagpapalit. Sa loob ng walong buwan mula nang ilabas ang ChatGPT, bumaba nang mga 21% ang mga job posting para sa pagsulat at coding na trabahong madaling ma-automate sa isang nangungunang global platform kumpara sa manual-intensive na trabaho, at binawasan ng mga image-generation tool ang mga posting para sa image work nang mga 17%. Sa Upwork, ang mga kredensyal at reputasyon ay naging mas mahina bilang panghula kung sino ang kukunin sa mga kategoryang nalantad sa AI, samantalang ang presyo ay naging mas malakas na panghula.

Pangalawa, nananatiling maliit ang epekto sa mas malawak na labor market. Ang pinaka-eksaktong pag-aaral, batay sa mga administrative record ng Denmark, ay hindi nagpapakita ng epekto sa kita o oras ng trabaho na higit sa 2% dalawang taon matapos ang ChatGPT. Matalas ang eksepsiyon dito: sa Estados Unidos, ang employment ng mga manggagawang may edad 22 hanggang 25 sa mga trabahong pinaka-nalantad sa AI ay nasa mga 19% na mas mababa kumpara sa kung ano sana ito kung sumabay ito sa bilis ng mga kapwa manggagawang hindi gaanong nalantad.

Pangatlo, malaki ang pakinabang sa productivity mula sa paggamit ng AI, ngunit hindi ito pantay. Pinakamalaki ito para sa mga manggagawang hindi gaanong may karanasan sa mga routine na gawain, at maaaring maging negatibo para sa mga eksperto sa mga gawaing lampas sa kakayahan ng tool. Sa isang mahigpit na pagsubok, 19% na mas mabagal ang mga developer na may karanasan gamit ang mga AI tool, habang naniniwala silang 20% silang mas mabilis.

Pang-apat, tumawid na ang mga agent mula sa pagiging assistant tungo sa pagiging manggagawa. Ang haba ng gawaing kayang tapusin ng isang frontier system ay dumodoble bawat ilang buwan, at hinuhusgahan na ngayon ng mga bulag na eksperto na grader na ang mga output ng pinakamahusay na modelo ay kapantay o mas mahusay pa sa isang propesyonal sa halos kalahati ng mga kaso. Ngunit kapag isinama na ang oras ng pagsusuri at pagwawasto, bumabagsak ang naisukat na matitipid mula sa halos siyamnapung ulit tungo sa pagitan ng 12% at 39%, at kahit na ang pinakamahusay na workplace agent ay paminsan-minsan pa ring nagkakamali sa maliliit na bagay na may hindi na maibabalik na kahihinatnan.

Panlima, ang makatwirang tugon, at ang pinagsasabayan ng mga platform, ay ang paghahati ng trabaho: mga agent para sa routine, nasusuring digital na trabaho; mga tao para sa paghatol, pananagutan, presensya, at anumang hindi na maibabalik; at isang sinasadyang paglipat sa pagitan ng dalawa.

Ang Kaso: Bakit ang mga Freelance Platform ang Tamang Laboratoryo

Karaniwang gumagamit ang mga labor economist ng taunang survey at malawak na occupational code. Ang mga online freelance platform ay nag-aalok ng isang mas bihirang bagay: trabahong hinati sa indibidwal na gawain, bawat isa ay may petsa ng pag-post, presyo, kategorya, bumibili, nagbebenta, at resulta. Kapag dumating ang isang teknolohiyang kayang gawin ang ilan sa mga gawaing iyon, lumilitaw ang pagbabago sa loob ng ilang linggo sa daloy ng mga posting, sa kung sino ang nananalo sa kontrata at sa anong rate. Agad ding tinatanggap ng merkado ang mga bagong tool, dahil walang procurement cycle sa pagitan ng isang freelancer at isang browser tab.

Ang mismong mga katangiang ito ang nagpapahina sa laboratoryong ito. Itinatala ng mga platform ang naka-post na demand, hindi ang lahat ng demand; isang kliyenteng gumagawa na ng trabaho in-house gamit ang isang agent ay nawawala na lamang sa datos sa halip na lumitaw bilang isang pagpapalit. Nagbabago ang mga kategorya, kaya ang pagbaba sa "writing" ay maaaring bahagyang muling-pagtatalaga lamang tungo sa "AI content editing". Karamihan sa malalaking dataset ay Amerikano, at hindi kumakatawan ang mga freelancer sa platform sa buong workforce. Mahalaga ang mga limitasyong ito para sa interpretasyon, at babalikan ito sa ibaba, ngunit hindi nito ginagawang walang saysay ang ebidensya. Ginagawa lamang nito itong isang leading indicator sa halip na isang census.

Hindi maliit ang nakataya rito. Tinatantya ng IPSE na mga 2.05 milyong tao ang freelance workforce ng UK, humigit-kumulang kalahati ng 4.2 milyong solong self-employed sa bansa, gamit ang isang kahulugang nakatuon lamang sa tatlong pangkat ng trabahong may pinakamataas na kasanayan. Iyon mismo ang mga trabahong iniuuri ng mga pag-aaral sa AI applicability bilang pinakamataas.

Isang Timeline ng Ebidensya, 2022 hanggang 2026

TaonPag-aaralSetting at DisenyoPangunahing Natuklasan
2023 hanggang 2024Hui, Reshef at Zhou, Organization ScienceMalaking freelance platform, difference-in-differences sa paligid ng ChatGPT at mga image modelNawalan ng trabaho at kita ang mga nalantad na freelancer; hindi sila protektado ng matibay na nakaraang performance
2023Dell'Acqua at mga kasamahan, Harvard Business School kasama ang BCGRandomised trial, 758 consultant, GPT-4Sa loob ng saklaw ng tool: 12.2% na mas maraming gawain, 25.1% na mas mabilis, 40% na mas mataas na kalidad. Sa labas nito: 19 porsyentong-puntos na mas mababa ang tsansang maging tama
2024 hanggang 2025Demirci, Hannane at Zhu, Management ScienceNangungunang global platform, mga job postingBumaba nang 21% ang mga posting sa pagsulat at coding na madaling ma-automate sa loob ng walong buwan; bumaba nang 17% ang mga image posting
2025Brynjolfsson, Li at Raymond, Quarterly Journal of Economics5,179 customer support agent, staggered rolloutTumaas ang productivity nang 14% sa average, 34% para sa mga baguhan, kaunti para sa mga eksperto
2025Humlum at Vestergaard, NBER, binago noong 2026Denmark, mga adoption survey na naka-link sa administrative recordEpekto sa kita at oras ay nasa loob ng 2% pagkalipas ng dalawang taon; muling inayos sa halip ang trabaho
2025METRRandomised trial, 16 developer na may karanasan, 246 totoong gawain19% na mas mabagal gamit ang mga AI tool; naniniwala ang mga kalahok na 20% silang mas mabilis
2025OpenAI, GDPval44 trabaho, bulag na pagmamarka ng ekspertoNananalo o nagpapantay ang mga output ng pinakamahusay na modelo nang 47.6% ng panahon; bumababa ang matitipid sa 12% hanggang 39% kapag isinama na ang oras ng pagsusuri
2025 hanggang 2026Brynjolfsson, Chandar at Chen, StanfordMga ADP payroll record hanggang Hunyo 202619% nahuhuli sa mga kapwa manggagawa ang mga edad 22 hanggang 25 sa mga nalantad na trabaho; walang economy-wide displacement
2026Siddiq at Zhang, UCLA2.26 milyong kontrata sa Upwork, 2021 hanggang 20267.8% na mas mahina bilang panghula ang mga kredensyal at reputasyon para sa pagkuha sa mga nalantad na kategorya; mas malakas na panghula ang presyo
2026Wang at mga kasamahan, AlibabaRandomised field experiment, agentic AI na may human supervisorMas maikling chat ngunit mas mababang rating kapag ang agent ang humawak; mas mahusay na nailigtas ng tao ang mga teknikal na kabiguan kaysa sa emosyonal
2026Styles at Miller, WorkBench revisitedWorkplace agent benchmark, 2024 laban sa 2026Pagkumpleto ng gawain mula 43% tungo sa 98%; mapaminsalang aksyon mula 26% tungo sa 1.9%, hindi zero
2026Upwork, Future Workforce IndexSurvey ng 2,400 na mahusay na manggagawa sa US kasama ang platform dataNagbabayad nang 34% na mas mataas kada oras ang AI work; nagbabayad nang 13% na mas mababa kada kontrata ang simpleng generative work kumpara noong isang taon

Natuklasan 1: Tunay, Mabilis at Makitid ang Pagpapalit

Nagmula ang pinakaunang mahigpit na ebidensya kina Xiang Hui, Oren Reshef at Luofeng Zhou, na ang kanilang pag-aaral sa isang malaking online labor platform ay nailathala sa Organization Science noong 2024 at nagwagi kalaunan ng Olin Award ng Washington University para sa pananaliksik na may praktikal na epekto. Sa paghahambing ng mga freelancer sa mga trabahong nalantad sa ChatGPT, DALL-E 2 at Midjourney sa mga nasa hindi gaanong nalantad na trabaho, natagpuan nila ang pagbaba kapwa sa bilang ng mga trabaho at buwanang kita para sa nalantad na grupo. Ang natuklasang nagpabalisa sa larangan ay ang tungkol sa kalidad. Hindi naprotektahan ang mga freelancer na may matibay na nakaraang rating at mahabang track record; kung mayroon man, iniuulat ng mga may-akda ang nagpapahiwatig na ebidensya na mas matinding tinamaan ang mga top performer. Ang pinaka-makatwirang paliwanag ay sa routine na text at image work, ang isang napakahusay na output ng tao at isang sapat na output ng makina ay naging halos magkatulad na kapalit sa paningin ng mga bumibili, kaya ang premium para sa kahusayan ang unang nawala.

Sinukat naman nina Ozge Demirci, Jonas Hannane at Xinrong Zhu ang demand side nang direkta. Gamit ang mga posting mula sa isang nangungunang global freelancing platform, sa isang papel na nailathala sa Management Science noong 2025, natagpuan nila ang 21% na pagbaba sa mga posting para sa pagsulat at coding na trabahong madaling ma-automate kumpara sa manual-intensive na trabaho sa loob ng walong buwan mula nang ilabas ang ChatGPT, at 17% na pagbaba sa mga image-creation posting matapos dumating ang mga image-generating na modelo. May dalawang pangalawahing resulta na kasing-halaga ng pangunahing balita. Ang mga posting na nanatili sa mga nalantad na kategorya ay mas komplikado at mas mataas ang bayad, at tumindi ang kompetisyon para sa mga ito. Sa madaling salita, hindi inubos ng pagpapalit ang buong kategorya; inalis lamang nito ang ilalim nito.

Bakit pagsulat, pagsasalin at image work ang unang naapektuhan? Binibigyang-anyo ng pagsusuri ng Microsoft Research sa 200,000 anonymized na Bing Copilot conversation, na nailathala noong 2025, ang mekanismong ito. Ang mga trabahong may pinakamataas na AI applicability ay yaong ang trabaho ay binubuo ng pangongolekta, paggawa at pagpapahayag ng impormasyon; nangunguna sa listahan ang mga interpreter at tagasalin, kung saan 98% ng kanilang mga gawain sa trabaho ay nagsasalubong sa mga gawaing matagumpay nang nagagawa ng assistant. Ang applicability ay hindi displacement, at maingat itong sinasabi ng mga may-akda, ngunit halos eksaktong nahuhulaan ng ranggo kung aling mga kategorya sa freelance ang natagpuan ng mga pag-aaral sa platform na humihina.

Ang pinakabago at, para sa isang mambabasang negosyante, ang pinaka-nakapagtuturong ebidensya ay nagmula kina Auyon Siddiq at Niuniu Zhang sa UCLA Anderson. Sinusundan ng kanilang 2026 working paper, "Human Capital, AI, and Labor Commoditization", ang halos 50,000 Upwork freelancer na aktibo bago ang ChatGPT sa loob ng 21 quarter mula unang bahagi ng 2021 hanggang unang bahagi ng 2026, sumasaklaw sa 2.26 milyong natapos na kontrata. Sa halip na bilangin ang mga trabaho, itinatanong nila kung ano ang naghuhula kung sino ang kinukuha. Sa mas nalantad-sa-AI na mga kategorya tulad ng pagsasalin at pagsulat, ang pinagsamang timbang ng self-presentation, kredensyal at reputasyon ng isang freelancer bilang panghula ay bumaba nang mga 7.8% kumpara sa hindi gaanong nalantad na mga kategorya tulad ng photography, at tumaas ang timbang ng presyo. Sa huling taon, nawalan na ng mga 10.1% ng kahalagahan ang mga sukatan ng human capital, at nakakuha naman ang presyo nang mga 1.8%. Humina ang bentahe ng mga freelancer na may karanasan nang 6.2% at pagkatapos ay 10.3%, at sa pinaka-nalantad na trabaho, nanalo ang mga mas murang freelancer nang 7.9% na mas maraming kontrata. Bumaba ang pangkalahatang demand sa mga nalantad na larangan nang mga 7%. Ang tawag ng mga may-akda dito ay commoditisation: kapag may makukuha nang katanggap-tanggap na unang draft ang isang bumibili mula sa isang modelo, ang babayaran nila sa isang tao ay lumilipat mula sa "sino ka" tungo sa "magkano".

Natuklasan 2: Maliit Pa Rin ang Pangkalahatang Epekto, May Isang Malakas na Eksepsiyon

Kung ang ebidensya mula sa mga platform lang ang buong kuwento, dapat sana ay makikita na ito sa mga pambansang istatistika ngayon. Sa karamihan, hindi ito nakikita, at ang mga pag-aaral na hindi nakakita ng malalaking epekto ay kabilang sa pinakamahusay na dinisenyo.

Iniugnay nina Anders Humlum at Emilie Vestergaard ang malakihang adoption survey sa mga administrative labor record ng Denmark, na sumasaklaw sa 25,000 manggagawa at 7,000 lugar ng trabaho sa labing-isang nalantad na trabaho. Idinodokumento ng kanilang NBER working paper, unang ipinamahagi noong 2025 at binago noong Marso 2026, ang mabilis na adoption: karamihan sa mga employer sa nalantad na trabaho ay naglunsad na ng mga chatbot initiative, iniulat ng mga manggagawa ang mga benepisyo sa productivity, at malawak na ang mga bagong gawaing kaugnay ng AI. Gayunpaman, eksaktong zero ang mga estimate ng difference-in-differences sa kita at naitalang oras ng trabaho, na hindi nagpapakita ng epekto na higit sa 2% dalawang taon matapos ang ChatGPT, kapwa sa antas ng manggagawa at ng lugar ng trabaho. Ang nagbago ay ang istruktura ng trabaho: hinarap ng mga employer ang teknolohiya sa pamamagitan ng muling pag-aayos ng gawain, kabilang ang mga bagong gawain sa paggawa ng content, pangangasiwa ng AI at pag-integrate ng AI, at ang mga nag-adopt ay lumipat sa mga trabahong mas mataas ang bayad kung saan mas kapaki-pakinabang ang mga tool, bagama't kakaunti lamang ang bilang para makaapekto sa mga average. Inilagay ng naunang bersyon ng papel ang self-reported na matitipid na oras sa mababa sa 3% ng oras ng trabaho, isang maliit na bahagi lamang ng mga pakinabang, kadalasan ay higit sa 15%, na idinodokumento ng mga controlled trial sa parehong mga trabaho. Ang agwat sa pagitan ng magagawa ng AI sa isang trial at ang binabago nito sa payroll ang sentrong bugtong ng literaturang ito, at ang Denmark ang lugar kung saan ito pinakamalinaw na nasusukat.

Ang Budget Lab sa Yale ay umaabot sa katulad na konklusyon para sa Estados Unidos sa ibang daan. Sa pagsubaybay sa occupational mix ng employment at paggamit ng synthetic difference-in-differences sa mga trabahong nalantad sa AI, walang malinaw na bakas ng AI na natagpuan ang mga update nito noong 2025 at 2026. Ipinapakita ng unang bahagi ng 2026 ang mababang layoff ngunit mababa rin ang hiring, at pinagtatalunan ng mga may-akda na ang isang teknolohiyang may malawakang epekto ay inaasahang mangangailangan ng mas mahabang panahon kaysa sa halos tatlong taon mula nang lumabas ang ChatGPT bago ito magpakita.

Idinodokumento ang eksepsiyon nina Erik Brynjolfsson, Bharat Chandar at Ruyu Chen sa Digital Economy Lab ng Stanford, na ang kanilang papel na "Canaries in the Coal Mine?" ay gumagamit ng mga ADP payroll record na sumasaklaw sa milyun-milyong Amerikanong manggagawa. Sa update nito noong Agosto 2026, gamit ang datos hanggang Hunyo 2026, ang employment ng mga manggagawang edad 22 hanggang 25 sa mga trabahong lubos na nalantad sa AI ay nasa mga 19% na mas mababa kumpara sa kung ano sana ito kung sumunod ito sa mga manggagawang katulad ang edad sa hindi gaanong nalantad na trabaho, taas mula sa 15% na agwat noong nakaraang taon. Sa antas, bumaba ang employment ng grupong edad na iyon sa dalawang pinaka-nalantad na quintile nang mga 11% sa pagitan ng Nobyembre 2022 at Hunyo 2026 samantalang lumago ang employment sa tatlong hindi gaanong nalantad na quintile nang mga 10%. Walang katulad na agwat ang mga manggagawang may karanasan, at malinaw na sinabi ng mga may-akda na wala silang nakikitang malawakang, economy-wide na displacement. Ang mga pagbaba ay puro sa mga trabahong ang paggamit ng AI ay nag-a-automate ng trabaho sa halip na nagpapalakas dito.

Magkatugma ang mga resultang ito kapag tumigil na ang isang tao sa pag-asang kikilos ang AI na parang isang resesyon. Unang lumilitaw ang pagpapalit sa antas ng gawain kung saan pinakamaikli ang mga kontrata at pinaka-madalas muling pinepresyuhan: ang mga freelance gig at entry-level hiring. Ang freelance market ang kanaryo dahil muli itong pinepresyuhan bawat linggo; ang payroll ang mina, at ang hangin doon ang pinakakaunting nagbago sa ngayon.

Natuklasan 3: Malaki Ngunit Hindi Pantay ang Pakinabang sa Pagpapalakas, at Baku-Bako ang Hangganan

Ang panig na kabaligtaran ng pagpapalit ay ang pagpapalakas, at dito lubhang matibay ang ebidensyang eksperimental dahil posible ang randomisasyon.

Pinag-aralan nina Brynjolfsson, Danielle Li at Lindsey Raymond ang staggered na pagpapakilala ng isang generative AI assistant sa 5,179 customer support agent, sa isang papel na nailathala sa Quarterly Journal of Economics noong 2025. Tumaas ang mga isyung nalutas kada oras nang 14% sa average, na may 34% na pakinabang para sa mga baguhan at mas mababa ang kasanayang ahente, at kaunting pagbabago para sa mga may karanasan at mataas ang kasanayan. Waring na-encode ng tool ang mga kasanayan ng pinakamahusay na ahente at ipinasa ang mga ito sa pinakabago, na mas mabilis silang inilipat pababa sa experience curve.

Si Fabrizio Dell'Acqua at mga kasamahan sa Harvard Business School, kasama ang BCG, ay nag-randomize ng 758 management consultant sa mga makatotohanang gawain, may at walang GPT-4, sa isang pag-aaral na nailathala na ngayon sa Organization Science. Sa labingwalong gawaing nasa loob ng kakayahan ng modelo, natapos ng mga consultant na may AI ang 12.2% na mas maraming gawain, 25.1% na mas mabilis, na may kalidad na na-rate nang 40% na mas mataas ng mga bulag na evaluator. Sa isang gawaing sinadyang piliin upang lumagpas sa kakayahang iyon, ang mga consultant na may AI ay 19 porsyentong-puntos na mas mababa ang tsansang makarating sa tamang sagot. Ang pariralang ginamit ng mga may-akda para sa hangganang ito, ang baku-bakong hangganan ng teknolohiya, ay naging karaniwang paglalarawan sa suliranin: ang kakayahan ng tool ay hindi sumusunod sa mga linyang makikita ng isang user, at mahina ang mga user sa pagtukoy kung nasaan sila sa hangganan.

Isang field experiment sa loob ng operasyon ng customer service ng Alibaba, nina Xiao Ni, Tianjun Feng, Lauren Xiaoyuan Lu at mga kasamang may-akda, ang muling nagpakita ng parehong pattern ng distribusyon sa malaking sukat: 5,940 na bagong ahente, humigit-kumulang 2.56 milyong chat, 390,000 rating ng customer. Pinakamalaki ang pag-unlad ng mahihinang performer kapwa sa bilis at kalidad; kaunti lamang ang napala ng mga top performer sa bilis at bumaba pa ang kalidad sa parehong subjective at objective na sukatan. Ang tulong na nagtataas sa sahig ay maaaring magpababa sa kisame.

Mayroon ding randomised trial ng METR sa mga developer na may karanasan sa open-source, na nailathala noong Hulyo 2025, na siyang pinaka-binabanggit na maingat na resulta sa panahong ito at karapat-dapat sa isang eksaktong pagsasaad. Labing-anim na developer ang gumawa ng 246 totoong gawain sa mga repository na kanilang pinapanatili, na ang average ay higit sa 22,000 star at isang milyong linya ng code, kung saan ang mga gawain ay random na pinahihintulutan o ipinagbabawal ang mga AI tool, pangunahin ang Cursor gamit ang Claude 3.5 at 3.7 Sonnet. Gamit ang AI, 19% silang mas matagal. Bago ang pag-aaral, inaasahan nilang magkakaroon ng 24% na pagbilis; pagkatapos, tinantya nilang naging 20% silang mas mabilis. Kasinghalaga ng resulta sa productivity ang agwat sa persepsyon. Iminumungkahi nito na ang mga self-reported na pakinabang, na siyang pundasyon ng karamihan sa mga industry survey, ay may bias pataas, lalo na kung saan pinakamataas ang kadalubhasaan. Tinatalakay ang mga implikasyon para sa software work partikular sa papalitan ba ng AI ang mga software developer?

Pinagsama-sama ng isang 2025 review nina R. Maria del Rio-Chanona, Ekkehard Ernst, Rossana Merola, Daniel Samaan at Ole Teutloff ang mga sinulid na ito sa buong literatura: pakinabang sa productivity na humigit-kumulang 20% hanggang 60% sa mga controlled trial at 15% hanggang 30% sa mga field experiment, mas malaki para sa mga baguhan sa mga simpleng gawain, magkahalo sa mga komplikadong gawain, kasama ang digital trace data na nagpapakita ng pagpapalit sa pagsulat at pagsasalin kasabay ng tumataas na demand para sa mga kasanayan sa AI at banayad ngunit lumalagong ebidensya ng bumababang demand para sa mga baguhan.

Natuklasan 4: Tumawid ang mga Agent Mula sa Assistant Tungo sa Manggagawa, at ang Agwat sa Reliability ang Buong Kuwento

Ang lahat ng nabanggit sa itaas ay tungkol sa AI bilang isang assistant ng isang taong nananatiling kasali sa bawat hakbang. Ang pagbabago mula 2025 ay ang mga sistema ngayon ay nagsasagawa na ng multi-step na trabaho habang ang tao ay sumusuri lamang sa dulo, o hindi na sumusuri kung minsan, at binabago nito kung anong ebidensya ang mahalaga.

Sinusukat ng time-horizon measure ng METR kung gaano kahaba ang isang gawain, na ipinapahayag sa oras na kakailanganin ng isang propesyonal na tao, na kayang tapusin ng isang sistema na may 50% na success rate. Sa Enero 2026 na rebisyon ng metodolohiya, na may suite na pinalawak sa 228 gawain kabilang ang 31 na may walong oras o higit pa, ang pangmatagalang doubling time ay tinantya sa mga 196 na araw, na may mas mabilis na doubling na 131 araw simula 2023 at 89 araw simula 2024. Ang pinakamahusay na nasukat na modelo sa puntong iyon, ang Claude Opus 4.5, ay may 50% na horizon na mga 320 minuto, na may malawak na confidence interval na humigit-kumulang tatlo hanggang labindalawang oras. Malinaw na sinasabi ng mga may-akda na mapagbigay ang 50% na success threshold para sa totoong trabaho, na sensitibo ang trend sa komposisyon ng gawain, at karamihan sa mahahabang gawain ay gumagamit ng tinatantyang oras ng tao sa halip na aktwal na nasukat. Kung isasaalang-alang ang mga babalang ito, malinaw ang direksyon: ang haba ng digital na trabahong maaaring ipagkatiwala ay lumalago nang exponential.

Sinusuri ng GDPval evaluation ng OpenAI, na inilabas sa huling bahagi ng 2025, kung maganda ba talaga ang naipagkatiwalang trabahong iyon. Isinulat ang mga gawain ng mga propesyonal sa 44 na trabaho sa siyam na sektor, na ang average ay 14 na taong karanasan, at pinagmarkahan sa pamamagitan ng bulag na pairwise comparison ng eksperto laban sa output ng tao. Ang pinakamahusay na modelo, ang Claude Opus 4.1, ay gumawa ng mga output na pinagmarkahang mas mahusay o katumbas ng sa eksperto sa 47.6% ng mga kaso. Ibang bilang ang dapat tandaan ng isang negosyo. Ang simpleng paghahambing ng oras ng makina sa oras ng tao ay nagbibigay ng ratio na malapit sa siyamnapung ulit, ngunit kapag isinama na ng papel ang isang taong sumusuri at, kung kinakailangan, ginagawa muli ang trabaho, bumababa ang tinatantyang matitipid sa pagitan ng 1.12 at 1.39 beses depende sa estratehiya. Doon napunta ang gastos, sa pagsusuri. Iyon din ang mekanismong natagpuan ni Dell'Acqua sa mga consultant at ng METR sa mga developer, ngayon ay nasusukat na sa antas ng output.

Ipinapakita ng mga workplace benchmark kapwa ang bilis ng pag-unlad at ang naiiwang problema. TheAgentCompany, mula sa Carnegie Mellon, ay naglagay ng mga agent sa isang simulated na software firm na may totoong instance ng GitLab, OwnCloud, Plane at RocketChat at 175 gawain; natapos ng pinakamahusay na agent ang halos ikaapat na bahagi ng mga ito sa paglunsad noong huling bahagi ng 2024 at mga 30% noong 2025. Muling binisita nina Olly Styles at Sam Miller ang kanilang WorkBench benchmark noong Hunyo 2026 at iniulat na ang rate ng pagkumpleto ng gawain ng pinakamahusay na agent ay tumaas mula 43% para sa GPT-4 noong Marso 2024 tungo sa 98% para sa Claude Fable 5, samantalang bumaba ang bahagi ng mga run na may hindi sinasadyang mapaminsalang aksyon mula 26% tungo sa 1.9%. Iniuulat din nila na ang mga frontier model ay nagkakamali pa rin sa mga pangunahing bagay na paminsan-minsang nagdudulot ng hindi na maibabalik na pinsala. Napakaganda ng dalawang porsyento; ngunit ito rin ay halos isang run sa bawat limampu na gumagawa ng bagay na hindi dapat gawin.

Ang 2026 Alibaba field experiment, nina Yiwei Wang, Chuan Zhu, Tianjun Feng, Lauren Xiaoyuan Lu at Bingxin Jia, ang unang randomised na ebidensya sa agentic AI na may mga taong kasali sa proseso sa isang live na operasyon ng serbisyo. Sinubaybayan ng mga ginamit na manggagawa ang isang agent na humahawak sa mga karapat-dapat na chat ng customer habang ginagawa nila ang natitira nang de-kamay. Bumaba ang average na tagal ng chat na may limitadong epekto sa mga customer na bumabalik dahil sa parehong problema, ngunit ang mga chat na hinawakan ng agent ay tumanggap ng mas mababang rating nang malaki. Mas mahusay na naibalik ng human intervention ang sitwasyon kapag teknikal ang kabiguan, isang hindi pa nalulutas na isyu, kaysa kapag emosyonal ito, isang naiinis na customer, at pinakamainam ito kapag maaga itong ginawa. Ang mga nagsusubaybay na manggagawa ay mas nagbigay-pansin din sa mga chat na hinahawakan pa rin nila mismo, isang positibong spillover. Ito ang pinaka-direktang ebidensya sa ngayon kung paano dapat idisenyo ang paglipat sa pagitan ng agent at tao: manood nang maaga, mamagitan sa mga katotohanan, at huwag iwan ang mga damdamin sa makina.

Kinukumpirma ng adoption data na hindi lamang nakukulong sa mga laboratoryo ang paglipat na ito. Iniulat ng Economic Index ng Anthropic para sa Marso 2026 na 49% ng mga trabaho ay nakakita na ng kahit isang-kapat ng kanilang mga gawain na isinasagawa gamit ang Claude, at lumipat na ang coding work mula sa conversational use tungo sa automated API workflow, kung saan tumaas ang bahagi ng coding nang 14% sa API at bumaba nang 18% sa chat product simula Agosto 2025. Natagpuan ng ambag ni Lightcast sa 2026 Stanford AI Index ang mga kasanayan sa AI sa 2.5% ng lahat ng job posting sa US, at tumaas ang mga posting na bumabanggit ng skill cluster na "agentic AI" mula 0.06% noong 2024 tungo sa 0.23% noong 2025, humigit-kumulang 90,000 na posting. At sa UpBench, isang 2025 benchmark na binuo mula sa totoo at natapos na mga trabaho sa Upwork marketplace, hinahati ng mga eksperto na freelancer ang bawat trabaho sa mga nasusuring acceptance criteria kung saan sinusukat ang mga agent. Ang pagmamarka sa mga agent gamit ang rubric na ilalapat ng isang kliyente sa isang freelancer ay isang senyales kung saan inaasahang patutunguhan ng supply side.

Mga Mekanismo: Bakit Ganito ang Anyo ng Pattern

Apat na mekanismo ang nagpapaliwanag sa karamihan ng ipinapakita ng ebidensya, at karapat-dapat itong sabihin dahil hinuhulaan nila kung ano ang susunod na mangyayari.

Ang una ay ang commoditisation ng routine na kakayahan. Kapag gumawa ang isang modelo ng katanggap-tanggap na draft ng isang paglalarawan ng produkto, isang pagsasalin, o isang boilerplate module, bumababa ang kahandaang magbayad ng bumibili para sa mga kredensyal ng isang tao sa kategoryang iyon, at ang presyo ang nagiging desisibong variable. Sinusukat mismo nina Siddiq at Zhang ang paglipat na ito, at ipinapakita nina Demirci at mga kasamahan ang kabaligtaran nito: ang trabahong nananatiling gawa ng tao ay nagiging mas komplikado at mas mataas ang bayad, at mas pinagtatalunan.

Ang pangalawa ay ang gastos sa pag-verify bilang ang bindig na hadlang. Naging mura ang produksyon; hindi naman ang pagsusuri. Ang pagbagsak ng GDPval mula siyamnapung ulit tungo sa mas mababa sa 1.4 ulit kapag isinama na ang pagsusuri, ang pagbagal ng mga eksperto sa METR, at ang baku-bakong hangganan ay naglalarawan lahat ng parehong ekonomiya. Sinumang kayang mag-verify ng isang output nang mura ang nakakakuha ng pakinabang; sinumang hindi kaya ang siyang magbabayad dito sa rework o sa hindi natukoy na error. Ito ang dahilan kung bakit dumadaloy ang pakinabang sa mga baguhan sa mga gawaing madaling suriin at humihinto para sa mga eksperto sa mga gawaing kasing-mahal suriin gaya ng paggawa.

Ang pangatlo ay ang agwat sa apprenticeship. Ang mga gawaing mahusay gawin ng isang agent ay ang mga gawaing dati ay ibinibigay ng mga kumpanya sa mga junior staff at junior freelancer upang sila'y matuto. Ipinapakita nina Brynjolfsson, Li at Raymond na pinakatumutulong ang tulong sa mga baguhan; ipinapakita naman nina Brynjolfsson, Chandar at Chen na kahit na gayon, mas kaunti ang kinukuhang junior ng mga kumpanya. Parehong maaaring totoo: ang isang kumpanyang nangangailangan ng mas kaunting junior para makagawa ng parehong output ay kukuha ng mas kaunting junior, kahit na mas produktibo ang bawat isa. Ang pangmatagalang gastos, isang manipis na pipeline ng mga taong may karanasan, ay hindi pa nakikita sa anumang dataset at siyang pinakamahalagang hindi pa nasusukat na variable sa larangang ito.

Ang pang-apat ay ang pagpapatuloy ng mga gawaing tao na dagdag-pakinabang. Ang comparison group ni Demirci na manual-intensive na trabaho ay hindi bumaba. Ipinapakita ng Alibaba experiment na lumalaban ang mga emosyonal na kabiguan sa pagbawi ng makina. Ang pananagutan, presensya, pisikal na trabaho at relasyon ay nananatiling gawa ng tao dahil sa mga dahilang walang kinalaman sa kakayahan ng modelo at may lubos na kinalaman sa kung ano ang tatanggapin ng isang customer.

Dapat isaalang-alang ng isang mapanuring mambabasa ang dalawang alternatibong paliwanag kasabay ng mga ito. Ang pagbaba sa entry-level sa Estados Unidos ay nagkataon lamang na kasabay ng mas mataas na interest rate at ang pagkawala ng hiring noong panahon ng pandemya sa teknolohiya, na hiwalay na tumama sa parehong cohort; tinutugunan ito ng mga may-akda ng Stanford sa pamamagitan ng mga within-firm na paghahambing at sa paghahambing ng mga automating laban sa augmenting na trabaho, ngunit hindi ganap na maisasantabi ang confound na ito. At ang bawat sukatan ng "exposure" ay mismong hango sa modelo, kaya bahagyang sinusuri ng mga pag-aaral ang mga pagpapalagay ng classifier. Maaari ding pigilan ng mga institusyon ng collective bargaining sa Denmark ang mga tugon sa sahod na sana'y lumitaw nang mas mabilis sa isang mas maluwag na labor market.

Paano Tumugon ang mga Platform

Nabasa ng mga marketplace ang parehong mga senyales at kumilos. Noong Abril 2025, sumulat sa mga tauhan ang punong ehekutibo ng Fiverr na si Micha Kaufman na "darating ang AI para sa inyong mga trabaho", kabilang ang sa kanya, at hinimok silang bihasahin ang mga tool tulad ng Cursor at Legora; noong Setyembre 2025, nagtanggal ang kumpanya ng humigit-kumulang 250 posisyon, malapit sa 30% ng kanyang workforce, upang maging kung ano ang tinawag nitong isang AI-first na kumpanya, matapos ilunsad ang mga Fiverr Go creator tool nito noong Pebrero ng taon ding iyon. Ginagawa ng Upwork ang assistant nitong si Uma tungo sa inilalarawan nitong isang laging-aktibong work agent na kumikilos sa ngalan ng mga kliyente at freelancer, at binabalangkas muli ng 2026 Future Workforce Index nito ang matagumpay na freelancer bilang isang "AI orchestrator" na nag-uugnay ng mga tool sa domain expertise at naglalapat ng paghatol. Ibinibigay ng parehong ulat ang senyales sa presyo sa isang linya: kumita nang 34% na mas mataas kada oras ang mga freelancer na gumagawa ng AI work kaysa sa mga hindi, tumaas nang 45% year on year ang kita ng komplikadong AI-augmented na trabaho, samantalang lumago nang 90% sa contract start ang generative AI at creative production work habang bumaba nang 13% ang kita kada kontrata. Lumipat ang volume sa simpleng dulo; lumipat ang pera sa komplikadong dulo.

Ang Jobbit, ang platform kung saan inilathala ang case study na ito, ay idinisenyo batay sa paghahati ng trabaho na itinuturo ng ebidensya sa halip na sa alinman sa dalawang panig nito. Kinukuha ng agent ang nasusuring digital na trabaho: ang pagbuo at pag-deploy ng isang website o web app, ang pagdaraft ng mga dokumento at presentasyon, ang pagsasagawa ng research, ang pag-set up ng mga automation, ang paggawa ng mga imahe at video. Mapapanood ng user ang paggawa nito sa agent browser at maaaring kontrolin ito anumang sandali, na siyang early-intervention pattern na natagpuan na pinaka-epektibo ng Alibaba experiment. Para sa trabahong hindi magaling gawin ng isang agent o hindi dapat gawin nang mag-isa, mga pisikal at lokal na trabaho, accountable na pagsusuri ng eksperto, anumang kailangan ng customer sa isang tao, inuutos ng platform sa isang moderated na human network sa pro.jobbit.uk. Hindi pa naglalathala ang Jobbit ng sarili nitong trial data, at walang inaangkin ang pag-aaral na ito tungkol sa nasukat na resulta rito; ang inaangkin ay ang pagkakatugma sa pagitan ng isang disenyo at ng ebidensya. Ang mga mambabasang gustong malaman ang mekanismo ay maaaring magsimula sa ano nga ba talaga ang agentic AI, ang gabay sa pagmamanman at pagkontrol sa agent browser, at ang praktikal na listahan ng mga use case ng AI para sa maliit na negosyo.

Ano ang Dapat Gawin ng Isang Negosyo sa Ebidensyang Ito

Ang mga natuklasan ay nagiging isang panuntunan sa pagdelegasyon na maaaring ilapat ng isang may-ari ng negosyo nang hindi na kailangang magbasa ng kahit isang papel.

Ibigay sa isang agent ang trabahong routine at nasusuri: mga unang draft, buod, research brief, standard na dokumento, isang website o internal na tool na maaari mong i-click at suriin sa loob lang ng isang hapon. Dito nakikita ng bawat pag-aaral ang pinakamalaking pakinabang, lalo na kung kasalukuyang ginagawa ng negosyo ang gawain nang mabagal o hindi man lang ginagawa, dahil ang epekto sa mga baguhan ay pareho ring naaangkop sa mga kumpanya tulad ng sa mga tao. Isang praktikal na paunang pagkakasunud-sunod ang inilahad sa paano i-automate ang iyong negosyo gamit ang mga AI agent.

Panatilihin ang isang tao sa trabahong hindi na maibabalik, emosyonal, pisikal, o may pananagutan: anumang nagpapadala ng pera, nagbubura ng datos, nakikitungo sa isang customer na galit, o nangangailangan ng isang taong sasagot para sa resulta. Iyan din ang itinuturo ng Alibaba experiment at ng naiiwang problema sa WorkBench.

Isama sa presyo ang oras ng pagsusuri bago magpasyang mas mura ang isang agent. Ang tapat na aritmetika ng GDPval, isang matitipid na 12% hanggang 39% sa halip na siyamnapung ulit, ang bilang na dapat pagbatayan sa pagpaplano. Kung walang sinuman sa negosyo ang makakasuri sa output, hindi totoo ang matitipid; ang sagot sa kasong iyon ay hayaang gawin ng agent ang trabaho at susuriin ito ng isang eksperto na tao, na siyang kaayusang ipinapakita ng freelance data na binabayaran na ng mga bumibili ng premium.

Asahan na baku-bako ang hangganan at gumagalaw ito. Ang isang gawaing hindi kayang gawin ng agent noong Enero ay maaaring maging routine na noong Setyembre, ngunit hindi totoo ang kabaligtaran. Subukan, itala kung ano ang na-check at kung ano ang nabigo, at baguhin ang paghahati bawat quarter.

Ang gumaganang panuntunan mula sa apat na taong ebidensya: ipagkatiwala ang routine at nasusuring gawain, panatilihin ang isang tao sa anumang hindi na maibabalik o emosyonal, at ituring ang oras ng pagsusuri bilang bahagi ng presyo.

Mga Limitasyon at Bukas na mga Tanong

Karamihan sa malalaking dataset ay Amerikano, at sinusukat ng platform data ang naka-post na demand sa halip na lahat ng trabahong isinagawa. Ang mga sukatan ng exposure ay hango sa modelo, kaya bahagyang minana ng mga resulta ang mga pagpapalagay ng classifier. Maiikli ang mga horizon: dalawang taon sa Denmark, mababa sa apat sa Estados Unidos, at makatwiran ang punto ng mga may-akda ng Yale na ang malawakang epekto ay maaaring mangailangan ng mas mahabang panahon. Hindi mga trabaho ang mga benchmark; ang mga gawain sa GDPval ay self-contained na output at ang WorkBench ay isang synthetic na opisina, samantalang ang totoong trabaho ay nagagambala, malabo, at pulitikal. Kumikilos nang sapat na mabilis ang kakayahan kaya ang anumang bilang sa pag-aaral na ito ay isang snapshot lamang, at ang mga pag-aaral na pinakamalamang mapapalitan ay ang mga numero sa kakayahan, hindi ang mga sa paggawa. Sa huli, ang epekto na pinakamahalaga para sa susunod na dekada, kung ang isang manipis na apprenticeship pipeline ay nagpapababa sa suplay ng mga eksperyensadong propesyonal, ay hindi pa masusukat sa ngayon.

Konklusyon

Pinapalitan ba ng mga AI agent ang mga freelancer? Sa ngayon, pinapalitan nila ang mga gawain, at ginagawa nila ito kung saan ang output ng isang gawain ay maaaring gawin at hatulan bilang routine. Sapat na iyon upang paliitin ang merkado ng commodity na pagsulat, pagsasalin at image work, upang panghinaan ang hiring premium para sa mga kredensyal sa mga kategoryang iyon, at upang bawasan nang malaki ang entry-level hiring sa mga nalantad na trabaho, habang halos hindi nagbabago ang kita at oras ng trabaho sa kabuuan ng buong ekonomiya. Ang freelancer na umuunlad sa datos ay ang nagbebenta ng paghatol, pananagutan, at ang kakayahang mag-direct at mag-check ng trabaho ng makina; ang negosyong nakikinabang ay ang natututong magdelegate ng routine at susuriin ito, at nagpapanatili ng isang tao sa lahat ng bagay na hindi na maibabalik. Hindi nawawalan ang merkado ng isang panig ng transaksyon. Muli itong inaayos sa palibot ng paglipat sa pagitan nila, at ang mga platform na nagpapadali sa paglipat na iyon ang pinapaboran ng ebidensya.

Mga Madalas Itanong

Pinapalitan Ba ng mga AI Agent ang mga Freelancer?

Hindi bilang isang kategorya. Ipinapakita ng pinakamahusay na ebidensya mula 2022 hanggang 2026 na pinapalitan ng AI ang mga tiyak na gawain, pangunahin ang routine na pagsulat, pagsasalin, paggawa ng imahe, at simpleng coding, kung saan bumaba ang mga job posting nang humigit-kumulang isang-ikalima kumpara sa manual work sa loob ng ilang buwan mula sa ChatGPT. Tumaas ang demand para sa komplikadong trabaho sa parehong mga kategorya kapwa sa bayad at sa kompetisyon, at walang ipinapakitang economy-wide na displacement ang pambansang datos. Ang pinaka-malinaw na natalo ay ang mga manggagawang entry-level sa mga nalantad na trabaho, hindi ang mga eksperyensadong freelancer.

Aling mga Freelance na Trabaho ang Pinaka-Apektado ng AI?

Pagsulat, pagsasalin, content editing, paggawa ng imahe at disenyo, at routine na coding. Natagpuan ng mga pag-aaral sa Upwork at ibang platform na nawalan ng posting ang mga kategoryang ito at bumaba ang kahalagahan ng mga kredensyal habang tumaas ang kahalagahan ng presyo kapag kumukuha ang mga kliyente. Ang trabahong pisikal, lokal, nakabatay sa relasyon, o may dalang pananagutan para sa resulta ay halos hindi pa naaapektuhan sa ngayon.

Mas Mura Bang Gumamit ng AI Agent Kaysa Kumuha ng Freelancer?

Para sa routine at nasusuring trabaho, karaniwan nang oo, ngunit mas mababa kaysa sa iminumungkahi ng mga headline na paghahambing. Natagpuan ng GDPval evaluation ng OpenAI na gumagawa ang mga modelo ng propesyonal na output nang halos siyamnapung beses na mas mabilis sa hilaw na termino, ngunit kapag isinama na ang pagsusuri at pagwawasto ng tao, bumababa ang matitipid sa mga 12% hanggang 39%. Kung walang sinuman sa negosyo ang makakasuri sa output, ang makatotohanang opsyon ay hayaang gawin ng agent ang trabaho at susuriin ito ng isang eksperto na tao.

Anong Trabaho ang Dapat Pa Ring Ibigay ng Isang Maliit na Negosyo sa Isang Tao?

Anumang hindi na maibabalik, emosyonal, pisikal, o may pananagutan: mga pagbabayad at pagbura, mga galit na customer, mga on-site na trabaho, at mga resultang dapat sagutin ng isang tao. Natagpuan ng isang 2026 field experiment sa Alibaba na mas mabilis ngunit mas mababa ang rating ng mga chat ng serbisyong hinawakan ng agent, at mas mahusay na iniligtas ng human intervention ang mga teknikal na kabiguan kaysa sa mga emosyonal. Pinagsasama ng mga platform tulad ng Jobbit ang isang agent para sa mga digital na gawain sa isang human network para sa mismong natitirang bahaging ito.

Bakit Hindi Magkatugma ang mga Pag-aaral Tungkol sa AI at mga Trabaho?

Karamihan sa kanila ay sumusukat ng magkakaibang bagay. Sinusukat ng mga controlled experiment kung ano ang kayang gawin ng AI sa mga piling gawain at nakakakita ng malalaking pakinabang; sinusukat ng platform data ang demand para sa mga tiyak na kategorya ng gawain at nakakakita ng matatalim na lokal na pagbaba; sinusukat ng payroll at administrative data ang economy-wide na employment at kita at kaunti pa lamang ang nakikitang pagbabago sa ngayon. Nagiging magkatugma ang larawan kapag magkasamang binasa ang pagpapalit sa antas ng gawain, hindi pantay na pagpapalakas, at mabagal na pangkalahatang pagsasaayos.

Related guides