Preparing your workspace
Jobbit
Case Studies23 min read

Чи замінюють ШІ-агенти фрилансерів? Що показують 4 роки доказів (ChatGPT, Claude, Upwork, Jobbit)

Що чотири роки доказів говорять про ШІ-агентів і фриланс-роботу: які завдання були заміщені, де люди досі перемагають і як бізнесу розподіляти роботу між агентами та людьми.

Чи замінюють ШІ-агенти фрилансерів? Що показують 4 роки доказів (ChatGPT, Claude, Upwork, Jobbit)
Read in:

Кожен власник бізнесу зараз ставить варіант одного й того самого питання: яку роботу можна доручити ШІ-агенту, а яка досі потребує людини? Нарешті, для цього питання є лабораторія. З кінця 2022 року онлайн-платформи для фрилансу, на яких працюють мільйони письменників, перекладачів, дизайнерів і розробників, також стали майданчиком природного експерименту: що відбувається, коли здатна заміна рутинній інтелектуальній роботі з'являється за одну ніч, за майже нульової граничної вартості, на ринку, де кожне завдання публікується, оцінюється і фіксується за часом.

Це дослідження розглядає цей експеримент так, як науковець розглядав би будь-який інший масив доказів: що саме вимірювалося, наскільки добре, що показують результати і чого вони поки не можуть показати. Воно спирається на рецензовані дослідження та робочі публікації науковців зі Stanford, MIT, Harvard Business School, University of Chicago та UCLA, на рандомізовані польові експерименти всередині BCG та Alibaba, на оцінки можливостей від METR та OpenAI, а також на власні дані платформ Upwork і Fiverr. Період охоплює час від листопада 2022 року, коли вийшов ChatGPT, до серпня 2026 року, коли було оновлено найновіше з цих досліджень.

Коротка відповідь на питання в заголовку: наразі агенти заміщують завдання, а не фрилансерів, і це заміщення було вузьким, швидким і нерівномірним. Довга відповідь корисніша, бо вона показує бізнесу, де саме зараз проходить межа і як працювати по обидва її боки.

Підсумок висновків

П'ять висновків витримують скептичне прочитання доказів.

Перше: заміщення реальне і зосереджене. Протягом восьми місяців після виходу ChatGPT кількість оголошень щодо схильної до автоматизації роботи з текстом і кодом на провідній глобальній платформі впала приблизно на 21% відносно роботи, що вимагає ручної праці, а інструменти генерації зображень скоротили кількість оголошень щодо роботи із зображеннями приблизно на 17%. На Upwork кваліфікація та репутація стали вимірювано менш прогностичними щодо того, кого наймають у категоріях, вразливих до ШІ, тоді як ціна стала прогностичнішою.

Друге: вплив на ширший ринок праці залишається малим. Найточніше дослідження, засноване на данських адміністративних даних, виключає вплив на заробітки чи години роботи, більший за 2%, через два роки після появи ChatGPT. Виняток різкий: у Сполучених Штатах зайнятість працівників віком від 22 до 25 років у професіях, найбільш вразливих до ШІ, зараз приблизно на 19% нижча, ніж була б, якби вона трималася темпу менш вразливих однолітків.

Третє: приріст продуктивності від роботи зі ШІ великий, але нерівномірний. Він найбільший для менш досвідчених працівників на рутинних завданнях і може ставати від'ємним для експертів на завданнях поза межами компетенції інструменту. В одному ретельному дослідженні досвідчені розробники працювали зі ШІ-інструментами на 19% повільніше, вважаючи при цьому, що вони на 20% швидші.

Четверте: агенти перейшли від асистентів до виконавців. Тривалість завдання, яке здатна виконати передова система, подвоюється кожні кілька місяців, і сліпі експертні оцінювачі тепер визнають результати роботи найкращих моделей рівними або кращими за результати професіонала майже в половині випадків. Але щойно врахувати час на перевірку і виправлення, виміряна економія падає приблизно з дев'яностократної до значення від 12% до 39%, і навіть найкращі робочі агенти досі час від часу припускаються дрібних помилок з незворотними наслідками.

П'яте: раціональна відповідь, до якої сходяться платформи, це розподіл праці: агенти для рутинної, придатної до перевірки цифрової роботи; люди для суджень, відповідальності, присутності та всього незворотного; і свідома передача роботи між ними.

Аргумент: чому фриланс-платформи є правильною лабораторією

Економісти праці зазвичай працюють із щорічними опитуваннями та широкими кодами професій. Онлайн-платформи для фрилансу пропонують дещо рідкісніше: роботу, розбиту на окремі завдання, кожне з яких має дату публікації, ціну, категорію, покупця, продавця і результат. Коли з'являється технологія, здатна виконувати частину цих завдань, зміна проявляється протягом кількох тижнів у потоці оголошень, у тому, хто отримує контракт і за якою ставкою. Ринок також миттєво впроваджує нові інструменти, бо між фрилансером і вкладкою браузера немає циклу закупівель.

Ті самі риси роблять цю лабораторію недосконалою. Платформи фіксують опублікований попит, а не весь попит; клієнт, який тепер виконує роботу власними силами за допомогою агента, зникає з даних, а не з'являється в них як заміщення. Категорії змінюються, тож спад у категорії «письмо» може частково бути перейменуванням у «редагування контенту за допомогою ШІ». Більшість великих наборів даних американські, і фрилансери на платформах не є репрезентативними для всієї робочої сили. Ці обмеження важливі для інтерпретації, і до них ще повернемося нижче, але вони не роблять докази марними. Вони роблять їх випереджальним індикатором, а не переписом населення.

Ставки тут немалі. IPSE оцінює кількість фрилансерів у Великій Британії приблизно в 2.05 мільйона осіб, тобто приблизно половину від 4.2 мільйона самозайнятих одноосібників країни, використовуючи визначення, обмежене трьома найбільш кваліфікованими групами професій. Це саме ті професії, які дослідження застосовності ШІ ставлять на найвищі позиції.

Хронологія доказів, від 2022 до 2026 року

РікДослідженняУмови та дизайнГоловний висновок
від 2023 до 2024Hui, Reshef and Zhou, Organization ScienceВелика фриланс-платформа, метод difference-in-differences навколо ChatGPT та моделей генерації зображеньВразливі фрилансери втратили і роботу, і заробіток; висока репутація в минулому їх не захистила
2023Dell'Acqua and colleagues, Harvard Business School with BCGРандомізоване дослідження, 758 консультантів, GPT-4У межах компетенції інструменту: на 12.2% більше завдань, на 25.1% швидше, якість на 40% вища. Поза межами: ймовірність правильної відповіді нижча на 19 пунктів
від 2024 до 2025Demirci, Hannane and Zhu, Management ScienceПровідна глобальна платформа, оголошення про роботуОголошення щодо схильної до автоматизації роботи з текстом і кодом впали на 21% протягом восьми місяців; оголошення щодо зображень впали на 17%
2025Brynjolfsson, Li and Raymond, Quarterly Journal of Economics5,179 операторів служби підтримки, поетапне впровадженняПродуктивність зросла в середньому на 14%, на 34% для новачків, і мало для експертів
2025Humlum and Vestergaard, NBER, оновлено 2026Данія, опитування щодо впровадження, пов'язані з адміністративними данимиВплив на заробіток і години роботи в межах 2% через два роки; натомість реорганізувалася сама робота
2025METRРандомізоване дослідження, 16 досвідчених розробників, 246 реальних завданьНа 19% повільніше зі ШІ-інструментами; учасники вважали, що вони на 20% швидші
2025OpenAI, GDPval44 професії, сліпе експертне оцінюванняРезультати найкращої моделі перемагають або мають нічию в 47.6% випадків; економія падає до значення від 12% до 39%, якщо врахувати час на перевірку
від 2025 до 2026Brynjolfsson, Chandar and Chen, StanfordДані ADP щодо заробітної плати до червня 2026Працівники віком від 22 до 25 років у вразливих професіях відстають від однолітків на 19%; витіснення в масштабах економіки не виявлено
2026Siddiq and Zhang, UCLA2.26 мільйона контрактів Upwork, від 2021 до 2026Кваліфікація і репутація на 7.8% менш прогностичні щодо найму у вразливих категоріях; ціна стала прогностичнішою
2026Wang and colleagues, AlibabaРандомізований польовий експеримент, агентний ШІ під наглядом людейКоротші чати, але нижчі оцінки, коли їх вів агент; люди рятували технічні збої краще, ніж емоційні
2026Styles and Miller, WorkBench revisitedБенчмарк робочих агентів, 2024 проти 2026Виконання завдань зросло з 43% до 98%; шкідливі дії скоротилися з 26% до 1.9%, але не до нуля
2026Upwork, Future Workforce IndexОпитування 2,400 кваліфікованих працівників США плюс дані платформиРобота зі ШІ оплачується на 34% більше за годину; проста генеративна робота оплачується на 13% менше за контракт, ніж рік тому

Висновок 1: заміщення реальне, швидке і вузьке

Найперші ретельні докази надали Xiang Hui, Oren Reshef і Luofeng Zhou, чиє дослідження великої онлайн-платформи праці було опубліковане в Organization Science у 2024 році і пізніше отримало премію Olin Award Вашингтонського університету за дослідження з практичним впливом. Порівнюючи фрилансерів у професіях, вразливих до ChatGPT, DALL-E 2 та Midjourney, з фрилансерами в менш вразливих професіях, вони виявили спад як кількості замовлень, так і місячного заробітку для вразливої групи. Висновок, що стривожив галузь, стосувався якості. Фрилансери з високими оцінками в минулому і тривалою історією роботи не були захищені; якщо вже на те пішло, автори наводять непрямі докази того, що найкращих виконавців це вдарило сильніше. Найправдоподібніше пояснення в тому, що в рутинній роботі з текстом і зображеннями чудовий результат людини і прийнятний результат машини стали в очах покупців близькими замінниками, тож премія за досконалість розмилася першою.

Ozge Demirci, Jonas Hannane і Xinrong Zhu потім виміряли бік попиту напряму. Використовуючи оголошення з провідної глобальної фриланс-платформи, у статті опублікованій в Management Science у 2025 році, вони виявили падіння на 21% кількості оголошень щодо схильної до автоматизації роботи з текстом і кодом відносно роботи, що вимагає ручної праці, протягом восьми місяців після виходу ChatGPT, а також падіння на 17% оголошень щодо створення зображень після появи моделей генерації зображень. Два другорядні результати важливі не менше за головний. Оголошення, що залишилися у вразливих категоріях, стали складнішими і оплачувалися краще, а конкуренція за них посилилася. Іншими словами, заміщення не спорожнило категорію; воно прибрало її нижню частину.

Чому саме письмо, переклад і робота із зображеннями постраждали першими? Аналіз Microsoft Research 200 000 знеособлених розмов Bing Copilot, опублікований у 2025 році, надає механізму форму. Професії з найвищою застосовністю ШІ виявилися тими, чия робота полягає у зборі, створенні та передачі інформації; усні та письмові перекладачі очолили список: 98% їхньої робочої діяльності перетиналося із завданнями, які асистент уже виконував добре. Застосовність це не витіснення, і автори обережно це наголошують, але цей рейтинг майже точно передбачає, які категорії фрилансу, за даними досліджень платформ, скорочувалися.

Найновіші й, для читача-бізнесмена, найповчальніші докази надають Auyon Siddiq і Niuniu Zhang з UCLA Anderson. Їхня робоча публікація 2026 року, "Human Capital, AI, and Labor Commoditization" («Людський капітал, ШІ та комодитизація праці»), простежує майже 50 000 фрилансерів Upwork, які були активні до ChatGPT, протягом 21 кварталу від початку 2021 до початку 2026 року, охоплюючи 2.26 мільйона завершених контрактів. Замість підрахунку замовлень вони запитують, що передбачає те, кого наймають. У категоріях з вищою вразливістю до ШІ, таких як переклад і письмо, сукупна прогностична вага самопрезентації, кваліфікації та репутації фрилансера впала приблизно на 7.8% відносно менш вразливих категорій, таких як фотографія, а вага ціни зросла. До останнього року показники людського капіталу втратили приблизно 10.1% своєї значущості, а ціна набрала приблизно 1.8%. Перевага, яку мали досвідчені фрилансери, звузилася на 6.2%, а потім на 10.3%, і в найбільш вразливій роботі дешевші фрилансери вигравали на 7.9% більше контрактів. Загальний попит у вразливих сферах впав приблизно на 7%. Автори називають це комодитизацією: коли покупець може отримати прийнятний перший чернетковий варіант від моделі, те, за що він платитиме людині, зміщується від «хто ти» до «скільки».

Висновок 2: сукупний ефект досі малий, з одним гучним винятком

Якби докази з платформ були всією історією, національна статистика вже мала б це показувати. Здебільшого вона цього не показує, і дослідження, які не знаходять великих ефектів, належать до найкраще спроєктованих.

Anders Humlum і Emilie Vestergaard пов'язали масштабні опитування щодо впровадження з данськими адміністративними даними про працю, охопивши 25 000 працівників і 7 000 робочих місць в одинадцяти вразливих професіях. Їхня робоча публікація NBER, вперше поширена у 2025 році і переглянута в березні 2026 року, документує швидке впровадження: більшість роботодавців у вразливих професіях запустили ініціативи з чат-ботами, працівники повідомляли про переваги для продуктивності, а нові завдання, пов'язані зі ШІ, стали поширеними. Проте оцінки методом difference-in-differences щодо заробітку та зафіксованих годин роботи виявилися точними нулями, виключаючи ефекти, більші за 2%, через два роки після появи ChatGPT, як на рівні працівника, так і на рівні робочого місця. Змінилася структура роботи: роботодавці засвоювали технологію через реорганізацію завдань, зокрема нові завдання зі створення контенту, нагляду за ШІ та інтеграції ШІ, а ті, хто впроваджував ШІ, поступово переходили у краще оплачувані професії, де інструменти корисніші, хоча в кількостях, надто малих, щоб змістити середні показники. Рання версія публікації оцінювала самозвітну економію часу менш ніж у 3% робочих годин, що є лише часткою приросту, часто понад 15%, задокументованого контрольованими дослідженнями в тих самих професіях. Розрив між тим, що ШІ може зробити в дослідженні, і тим, що він змінює у відомості про зарплату, є центральною загадкою цієї літератури, і саме в Данії її виміряно найчистіше.

Budget Lab у Yale доходить схожого висновку для Сполучених Штатів іншим шляхом. Відстежуючи професійну структуру зайнятості і застосовуючи метод synthetic difference-in-differences до професій, вразливих до ШІ, його оновлення за 2025 та 2026 роки не виявляють чіткого сліду ШІ. Початок 2026 року показує низький рівень звільнень, але й низький рівень найму, і автори стверджують, що для технології з широким впливом слід було б очікувати довшого терміну, ніж приблизно три роки з моменту появи ChatGPT, щоб цей вплив проявився.

Виняток задокументували Erik Brynjolfsson, Bharat Chandar і Ruyu Chen з Digital Economy Lab при Stanford, чия стаття "Canaries in the Coal Mine?" («Канарки в вугільній шахті?») використовує дані ADP про заробітну плату, що охоплюють мільйони американських працівників. У її оновленні за серпень 2026 року, з даними до червня 2026 року, зайнятість працівників віком від 22 до 25 років у професіях з високою вразливістю до ШІ була приблизно на 19% нижчою, ніж вона була б, якби відповідала працівникам такого ж віку в менш вразливих професіях, порівняно з розривом у 15% роком раніше. У абсолютних показниках зайнятість цієї вікової групи у двох найбільш вразливих квінтилях впала приблизно на 11% між листопадом 2022 і червнем 2026 року, тоді як зайнятість у трьох найменш вразливих квінтилях зросла приблизно на 10%. Досвідчені працівники не показують порівнянного розриву, і автори прямо заявляють, що не бачать масового витіснення в масштабах економіки. Спади зосереджені в професіях, де використання ШІ автоматизує роботу, а не доповнює її.

Ці результати узгоджуються між собою, щойно перестати очікувати, що ШІ поводитиметься як рецесія. Заміщення на рівні завдань з'являється першим там, де контракти найкоротші і найчастіше переоцінюються: фриланс-підробітки і найм на початкові позиції. Ринок фрилансу це канарка, бо він переоцінюється щотижня; відомість про зарплату це шахта, і повітря в ній поки що змінилося найменше.

Висновок 3: приріст від доповнення великий, але нерівномірний, а межа нерівна

Протилежністю заміщення є доповнення, і тут експериментальні докази незвично переконливі, бо можлива рандомізація.

Brynjolfsson, Danielle Li і Lindsey Raymond дослідили поетапне впровадження генеративного ШІ-асистента для 5,179 операторів служби підтримки, у статті опублікованій в Quarterly Journal of Economics у 2025 році. Кількість вирішених звернень за годину зросла в середньому на 14%, з приростом на 34% для новачків і менш кваліфікованих операторів і майже без змін для досвідчених, високваліфікованих. Схоже, інструмент фіксував практики найкращих операторів і передавав їх новачкам, швидше просуваючи їх кривою досвіду.

Fabrizio Dell'Acqua з колегами з Harvard Business School, у співпраці з BCG, рандомізували 758 консультантів з менеджменту на реалістичних завданнях з GPT-4 і без нього, у дослідженні, нині опублікованому в Organization Science. На вісімнадцяти завданнях у межах компетенції моделі консультанти зі ШІ виконали на 12.2% більше завдань, на 25.1% швидше, а якість сліпі оцінювачі оцінили на 40% вищою. На завданні, свідомо обраному так, щоб лежати поза цією компетенцією, консультанти зі ШІ на 19 відсоткових пунктів рідше доходили до правильної відповіді. Фраза авторів для цієї межі, нерівна технологічна межа (the jagged technological frontier), стала стандартним описом проблеми: компетенція інструменту не проходить по лініях, які користувач може побачити, а користувачі погано визначають, по який бік лінії вони перебувають.

Польовий експеримент всередині служби підтримки клієнтів Alibaba, проведений Xiao Ni, Tianjun Feng, Lauren Xiaoyuan Lu та співавторами, відтворив цю розподільну закономірність у масштабі: 5,940 нових операторів, приблизно 2.56 мільйона чатів, 390,000 оцінок клієнтів. Слабші виконавці покращилися найбільше і за швидкістю, і за якістю; найкращі виконавці отримали мало приросту швидкості і втратили якість за суб'єктивними й об'єктивними показниками. Допомога, що піднімає підлогу, може опустити стелю.

Далі є рандомізоване дослідження METR досвідчених розробників відкритого коду, опубліковане в липні 2025 року, яке є найбільш цитованим застережливим результатом цього періоду і заслуговує точного викладу. Шістнадцять розробників виконали 246 реальних завдань у репозиторіях, які вони підтримують, у середньому з понад 22,000 зірок і мільйоном рядків коду, причому завдання випадково або дозволяли, або забороняли використання ШІ-інструментів, переважно Cursor з Claude 3.5 і 3.7 Sonnet. Зі ШІ вони витрачали на 19% більше часу. До дослідження вони прогнозували прискорення на 24%; після нього вони оцінили, що були на 20% швидшими. Розрив у сприйнятті настільки ж важливий, як і результат щодо продуктивності. Він свідчить, що самозвітний приріст, на якому засновані більшість галузевих опитувань, зміщений у бік завищення саме там, де експертиза найвища. Наслідки конкретно для роботи в розробці програмного забезпечення розглядаються в статті чи замінить ШІ розробників програмного забезпечення?

Огляд 2025 року авторства R. Maria del Rio-Chanona, Ekkehard Ernst, Rossana Merola, Daniel Samaan і Ole Teutloff зводить ці напрямки докупи за всією літературою: приріст продуктивності приблизно від 20% до 60% у контрольованих дослідженнях і від 15% до 30% у польових експериментах, більший для новачків на простих завданнях, змішаний на складних завданнях, причому дані цифрових слідів показують заміщення в письмі та перекладі поряд зі зростанням попиту на навички роботи зі ШІ і слабкими, але зростаючими доказами зниження попиту на новачків.

Висновок 4: агенти перейшли від асистента до виконавця, і розрив у надійності це вся суть історії

Усе сказане вище стосується ШІ як асистента людини, яка залишається залученою на кожному кроці. Зміна, що відбулася з 2025 року, полягає в тому, що системи тепер виконують багатоетапну роботу, а людина перевіряє результат лише наприкінці, або не перевіряє взагалі, і це змінює, які докази мають значення.

Показник часового горизонту METR визначає, наскільки довге завдання, виражене в часі, який знадобився б людині-професіоналу, система може виконати з імовірністю успіху 50%. У перегляді методології в січні 2026 року, з набором, розширеним до 228 завдань, включно з 31 завданням тривалістю вісім годин або більше, довгостроковий час подвоєння оцінили приблизно в 196 днів, зі швидшим подвоєнням у 131 день з 2023 року і 89 днів з 2024 року. Найкраща виміряна на той момент модель, Claude Opus 4.5, мала 50-відсотковий горизонт приблизно 320 хвилин, з широким довірчим інтервалом приблизно від трьох до дванадцяти годин. Автори прямо зазначають, що поріг успіху в 50% є поблажливим для реальної роботи, що тенденція чутлива до складу завдань, і що більшість довгих завдань використовують оцінений, а не виміряний людський час. З урахуванням цих застережень напрямок однозначний: тривалість цифрової роботи, яку можна делегувати, зростає експоненційно.

Оцінювання GDPval від OpenAI, випущене наприкінці 2025 року, перевіряє, чи справді якісна ця делегована робота. Завдання були написані професіоналами в 44 професіях у дев'яти секторах, у середньому з 14-річним досвідом, і оцінені сліпим експертним попарним порівнянням з результатом роботи людини. Найкраща модель, Claude Opus 4.1, видавала результати, оцінені як кращі за або рівні результату експерта в 47.6% випадків. Число, яке бізнесу варто запам'ятати, інше. Наївне порівняння машинного часу з людським дає співвідношення близько дев'яностократного, але щойно стаття враховує перевірку людиною і, за потреби, переробку роботи, оцінена економія падає до значення від 1.12 до 1.39 раза, залежно від стратегії. Саме на перевірку пішла вартість. Це той самий механізм, який Dell'Acqua виявив у консультантів, а METR у розробників, тепер виміряний на рівні готового результату.

Бенчмарки робочого середовища показують і швидкість прогресу, і залишок проблем. TheAgentCompany, розроблений у Carnegie Mellon, помістив агентів у симульовану software-компанію з реальними інстансами GitLab, OwnCloud, Plane і RocketChat та 175 завданнями; найкращий агент виконав близько чверті з них на старті наприкінці 2024 року і близько 30% протягом 2025 року. Olly Styles і Sam Miller переглянули свій бенчмарк WorkBench у червні 2026 року і повідомили, що показник виконання завдань найкращим агентом зріс з 43% для GPT-4 у березні 2024 року до 98% для Claude Fable 5, тоді як частка запусків з ненавмисними шкідливими діями впала з 26% до 1.9%. Вони також повідомляють, що передові моделі досі припускаються базових помилок, які інколи спричиняють незворотну шкоду. Два відсотки це дуже добре; але це також приблизно один запуск з п'ятдесяти, в якому відбувається щось, чого не мало б відбуватися.

Польовий експеримент Alibaba 2026 року, проведений Yiwei Wang, Chuan Zhu, Tianjun Feng, Lauren Xiaoyuan Lu і Bingxin Jia, є першим рандомізованим доказом щодо агентного ШІ з людьми в циклі в реальній сервісній операції. Працівники з дослідної групи наглядали за агентом, який обробляв прийнятні чати клієнтів, поки вони вручну опрацьовували решту. Середня тривалість чату скоротилася з обмеженим впливом на повернення клієнтів з тією самою проблемою, але чати, які вів агент, отримали суттєво нижчі оцінки. Втручання людини рятувало ситуацію значно краще, коли збій був технічним, тобто нерозв'язаною проблемою, ніж коли він був емоційним, тобто засмученим клієнтом, і найкраще спрацьовувало, коли відбувалося рано. Працівники, що наглядали, також приділяли більше уваги чатам, які вони досі вели самостійно, це позитивний побічний ефект. Це наразі найпряміший доказ того, як слід проєктувати передачу роботи між агентом і людиною: спостерігати рано, втручатися щодо фактів і не залишати почуття машині.

Дані щодо впровадження підтверджують, що зсув не обмежується лабораторіями. Economic Index Anthropic за березень 2026 року повідомляє, що в 49% професій щонайменше чверть завдань виконувалася за допомогою Claude, і що робота з кодом мігрувала від розмовного використання до автоматизованих робочих процесів через API, при цьому частка коду зросла на 14% в API і впала на 18% у чат-продукті з серпня 2025 року. Внесок Lightcast до Stanford AI Index 2026 року виявляє навички роботи зі ШІ в 2.5% усіх оголошень про роботу в США, а оголошення, що згадують кластер навичок «агентного ШІ», зросли з 0.06% у 2024 році до 0.23% у 2025 році, приблизно 90,000 оголошень. А UpBench, бенчмарк 2025 року, побудований на реальних завершених замовленнях на маркетплейсі Upwork, змушує експертних фрилансерів розкладати кожне замовлення на перевірювані критерії прийняття, за якими потім оцінюють агентів. Оцінювання агентів за тим же критерієм, який клієнт застосував би до фрилансера, це сигнал того, куди рухається бік пропозиції.

Механізми: чому картина виглядає саме так

Чотири механізми пояснюють більшу частину того, що показують докази, і їх варто назвати, бо вони передбачають, що станеться далі.

Перший це комодитизація рутинної компетенції. Коли модель видає прийнятний чернетковий варіант опису товару, перекладу чи шаблонного модуля, готовність покупця платити за кваліфікацію людини в цій категорії падає, і ціна стає вирішальною змінною. Siddiq і Zhang вимірюють саме цей зсув, а Demirci з колегами показують його дзеркальне відображення: робота, що залишається людською, стає складнішою, краще оплачуваною і більш конкурентною.

Другий це вартість перевірки як обмежувальний фактор. Виробництво стало дешевим; перевірка ні. Падіння показника GDPval з дев'яностократного до менш ніж 1.4-кратного, щойно врахувати перевірку, уповільнені експерти в METR і нерівна межа, все це описує ту саму економіку. Хто може дешево перевірити результат, той отримує вигоду; хто не може, той платить за це переробкою або непоміченою помилкою. Саме тому приріст дістається новачкам на завданнях з простою перевіркою і застоюється для експертів на завданнях, де перевірка коштує стільки ж, скільки й виконання.

Третій це розрив у навчанні через учнівство (apprenticeship gap). Завдання, які агент виконує добре, це саме ті завдання, які фірми раніше давали молодшому персоналу і молодшим фрилансерам, щоб ті вчилися. Brynjolfsson, Li і Raymond показують, що допомога найбільше допомагає новачкам; Brynjolfsson, Chandar і Chen показують, що фірми попри це наймають менше новачків. Обидва твердження можуть бути правдою: фірма, якій потрібно менше молодших співробітників для того самого обсягу продукції, наймає менше молодших співробітників, навіть якщо кожен з них продуктивніший. Довгостроковий наслідок, тонший потік досвідчених людей, ще не видно в жодному наборі даних, і це найважливіша невиміряна змінна в цій сфері.

Четвертий це стійкість завдань, що доповнюють людину. Контрольна група роботи, що вимагає ручної праці, у Demirci не скоротилася. Експеримент Alibaba показує, що емоційні збої погано піддаються машинному відновленню. Відповідальність, присутність, фізична робота і стосунки залишаються людськими не через можливості моделі, а через те, що готовий прийняти клієнт.

Скептичному читачеві варто тримати в голові два альтернативні пояснення поряд із цими. Спад найму на початкові позиції в Сполучених Штатах збігається з вищими відсотковими ставками і згортанням пандемійного найму в технологічному секторі, що незалежно вдарило по тій самій когорті; автори зі Stanford враховують це через порівняння всередині фірм і зіставлення професій, де ШІ автоматизує, з тими, де він доповнює, але цей супутній фактор неможливо повністю виключити. І кожен показник «вразливості» сам є похідним від моделі, тож дослідження частково перевіряють припущення класифікатора. Данські інститути колективних переговорів також можуть притлумлювати реакцію заробітної плати, яка проявилася б швидше на менш зарегульованому ринку праці.

Як відповіли платформи

Маркетплейси зчитали ті самі сигнали і відреагували. У квітні 2025 року генеральний директор Fiverr Micha Kaufman написав співробітникам, що «ШІ йде за вашими робочими місцями», включно з його власним, і закликав їх опанувати такі інструменти, як Cursor і Legora; у вересні 2025 року компанія скоротила близько 250 посад, майже 30% свого штату, щоб стати тим, що вона назвала AI-first компанією, запустивши свої інструменти для творців Fiverr Go того лютого. Upwork перетворює свого асистента Uma на те, що описує як завжди активного робочого агента, який виконує дії від імені клієнтів і фрилансерів, а її Future Workforce Index за 2026 рік переосмислює успішного фрилансера як «ШІ-оркестратора», який поєднує інструменти з експертизою в галузі і застосовує судження. Той самий звіт дає ціновий сигнал в одному рядку: фрилансери, що виконують роботу зі ШІ, заробляли на 34% більше за годину, ніж ті, хто цього не робив, складна робота, доповнена ШІ, показала зростання заробітку на 45% рік до року, тоді як генеративна ШІ-робота і креативне виробництво зросли на 90% за кількістю нових контрактів, а заробіток за контракт впав на 13%. Обсяг змістився до простого кінця; гроші змістилися до складного кінця.

Jobbit, платформа, на якій опубліковано це дослідження, була спроєктована навколо того розподілу праці, на який вказують докази, а не навколо якогось одного його боку. Агент бере на себе придатну до перевірки цифрову роботу: створення і розгортання сайту чи веб-застосунку, підготовку документів і презентацій, проведення досліджень, налаштування автоматизацій, генерацію зображень і відео. Користувач може спостерігати за його роботою в браузері агента і взяти керування в будь-який момент, а це саме та модель раннього втручання, яку експеримент Alibaba визнав найефективнішою. Для роботи, яку агент виконує погано або не повинен виконувати самостійно, фізичних і локальних завдань, підзвітної експертної перевірки, всього, для чого клієнту потрібна людина, платформа скеровує до модерованої мережі людей на pro.jobbit.uk. Jobbit не публікувала власних даних випробувань, і це дослідження не робить жодних тверджень про виміряні результати на ній; твердження стосується лише відповідності між дизайном платформи і доказами. Читачі, які хочуть розібратися в механіці, можуть почати зі статті що таке агентний ШІ насправді, гайду про спостереження та керування браузером агента, і практичного списку сценаріїв використання ШІ для малого бізнесу.

Що бізнесу робити з цими доказами

Ці висновки перетворюються на правило делегування, яке власник бізнесу може застосувати, не прочитавши жодної наукової статті.

Доручайте агенту роботу, яка є рутинною і придатною до перевірки: перші чернетки, резюме, дослідницькі брифи, стандартні документи, сайт чи внутрішній інструмент, який можна перевірити, клацаючи по ньому, за один вечір. Саме тут кожне дослідження знаходить найбільший приріст, особливо там, де бізнес наразі виконує завдання повільно або не виконує взагалі, бо ефект новачка стосується фірм так само, як і людей. Практичну послідовність для початку викладено в статті як автоматизувати свій бізнес за допомогою ШІ-агентів.

Тримайте людину на роботі, яка є незворотною, емоційною, фізичною або пов'язаною з відповідальністю: усе, що відправляє гроші, видаляє дані, стосується засмученого клієнта, або вимагає, щоб хтось відповідав за результат. Експеримент Alibaba і залишкові ризики WorkBench вказують у той самий бік.

Закладайте час на перевірку в розрахунки, перш ніж вирішити, що агент дешевший. Чесна арифметика GDPval, економія від 12% до 39%, а не в дев'яносто разів, це те число, з яким варто планувати. Якщо ніхто в бізнесі не може перевірити результат, економія несправжня; у такому разі рішення в тому, щоб агент виконував роботу, а людина-експерт її перевіряла, і саме за таку схему, як показують дані фрилансу, покупці вже платять премію.

Очікуйте, що межа буде нерівною і рухатиметься. Завдання, яке агент не міг виконати в січні, може стати рутинним до вересня, а зворотне невірно. Тестуйте, ведіть облік того, що було перевірено і що не спрацювало, і переглядайте розподіл щоквартально.

Робоче правило з чотирьох років доказів: делегуйте те, що рутинне і піддається перевірці, тримайте людину на тому, що незворотне або емоційне, і враховуйте час перевірки як частину ціни.

Обмеження і відкриті питання

Більшість великих наборів даних американські, а дані платформ вимірюють опублікований попит, а не всю виконану роботу. Показники вразливості є похідними від моделі, тож результати частково успадковують припущення класифікатора. Горизонти короткі: два роки в Данії, менше чотирьох у Сполучених Штатах, і зауваження авторів з Yale про те, що масштабні ефекти можуть проявитися пізніше, варте уваги. Бенчмарки це не робочі місця; завдання GDPval є самодостатніми результатами, а WorkBench це синтетичний офіс, тоді як реальна робота переривається, неоднозначна і політична. Можливості розвиваються достатньо швидко, щоб будь-яка цифра в цьому дослідженні була лише знімком моменту, і саме показники можливостей, а не показники ринку праці, найімовірніше застаріють першими. Нарешті, ефект, який матиме найбільше значення для наступного десятиліття, а саме чи погіршує тонший потік учнівства постачання досвідчених фахівців, поки що взагалі неможливо виміряти.

Висновок

Чи замінюють ШІ-агенти фрилансерів? Наразі вони заміщують завдання, і роблять це там, де результат завдання можна виробити і оцінити як рутинний. Цього виявилося достатньо, щоб скоротити ринок товарного письма, перекладу і роботи із зображеннями, послабити премію за кваліфікацію під час найму в цих категоріях і різко скоротити найм на початкові позиції у вразливих професіях, залишивши при цьому заробітки і години роботи в масштабах цілих економік практично незмінними. Фрилансер, який процвітає за даними, це той, хто продає судження, відповідальність і здатність спрямовувати і перевіряти роботу машини; бізнес, який виграє, це той, хто вчиться делегувати рутину і перевіряти її, і хто тримає людину на всьому, що неможливо скасувати. Ринок не втрачає одну зі сторін угоди. Він реорганізується навколо передачі роботи між ними, і докази на боці тих платформ, які роблять цю передачу простою.

Часті запитання

Чи замінюють ШІ-агенти фрилансерів?

Не як категорія. Найкращі докази від 2022 до 2026 року показують, що ШІ заміщує конкретні завдання, головно рутинне письмо, переклад, створення зображень і просте кодування, де кількість оголошень про роботу впала приблизно на одну п'яту відносно ручної роботи протягом місяців після появи ChatGPT. Попит на складну роботу в тих самих категоріях зріс і за оплатою, і за конкуренцією, а національні дані не показують витіснення в масштабах економіки. Найочевидніші постраждалі це працівники початкового рівня у вразливих професіях, а не досвідчені фрилансери.

Які фриланс-роботи найбільше постраждали від ШІ?

Письмо, переклад, редагування контенту, виробництво зображень і дизайну, а також рутинне кодування. Дослідження Upwork та інших платформ показують, що ці категорії втратили оголошення, а кваліфікація стала менш важливою, а ціна більш важливою під час найму клієнтами. Робота, яка є фізичною, локальною, заснованою на стосунках, або яка передбачає відповідальність за результат, поки що залишається практично незачепленою.

Чи дешевше використовувати ШІ-агента, ніж наймати фрилансера?

Для рутинної, придатної до перевірки роботи, зазвичай так, але меншою мірою, ніж припускають гучні порівняння. Оцінювання GDPval від OpenAI виявило, що моделі виробляють професійні результати приблизно в дев'яносто разів швидше в чистих показниках, але щойно врахувати перевірку і виправлення людиною, економія падає приблизно до значення від 12% до 39%. Якщо ніхто в бізнесі не може перевірити результат, реалістичний варіант це агент, який виконує роботу, і людина-експерт, яка її перевіряє.

Яку роботу малому бізнесу варто досі доручати людині?

Усе, що незворотне, емоційне, фізичне або пов'язане з відповідальністю: платежі і видалення, засмучені клієнти, робота на місці, і результати, за які хтось повинен відповідати. Польовий експеримент 2026 року в Alibaba виявив, що чати обслуговування, які вів агент, були швидшими, але отримували нижчі оцінки, і що втручання людини рятувало технічні збої значно краще, ніж емоційні. Такі платформи, як Jobbit, поєднують агента для цифрових завдань з мережею людей саме для цього залишку.

Чому дослідження не погоджуються щодо ШІ і робочих місць?

Здебільшого вони вимірюють різні речі. Контрольовані експерименти вимірюють, що ШІ може зробити на відібраних завданнях, і знаходять великий приріст; дані платформ вимірюють попит на конкретні категорії завдань і знаходять різкі локальні спади; дані про заробітну плату та адміністративні дані вимірюють зайнятість і заробітки в масштабах економіки і поки що знаходять мало змін. Картина стає узгодженою, щойно прочитати разом заміщення на рівні завдань, нерівномірне доповнення і повільне сукупне пристосування.

Related guides