Preparing your workspace
Jobbit
Case Studies23 min read

Yapay Zeka Ajanları Serbest Çalışanların Yerini Alıyor mu? 4 Yıllık Kanıt Ne Diyor (ChatGPT, Claude, Upwork, Jobbit)

Yapay zeka ajanları ve serbest çalışma hakkında dört yıllık kanıtın söyledikleri: hangi görevlerin yerini aldığı, insanların hâlâ nerede kazandığı ve bir işletmenin ajanlar ile insanlar arasında işi nasıl bölmesi gerektiği.

Yapay Zeka Ajanları Serbest Çalışanların Yerini Alıyor mu? 4 Yıllık Kanıt Ne Diyor (ChatGPT, Claude, Upwork, Jobbit)
Read in:

Her işletme sahibi artık aynı sorunun bir versiyonunu soruyor: Hangi iş bir yapay zeka ajanına devredilebilir, hangisi hâlâ bir insana ihtiyaç duyar? Bu kez sorunun bir laboratuvarı var. 2022'nin sonundan bu yana, milyonlarca yazar, çevirmen, tasarımcı ve geliştiriciye ev sahipliği yapan çevrimiçi serbest çalışma platformları, rutin bilgi işi için yetkin bir ikamenin bir gecede, neredeyse sıfır marjinal maliyetle, her işin yayınlandığı, fiyatlandırıldığı ve zaman damgası taşıdığı bir pazara girdiğinde ne olacağına dair doğal bir deneye de ev sahipliği yaptı.

Bu vaka çalışması, bu deneyi bir akademisyenin başka herhangi bir kanıt bütününe yaklaşacağı şekilde ele alıyor: tam olarak ne ölçüldü, ne kadar iyi ölçüldü, sonuçlar neyi gösteriyor ve henüz neyi gösteremiyor. Çalışma; Stanford, MIT, Harvard Business School, Chicago Üniversitesi ve UCLA'daki araştırmacıların hakemli çalışmalarına ve çalışma raporlarına, BCG ve Alibaba içindeki randomize saha deneylerine, METR ve OpenAI'nin yetkinlik değerlendirmelerine ve Upwork ile Fiverr'ın kendi platform verilerine dayanıyor. Kapsanan dönem, ChatGPT'nin yayınlandığı Kasım 2022'den, bu çalışmaların en güncelinin güncellendiği Ağustos 2026'ya kadar uzanıyor.

Başlığın kısa cevabı şu: ajanlar şimdiye kadar serbest çalışanların değil, görevlerin yerini aldı ve bu ikame dar kapsamlı, hızlı ve dengesiz oldu. Uzun cevap daha faydalı, çünkü bir işletmeye sınırın şu anda nerede durduğunu ve bu sınırın her iki tarafında nasıl çalışılacağını söylüyor.

Bulguların özeti

Kanıtların şüpheci bir okumasından beş sonuç sağlam çıkıyor.

Birincisi, ikame gerçek ve belirli alanlarda yoğunlaşmış durumda. ChatGPT'nin piyasaya sürülmesinden sonraki sekiz ay içinde, önde gelen küresel bir platformda otomasyona yatkın yazı ve kodlama işleri için ilanlar, elle yapılan yoğun işlere kıyasla yaklaşık 21% azaldı ve görsel üretim araçları görsel işi ilanlarını yaklaşık 17% düşürdü. Upwork'te, yapay zekaya maruz kalan kategorilerde kimin işe alındığını tahmin etmede referanslar ve itibarın öngörü gücü ölçülebilir şekilde azalırken, fiyatın öngörü gücü arttı.

İkincisi, daha geniş işgücü piyasası üzerindeki etki hâlâ küçük. En kesin çalışma olan, Danimarka'nın idari kayıtlarına dayanan araştırma, ChatGPT'den iki yıl sonra kazanç veya çalışma saatleri üzerinde 2%'den büyük bir etkiyi dışlıyor. İstisna ise çarpıcı: Amerika Birleşik Devletleri'nde, yapay zekaya en çok maruz kalan mesleklerde 22-25 yaş arası çalışanların istihdamı, daha az maruz kalan emsalleriyle aynı hızda ilerlemiş olsaydı bulunacağı düzeyin şu anda yaklaşık 19% altında.

Üçüncüsü, yapay zekayla çalışmanın getirdiği verimlilik kazançları büyük ama dengesiz. Bu kazançlar rutin görevlerde daha az deneyimli çalışanlar için en yüksek düzeyde ve aracın yetkinliğinin dışındaki görevlerde uzmanlar için negatife dönüşebiliyor. Titiz bir denemede, deneyimli geliştiriciler yapay zeka araçlarıyla 19% daha yavaş çalışırken kendilerinin 20% daha hızlı olduklarına inanıyorlardı.

Dördüncüsü, ajanlar asistan olmaktan çalışan olmaya geçti. Öncü bir sistemin tamamlayabildiği görevin uzunluğu birkaç ayda bir iki katına çıkıyor ve kör uzman değerlendiriciler artık en iyi modellerin çıktılarını, vakaların neredeyse yarısında bir profesyonelinkine eşit veya ondan daha iyi buluyor. Ama inceleme ve düzeltme süresi hesaba katıldığında, ölçülen tasarruf yaklaşık doksan kattan 12% ile 39% arasına düşüyor ve en iyi işyeri ajanları bile zaman zaman geri döndürülemez sonuçlara yol açan küçük hatalar yapmaya devam ediyor.

Beşincisi, rasyonel yanıt, ve platformların yakınlaştığı yanıt, bir iş bölümü: rutin ve incelenebilir dijital işler için ajanlar; muhakeme, hesap verebilirlik, fiziksel varlık ve geri döndürülemez her şey için insanlar; ve ikisi arasında bilinçli bir devir teslim.

Neden serbest çalışma platformları doğru laboratuvar

Emek ekonomistleri genellikle yıllık anketler ve geniş meslek kodlarıyla çalışır. Çevrimiçi serbest çalışma platformları daha nadir bir şey sunar: her birinin bir yayın tarihi, fiyatı, kategorisi, alıcısı, satıcısı ve sonucu olan, tek tek görevlere bölünmüş iş. Bu görevlerin bir kısmını yapabilen bir teknoloji ortaya çıktığında, değişiklik haftalar içinde ilan akışında, kimin sözleşmeyi kazandığında ve hangi ücretle kazandığında kendini gösterir. Pazar ayrıca yeni araçları anında benimser, çünkü bir serbest çalışan ile bir tarayıcı sekmesi arasında bir satın alma döngüsü yoktur.

Aynı özellikler laboratuvarı kusurlu hale de getiriyor. Platformlar tüm talebi değil, yayınlanan talebi kaydeder; artık işi bir ajanla kendi bünyesinde yapan bir müşteri, bir ikame olarak görünmek yerine veriden tamamen kaybolur. Kategoriler kayabilir, bu yüzden "yazı" alanındaki bir düşüş kısmen "yapay zeka içerik düzenleme" olarak yeniden etiketlenme olabilir. Büyük veri kümelerinin çoğu Amerikan kaynaklıdır ve platform serbest çalışanları işgücünü temsil etmez. Bu sınırlar yorum açısından önemlidir ve aşağıda tekrar ele alınacaktır, ancak kanıtları işe yaramaz hale getirmezler. Onları bir sayım değil, öncü bir gösterge yaparlar.

Bahis küçük değil. IPSE, en yüksek beceri düzeyine sahip üç meslek grubuyla sınırlı bir tanım kullanarak, Birleşik Krallık'taki serbest çalışan işgücünü yaklaşık 2.05 milyon kişi olarak tahmin ediyor; bu, ülkenin 4.2 milyon bağımsız kendi hesabına çalışanının kabaca yarısına denk geliyor. Bunlar tam olarak yapay zeka uygulanabilirlik çalışmalarının en üst sıraya koyduğu meslekler.

2022'den 2026'ya kanıtların zaman çizelgesi

YılÇalışmaOrtam ve tasarımÖne çıkan bulgu
2023-2024Hui, Reshef ve Zhou, Organization ScienceBüyük serbest çalışma platformu, ChatGPT ve görsel modeller etrafında farkların farkı analiziMaruz kalan serbest çalışanlar hem iş hem kazanç kaybetti; güçlü geçmiş performans onları korumadı
2023Dell'Acqua ve meslektaşları, BCG ile Harvard Business SchoolRandomize deneme, 758 danışman, GPT-4Aracın yetkinlik alanı içinde: 12.2% daha fazla görev, 25.1% daha hızlı, 40% daha yüksek kalite. Dışında: doğru olma olasılığı 19 puan daha düşük
2024-2025Demirci, Hannane ve Zhu, Management ScienceÖnde gelen küresel platform, iş ilanlarıOtomasyona yatkın yazı ve kodlama ilanları sekiz ay içinde 21% düştü; görsel ilanları 17% düştü
2025Brynjolfsson, Li ve Raymond, Quarterly Journal of Economics5,179 müşteri destek temsilcisi, kademeli devreye almaVerimlilik ortalama 14% arttı, yeni başlayanlarda 34%, uzmanlarda çok az
2025Humlum ve Vestergaard, NBER, 2026'da revize edildiDanimarka, idari kayıtlarla ilişkilendirilmiş benimseme anketleriİki yıl sonra kazanç ve saat etkileri 2% sınırları içinde; bunun yerine iş yeniden yapılandırıldı
2025METRRandomize deneme, 16 deneyimli geliştirici, 246 gerçek görevYapay zeka araçlarıyla 19% daha yavaş; katılımcılar 20% daha hızlı olduklarına inanıyordu
2025OpenAI, GDPval44 meslek, kör uzman değerlendirmesiEn iyi modelin çıktıları vakaların 47.6%'sında kazanıyor veya berabere kalıyor; inceleme süresi hesaba katıldığında tasarruf 12% ile 39% arasına düşüyor
2025-2026Brynjolfsson, Chandar ve Chen, StanfordHaziran 2026'ya kadar ADP bordro kayıtlarıMaruz kalan mesleklerdeki 22-25 yaş çalışanlar emsallerinin 19% gerisinde; ekonomi genelinde yer değiştirme yok
2026Siddiq ve Zhang, UCLA2.26 milyon Upwork sözleşmesi, 2021-2026Maruz kalan kategorilerde referans ve itibarın işe alımı öngörme gücü 7.8% azaldı; fiyatın öngörü gücü arttı
2026Wang ve meslektaşları, AlibabaRandomize saha deneyi, insan gözetimli ajan tipi yapay zekaSohbetler daha kısaydı ama ajanın yönettiği sohbetlerde puanlar daha düşüktü; insanlar teknik hataları duygusal olanlardan daha iyi telafi etti
2026Styles ve Miller, WorkBench revisitedİşyeri ajanı karşılaştırma testi, 2024'e karşı 2026Görev tamamlama 43%'ten 98%'e çıktı; zararlı eylemler 26%'dan 1.9%'a düştü, sıfır değil
2026Upwork, Future Workforce Index2,400 ABD'li vasıflı çalışanın anketi artı platform verileriYapay zeka işi saatte 34% daha fazla kazandırıyor; basit üretken iş, bir yıl öncesine göre sözleşme başına 13% daha az kazandırıyor

Bulgu 1: İkame gerçek, hızlı ve dar kapsamlı

En erken titiz kanıt, Xiang Hui, Oren Reshef ve Luofeng Zhou'dan geldi. Üçlünün büyük bir çevrimiçi emek platformu üzerine çalışması, 2024'te Organization Science'ta yayımlandı ve daha sonra Washington University'nin pratik etkisi olan araştırmalara verdiği Olin Ödülü'nü kazandı. ChatGPT, DALL-E 2 ve Midjourney'e maruz kalan mesleklerdeki serbest çalışanları, daha az maruz kalan mesleklerdekilerle karşılaştıran yazarlar, maruz kalan grup için hem iş sayısında hem aylık kazançta düşüşler buldu. Alanı tedirgin eden bulgu ise kaliteyle ilgili olandı. Güçlü geçmiş puanlara ve uzun bir geçmiş performansa sahip serbest çalışanlar korunmadı; hatta yazarlar, en iyi performans gösterenlerin daha sert vurulduğuna dair ima edici kanıtlar bildiriyor. En makul okuma, rutin metin ve görsel işlerinde, mükemmel bir insan çıktısı ile yeterli bir makine çıktısının alıcıların gözünde birbirine yakın ikameler haline geldiği, bu yüzden mükemmellik priminin ilk önce aşındığı yönünde.

Ozge Demirci, Jonas Hannane ve Xinrong Zhu ise talep tarafını doğrudan ölçtü. Önde gelen küresel bir serbest çalışma platformundan ilanları kullanan ve 2025'te Management Science'ta yayımlanan bir çalışmada, ChatGPT'nin piyasaya sürülmesinden sonraki sekiz ay içinde otomasyona yatkın yazı ve kodlama işleri için ilanlarda elle yapılan yoğun işlere kıyasla 21% düşüş, görsel üretim modellerinin ortaya çıkmasından sonra ise görsel oluşturma ilanlarında 17% düşüş buldular. İki ikincil sonuç, öne çıkan bulgu kadar önemli. Maruz kalan kategorilerde kalan ilanlar daha karmaşıktı ve daha fazla ödeme yapıyordu, bunlar için rekabet de yoğunlaştı. Başka bir deyişle ikame, kategoriyi boşaltmadı; kategorinin altını kaldırdı.

Neden önce yazı, çeviri ve görsel işi? Microsoft Research'ün 2025'te yayımlanan, 200,000 anonimleştirilmiş Bing Copilot konuşmasının analizi, mekanizmaya bir şekil kazandırıyor. Yapay zeka uygulanabilirliği en yüksek olan meslekler, işi bilgi toplamak, üretmek ve iletmekten oluşan mesleklerdi; sözlü ve yazılı çevirmenler, işlerinin 98%'inin asistanın zaten iyi yaptığı görevlerle örtüşmesiyle listenin başında yer aldı. Uygulanabilirlik yer değiştirme değildir ve yazarlar bunu özenle belirtir, ancak bu sıralama, platform çalışmalarının küçüldüğünü tespit ettiği serbest çalışma kategorilerini neredeyse birebir öngörüyor.

En yeni ve bir işletme okuyucusu için en öğretici kanıt, UCLA Anderson'dan Auyon Siddiq ve Niuniu Zhang'dan geliyor. 2026 tarihli çalışma raporları "Human Capital, AI, and Labor Commoditization" (İnsan Sermayesi, Yapay Zeka ve Emeğin Metalaşması), ChatGPT öncesinde aktif olan yaklaşık 50,000 Upwork serbest çalışanını, 2021 başından 2026 başına kadar 21 çeyrek boyunca, 2.26 milyon tamamlanmış sözleşmeyi kapsayacak şekilde takip ediyor. Yazarlar iş sayısını saymak yerine, kimin işe alındığını neyin öngördüğünü soruyor. Çeviri ve yazı gibi yapay zekaya daha çok maruz kalan kategorilerde, bir serbest çalışanın kendini sunuşunun, referanslarının ve itibarının birleşik öngörü ağırlığı, fotoğrafçılık gibi daha az maruz kalan kategorilere kıyasla yaklaşık 7.8% düştü ve fiyatın ağırlığı arttı. Son yıla gelindiğinde insan sermayesi ölçütleri önemlerinin yaklaşık 10.1%'ini kaybetmiş, fiyat ise yaklaşık 1.8% kazanmıştı. Deneyimli serbest çalışanların sahip olduğu avantaj önce 6.2%, ardından 10.3% daraldı ve en çok maruz kalan işlerde daha ucuz serbest çalışanlar 7.9% daha fazla sözleşme kazandı. Maruz kalan alanlardaki genel talep yaklaşık 7% düştü. Yazarların buna verdiği isim metalaşma: bir alıcı bir modelden kabul edilebilir bir ilk taslak alabildiğinde, bir insana ne için ödeme yapacağı "sen kimsin"den "ne kadar"a kayıyor.

Bulgu 2: Toplam etki hâlâ küçük, tek bir gürültülü istisna dışında

Platform kanıtları hikâyenin tamamı olsaydı, ulusal istatistikler şimdiye kadar bunu göstermiş olurdu. Çoğunlukla göstermiyorlar ve büyük etkiler bulamayan çalışmalar en iyi tasarlanmış olanlar arasında.

Anders Humlum ve Emilie Vestergaard, on bir maruz kalan meslekte 25,000 çalışanı ve 7,000 işyerini kapsayan büyük ölçekli benimseme anketlerini Danimarka'nın idari emek kayıtlarıyla ilişkilendirdi. İlk kez 2025'te dolaşıma giren ve Mart 2026'da revize edilen NBER çalışma raporları, hızlı bir benimsemeyi belgeliyor: maruz kalan mesleklerdeki işverenlerin çoğu sohbet botu girişimleri başlatmıştı, çalışanlar verimlilik faydaları bildirdi ve yeni yapay zeka ile ilgili görevler yaygındı. Yine de kazanç ve kayıtlı çalışma saatleri üzerindeki farkların farkı tahminleri kesin sıfır sonuçlar veriyor ve hem çalışan hem işyeri düzeyinde, ChatGPT'den iki yıl sonra 2%'den büyük etkileri dışlıyor. Değişen şey işin yapısıydı: işverenler teknolojiyi, içerik üretimi, yapay zeka denetimi ve yapay zeka entegrasyonunda yeni görevler dahil olmak üzere görev yeniden düzenlemesi yoluyla özümsedi ve benimseyenler, araçların daha faydalı olduğu daha yüksek ücretli mesleklere kaydı, ancak bu sayılar ortalamaları değiştirecek kadar büyük değildi. Çalışmanın önceki sürümü, kendi bildirilen zaman tasarruflarını çalışma saatlerinin 3%'inin altına yerleştirmişti; bu, aynı mesleklerde kontrollü denemelerin belgelediği, çoğu zaman 15%'in üzerindeki kazançların bir kesri. Yapay zekanın bir denemede yapabildikleri ile bir bordroda değiştirdikleri arasındaki fark, bu literatürün merkezi bilmecesi ve Danimarka bunun en net şekilde ölçüldüğü yer.

Yale'deki Budget Lab, farklı bir yoldan Amerika Birleşik Devletleri için benzer bir sonuca ulaşıyor. İstihdamın meslek karışımını takip eden ve yapay zekaya maruz kalan mesleklere sentetik farkların farkı analizini uygulayan kurumun 2025 ve 2026 güncellemeleri net bir yapay zeka izi bulmuyor. 2026'nın başı düşük işten çıkarmalar ama aynı zamanda düşük işe alımlar gösteriyor ve yazarlar, yaygın etkileri olan bir teknolojinin bu etkileri göstermesinin ChatGPT'den bu yana geçen yaklaşık üç yıldan daha uzun sürmesinin beklenmesi gerektiğini savunuyor.

İstisna, Stanford'ın Digital Economy Lab'inden Erik Brynjolfsson, Bharat Chandar ve Ruyu Chen tarafından belgeleniyor. Milyonlarca Amerikalı çalışanı kapsayan ADP bordro kayıtlarını kullanan "Canaries in the Coal Mine?" (Kömür Madenindeki Kanaryalar mı?) başlıklı çalışmalarının Ağustos 2026 güncellemesinde, Haziran 2026'ya kadar olan verilerle, yoğun şekilde yapay zekaya maruz kalan mesleklerdeki 22-25 yaş arası çalışanların istihdamı, benzer yaştaki daha az maruz kalan meslek çalışanlarını takip etmiş olsaydı bulunacağı düzeyin yaklaşık 19% altında kaldı; bu oran bir yıl önce 15%'lik bir farktı. Seviyeler açısından, bu yaş grubunun istihdamı en çok maruz kalan iki beşte birlik dilimde Kasım 2022 ile Haziran 2026 arasında yaklaşık 11% düşerken, en az maruz kalan üç beşte birlik dilimde istihdam yaklaşık 10% arttı. Deneyimli çalışanlar karşılaştırılabilir bir fark göstermiyor ve yazarlar, yaygın, ekonomi genelinde bir yer değiştirme görmediklerini açıkça belirtiyor. Düşüşler, yapay zeka kullanımının işi tamamlamak yerine otomatikleştirdiği mesleklerde yoğunlaşıyor.

Yapay zekanın bir durgunluk gibi davranmasını beklemekten vazgeçildiğinde, bu sonuçlar birbiriyle tutarlı hale geliyor. Görev düzeyindeki ikame önce sözleşmelerin en kısa olduğu ve en sık yeniden fiyatlandırıldığı yerlerde ortaya çıkıyor: serbest çalışma işleri ve giriş seviyesi işe alım. Serbest çalışma piyasası kanaryadır çünkü her hafta yeniden fiyatlanır; bordro ise madendir ve oradaki hava şimdiye kadar en az değişen oldu.

Bulgu 3: Destekleme kazançları büyük ama dengesiz, pürüzlü sınır gerçek

İkamenin tamamlayıcısı destekleme ve burada deneysel kanıt, randomizasyon mümkün olduğu için alışılmadık derecede güçlü.

Brynjolfsson, Danielle Li ve Lindsey Raymond, üretken bir yapay zeka asistanının 5,179 müşteri destek temsilcisine kademeli olarak tanıtılmasını, 2025'te Quarterly Journal of Economics'te yayımlanan bir çalışmada inceledi. Saat başına çözülen sorunlar ortalama 14% arttı; yeni başlayan ve daha düşük becerili temsilcilerde 34% kazanç görülürken, deneyimli, yüksek becerili temsilcilerde neredeyse hiç değişiklik olmadı. Araç, en iyi temsilcilerin uygulamalarını kodlayıp bunları en yenilere aktararak, onları deneyim eğrisinde daha hızlı ilerletiyor gibi görünüyordu.

Harvard Business School'dan Fabrizio Dell'Acqua ve meslektaşları, BCG ile birlikte çalışarak, 758 yönetim danışmanını GPT-4'lü ve GPT-4'süz gerçekçi görevlere randomize şekilde dağıttı; bu çalışma artık Organization Science'ta yayımlanmış durumda. Modelin yetkinliği içindeki on sekiz görevde, yapay zekalı danışmanlar 12.2% daha fazla görev tamamladı, 25.1% daha hızlı çalıştı ve kalite kör değerlendiriciler tarafından 40% daha yüksek puanlandı. Bilinçli olarak bu yetkinliğin dışında kalacak şekilde seçilen bir görevde ise, yapay zekalı danışmanların doğru cevaba ulaşma olasılığı 19 yüzde puanı daha düşüktü. Yazarların bu sınır için kullandığı ifade, pürüzlü teknolojik sınır, sorunun standart tanımı haline geldi: aracın yetkinliği bir kullanıcının görebileceği çizgiler boyunca ilerlemiyor ve kullanıcılar çizginin hangi tarafında olduklarını anlamakta zayıf.

Xiao Ni, Tianjun Feng, Lauren Xiaoyuan Lu ve ortak yazarların Alibaba'nın müşteri hizmetleri operasyonları içinde yürüttüğü saha deneyi, bu dağılım örüntüsünü büyük ölçekte yeniden ortaya koydu: 5,940 yeni temsilci, kabaca 2.56 milyon sohbet, 390,000 müşteri puanı. Düşük performans gösterenler hem hızda hem kalitede en çok gelişme gösterdi; en iyi performans gösterenler ise az hız kazandı ve hem öznel hem nesnel ölçütlerde kalite kaybetti. Tabanı yükselten destek, tavanı düşürebiliyor.

Sonra, Temmuz 2025'te yayımlanan ve döneminin en çok atıf alan uyarıcı sonucu olan, kesin bir ifadeyi hak eden METR'in deneyimli açık kaynak geliştiricileri üzerine randomize denemesi var. On altı geliştirici, ortalama 22,000'den fazla yıldıza ve bir milyon satır koda sahip, kendi bakımını yaptıkları depolarda 246 gerçek görev üzerinde çalıştı; görevlerde yapay zeka araçlarına, esas olarak Claude 3.5 ve 3.7 Sonnet ile Cursor'a, rastgele izin verildi veya izin verilmedi. Yapay zekayla 19% daha uzun sürdüler. Çalışmadan önce 24%'lük bir hızlanma öngörmüşlerdi; sonrasında ise 20% daha hızlı olduklarını tahmin ettiler. Algı farkı, verimlilik sonucu kadar önemli. Bu durum, çoğu sektör anketinin temelini oluşturan kendi kendine bildirilen kazançların, tam olarak uzmanlığın en yüksek olduğu yerde yukarı yönlü yanlı olduğunu düşündürüyor. Özellikle yazılım işi için çıkarımlar yapay zeka yazılım geliştiricilerin yerini alacak mı? yazısında ele alınıyor.

R. Maria del Rio-Chanona, Ekkehard Ernst, Rossana Merola, Daniel Samaan ve Ole Teutloff'un 2025 tarihli bir derlemesi, bu iplikleri literatür genelinde bir araya getiriyor: kontrollü denemelerde kabaca 20% ile 60% arasında, saha deneylerinde 15% ile 30% arasında verimlilik kazançları; basit görevlerde yeni başlayanlar için daha büyük, karmaşık görevlerde karışık sonuçlar; dijital iz verileri yazı ve çeviride ikameyi gösterirken, yapay zeka becerilerine talep artıyor ve yeni başlayanlara olan talebin azaldığına dair hafif ama büyüyen kanıtlar var.

Bulgu 4: Ajanlar asistanlıktan çalışanlığa geçti, güvenilirlik açığı hikayenin tamamı

Yukarıdaki her şey, her adımda döngüde kalan bir insana asistanlık eden yapay zekayla ilgili. 2025'ten bu yana değişen şey, sistemlerin artık çok adımlı işi, insanın sonunda kontrol ettiği veya hiç kontrol etmediği şekilde yürütmesi ve bu da hangi kanıtın önemli olduğunu değiştiriyor.

METR'in zaman ufku ölçütü, bir insan profesyonelin ihtiyaç duyacağı süre cinsinden ifade edilen bir görevi, bir sistemin 50% başarı oranıyla ne kadar uzun sürede tamamlayabildiğini soruyor. Metodolojinin Ocak 2026 revizyonunda, sekiz saat veya daha uzun 31 görev dahil olmak üzere 228 göreve genişletilen bir seti kullanarak, uzun vadeli ikiye katlanma süresi yaklaşık 196 gün olarak tahmin edildi; 2023'ten bu yana 131 güne, 2024'ten bu yana ise 89 güne kadar hızlanan bir ikiye katlanmayla. O noktada en iyi ölçülen model olan Claude Opus 4.5, kabaca üç ile on iki saat arasında geniş bir güven aralığıyla, yaklaşık 320 dakikalık bir 50% ufkuna sahipti. Yazarlar, 50%'lik bir başarı eşiğinin gerçek iş için cömert olduğunu, eğilimin görev bileşimine duyarlı olduğunu ve çoğu uzun görevin ölçülen değil tahmini insan sürelerini kullandığını açıkça belirtiyor. Bu uyarılarla birlikte ele alındığında, yön açık: devredilebilen dijital işin uzunluğu katlanarak büyüyor.

OpenAI'nin 2025'in sonunda yayınlanan GDPval değerlendirmesi, devredilen bu işin işe yarayıp yaramadığını test ediyor. Görevler, dokuz sektörde 44 meslekten, ortalama 14 yıl deneyime sahip profesyoneller tarafından yazıldı ve kör uzmanlar tarafından insan çıktısıyla ikili karşılaştırma yoluyla puanlandı. En iyi model olan Claude Opus 4.1, vakaların 47.6%'sında uzmanınkine eşit veya ondan daha iyi puanlanan çıktılar üretti. Bir işletmenin aklında tutması gereken sayı farklı bir sayı. Makine süresinin insan süresiyle saf karşılaştırması doksan kata yakın oranlar veriyor, ancak çalışma bir insanın işi incelemesini ve gerektiğinde yeniden yapmasını hesaba kattığında, tahmini tasarruf stratejiye bağlı olarak 1.12 ile 1.39 kat arasına düşüyor. Maliyetin gittiği yer inceleme. Bu, Dell'Acqua'nın danışmanlarda ve METR'in geliştiricilerde bulduğu aynı mekanizma, şimdi çıktı düzeyinde ölçülüyor.

İşyeri karşılaştırma testleri hem ilerlemenin hızını hem de arta kalanı gösteriyor. Carnegie Mellon'dan TheAgentCompany, ajanları GitLab, OwnCloud, Plane ve RocketChat'in gerçek örnekleriyle ve 175 görevle simüle edilmiş bir yazılım firmasına bıraktı; en iyi ajan, 2024'ün sonundaki lansmanda bunların yaklaşık dörtte birini, 2025 boyunca ise yaklaşık 30%'unu tamamladı. Olly Styles ve Sam Miller, WorkBench karşılaştırma testlerini Haziran 2026'da yeniden ele aldı ve en iyi ajanın tamamlama oranının Mart 2024'te GPT-4 için 43%'ten, Claude Fable 5 için 98%'e yükseldiğini, istenmeyen zararlı eylemler içeren çalıştırmaların payının ise 26%'dan 1.9%'a düştüğünü bildirdi. Ayrıca öncü modellerin hâlâ zaman zaman geri döndürülemez zarara yol açan temel hatalar yaptığını bildiriyorlar. Yüzde iki çok iyi bir oran; aynı zamanda kabaca elli çalıştırmadan birinin yapmaması gereken bir şeyi yaptığı anlamına da geliyor.

Yiwei Wang, Chuan Zhu, Tianjun Feng, Lauren Xiaoyuan Lu ve Bingxin Jia'nın 2026 Alibaba saha deneyi, canlı bir hizmet operasyonunda döngüde insan bulunan ajan tipi yapay zeka üzerine ilk randomize kanıt. İşlem grubundaki çalışanlar, uygun müşteri sohbetlerini yöneten bir ajanı denetlerken, geri kalanını kendi elleriyle yürüttü. Ortalama sohbet süresi düştü ve müşterilerin aynı sorunla geri gelmesi üzerinde sınırlı bir etki oldu, ancak ajanın yönettiği sohbetler önemli ölçüde daha düşük puanlar aldı. İnsan müdahalesi, hata teknik olduğunda, yani çözülmemiş bir sorun olduğunda, duygusal olduğunda, yani hayal kırıklığına uğramış bir müşteri olduğunda olduğundan çok daha iyi bir toparlanma sağladı ve erken geldiğinde en iyi sonucu verdi. Denetleyen çalışanlar ayrıca hâlâ kendileri yönettikleri sohbetlere daha fazla dikkat etti, bu da olumlu bir yan etki. Bu, ajan ile insan arasındaki devir teslimin nasıl tasarlanması gerektiğine dair şimdiye kadarki en doğrudan kanıt: erken izle, gerçekler üzerinde müdahale et ve duyguları makineye bırakma.

Benimseme verileri, bu kaymanın laboratuvarlarla sınırlı olmadığını doğruluyor. Anthropic'in Mart 2026 Ekonomik Endeksi, mesleklerin 49%'unda görevlerin en az dörtte birinin Claude ile gerçekleştirildiğini ve kodlama işinin sohbete dayalı kullanımdan otomatikleştirilmiş API iş akışlarına kaydığını, Ağustos 2025'ten bu yana kodlama payının API'de 14% arttığını ve sohbet ürününde 18% düştüğünü bildiriyor. Lightcast'in 2026 Stanford AI Index'ine katkısı, tüm ABD iş ilanlarının 2.5%'inde yapay zeka becerileri bulunduğunu ve "ajan tipi yapay zeka" beceri kümesinden bahseden ilanların 2024'te 0.06%'dan 2025'te 0.23%'e, kabaca 90,000 ilana yükseldiğini tespit ediyor. Ve Upwork pazaryerindeki gerçek, tamamlanmış işlerden oluşturulan 2025 tarihli bir karşılaştırma testi olan UpBench, uzman serbest çalışanlara her işi, ajanların karşısında puanlandığı doğrulanabilir kabul kriterlerine ayırdırıyor. Ajanları bir müşterinin bir serbest çalışana uygulayacağı rubrikle notlandırmak, arz tarafının nereye gitmesinin beklendiğine dair bir sinyal.

Mekanizmalar: Örüntü neden böyle görünüyor

Dört mekanizma, kanıtların gösterdiklerinin çoğunu açıklıyor ve bir sonraki adımda ne olacağını öngördükleri için belirtilmeye değerler.

Birincisi, rutin yetkinliğin metalaşması. Bir model bir ürün açıklamasının, bir çevirinin veya standart bir modülün kabul edilebilir bir taslağını ürettiğinde, alıcının o kategoride bir insanın referansları için ödeme yapma isteği düşer ve fiyat belirleyici değişken haline gelir. Siddiq ve Zhang tam olarak bu kaymayı ölçüyor, Demirci ve meslektaşları da bunun ayna görüntüsünü gösteriyor: insan elinde kalan iş daha karmaşık, daha iyi ödenen ve daha çok rekabet edilen bir hale geliyor.

İkincisi, bağlayıcı kısıt olarak doğrulama maliyeti. Üretim ucuzladı; kontrol etmek ucuzlamadı. GDPval'in inceleme hesaba katıldığında doksan kattan 1.4 katın altına düşmesi, METR'in yavaşlayan uzmanları ve pürüzlü sınır, hepsi aynı ekonomiyi tarif ediyor. Bir çıktıyı ucuza doğrulayabilen herkes kazancı elde eder; edemeyen ise bunun bedelini yeniden yapma veya fark edilmemiş hata olarak öder. Kazançların, kontrolü kolay görevlerde yeni başlayanlara akıp, kontrolün yapmak kadar maliyetli olduğu görevlerde uzmanlar için durma sebebi bu.

Üçüncüsü, çıraklık açığı. Bir ajanın iyi yaptığı görevler, firmaların öğrenmeleri için genç personele ve genç serbest çalışanlara vermeyi alışkanlık haline getirdiği görevler. Brynjolfsson, Li ve Raymond, desteğin en çok yeni başlayanlara yardımcı olduğunu gösteriyor; Brynjolfsson, Chandar ve Chen ise firmaların buna rağmen daha az sayıda yeni başlayan işe aldığını gösteriyor. İkisi de doğru olabilir: aynı çıktıyı üretmek için daha az sayıda junior'a ihtiyaç duyan bir firma, her biri daha üretken olsa bile daha az junior işe alır. Uzun vadeli maliyet, yani deneyimli insanların daha ince bir yetişme hattı, henüz hiçbir veri kümesinde görünür değil ve bu alandaki en önemli ölçülememiş değişken.

Dördüncüsü, tamamlayıcı insan görevlerinin kalıcılığı. Demirci'nin karşılaştırma grubu olan elle yapılan yoğun iş düşmedi. Alibaba deneyi, duygusal hataların makine tarafından toparlanmaya direndiğini gösteriyor. Hesap verebilirlik, fiziksel varlık, fiziksel iş ve ilişkiler, model yetkinliğiyle hiçbir ilgisi olmayan ama bir müşterinin neyi kabul edeceğiyle tamamen ilgili nedenlerle insana ait kalıyor.

Şüpheci bir okuyucu bunların yanında iki alternatif açıklamayı da aklında tutmalı. Amerika Birleşik Devletleri'ndeki giriş seviyesi düşüş, aynı kohortu bağımsız olarak etkileyen daha yüksek faiz oranlarıyla ve teknolojideki pandemi dönemi işe alımlarının geri sarılmasıyla çakışıyor; Stanford'daki yazarlar bunu firma içi karşılaştırmalarla ve otomatikleştiren meslekleri destekleyen mesleklerle karşılaştırarak ele alıyor, ancak bu karıştırıcı etken tam olarak dışlanamıyor. Ve her "maruziyet" ölçütü kendisi de modelden türetilmiş durumda, bu yüzden çalışmalar kısmen sınıflandırıcının varsayımlarını test ediyor. Danimarka'nın toplu pazarlık kurumları da, daha gevşek bir işgücü piyasasında daha hızlı ortaya çıkacak ücret tepkilerini yumuşatıyor olabilir.

Platformlar nasıl tepki verdi

Pazaryerleri aynı sinyalleri okudu ve harekete geçti. Nisan 2025'te Fiverr'ın CEO'su Micha Kaufman, personele yazdığı yazıda kendi işi dahil "yapay zekanın işlerinizin peşinde olduğunu" söyledi ve onları Cursor ve Legora gibi araçlarda ustalaşmaya çağırdı; Eylül 2025'te şirket, o Şubat ayında Fiverr Go yaratıcı araçlarını piyasaya sürdükten sonra, kendi deyimiyle bir yapay-zeka-öncelikli şirket olmak için işgücünün yaklaşık 30%'una yakın, yaklaşık 250 pozisyonu kesti. Upwork ise asistanı Uma'yı, müşteriler ve serbest çalışanlar adına eylemler gerçekleştiren, kendi tanımıyla her zaman açık bir iş ajanına dönüştürüyor ve 2026 Future Workforce Index raporu, başarılı serbest çalışanı, araçları alan uzmanlığına bağlayan ve muhakeme uygulayan bir "yapay zeka orkestra şefi" olarak yeniden tanımlıyor. Aynı rapor fiyat sinyalini tek bir satırda veriyor: yapay zeka işi yapan serbest çalışanlar, yapmayanlara göre saatte 34% daha fazla kazandı, karmaşık yapay zeka destekli işlerde kazançlar yıllık bazda 45% arttı, üretken yapay zeka ve yaratıcı üretim işinde sözleşme başlangıçları 90% büyürken sözleşme başına kazançlar 13% düştü. Hacim basit uca, para ise karmaşık uca kaydı.

Bu vaka çalışmasının yayımlandığı platform olan Jobbit, kanıtların işaret ettiği iş bölümünün iki tarafından biri etrafında değil, bu iş bölümünün kendisi etrafında tasarlandı. Ajan, incelenebilir dijital işi üstleniyor: bir web sitesi veya web uygulaması oluşturmak ve dağıtmak, belgeler ve sunumlar hazırlamak, araştırma yürütmek, otomasyonlar kurmak, görsel ve video üretmek. Kullanıcı, ajan tarayıcısında onun çalışmasını izleyebilir ve istediği anda kontrolü ele alabilir; bu da Alibaba deneyinin en etkili bulduğu erken müdahale örüntüsü. Bir ajanın kötü yaptığı veya tek başına yapmaması gereken işler, fiziksel ve yerel işler, hesap verebilir uzman incelemesi, bir müşterinin bir insana ihtiyaç duyduğu her şey için platform, pro.jobbit.uk üzerinde denetlenen bir insan ağına yönlendiriyor. Jobbit kendi deneme verilerini yayımlamadı ve bu çalışma onun üzerindeki ölçülmüş sonuçlar hakkında bir iddiada bulunmuyor; iddia, bir tasarım ile kanıtlar arasındaki uyuma dair. Mekaniği merak eden okuyucular, ajan tipi yapay zekanın gerçekte ne olduğu, ajan tarayıcısını izleme ve kontrolü ele alma kılavuzu ve küçük bir işletme için yapay zeka kullanım örnekleri pratik listesiyle başlayabilir.

Bir işletme bu kanıtla ne yapmalı

Bulgular, bir işletme sahibinin tek bir araştırma makalesi bile okumadan uygulayabileceği bir devretme kuralına dönüşüyor.

Rutin ve incelenebilir işi bir ajana verin: ilk taslaklar, özetler, araştırma notları, standart belgeler, bir öğleden sonrada tıklayarak gezip kontrol edebileceğiniz bir web sitesi veya dahili araç. Her çalışmanın en büyük kazançları bulduğu yer burası, özellikle işletmenin şu anda görevi yavaş yaptığı veya hiç yapmadığı durumlarda, çünkü yeni başlayan etkisi insanlar kadar firmalar için de geçerli. Pratik bir başlangıç sırası işletmenizi yapay zeka ajanlarıyla nasıl otomatikleştirirsiniz yazısında anlatılıyor.

Geri döndürülemez, duygusal, fiziksel veya hesap verebilir işte bir insanı tutun: para gönderen, veri silen, üzgün bir müşteriye dokunan veya birinin sonucun arkasında durmasını gerektiren her şey. Alibaba deneyi ve WorkBench'in arta kalanı aynı yöne işaret ediyor.

Bir ajanın daha ucuz olduğuna karar vermeden önce inceleme süresini fiyata dahil edin. GDPval'in dürüst aritmetiği, doksan kat yerine 12% ile 39% arasında bir tasarruf, planlama yapılacak sayı. İşletmede kimse çıktıyı kontrol edemiyorsa, tasarruf gerçek değildir; bu durumda cevap, işi ajana yaptırıp bir insan uzmana inceletmektir, ki serbest çalışma verileri alıcıların bunun için zaten prim ödediğini gösteriyor.

Sınırın pürüzlü olmasını ve hareket etmesini bekleyin. Ajanın Ocak'ta yapamadığı bir görev, Eylül'e kadar rutin hale gelebilir, ancak bunun tersi doğru değildir. Test edin, neyin kontrol edildiğinin ve neyin başarısız olduğunun kaydını tutun ve bölünmeyi her çeyrekte yeniden gözden geçirin.

Dört yıllık kanıttan çıkan çalışma kuralı: rutin ve kontrol edilebilir olanı devredin, geri döndürülemez veya duygusal olanda bir insanı tutun ve inceleme süresini fiyatın bir parçası olarak ele alın.

Sınırlılıklar ve açık sorular

Büyük veri kümelerinin çoğu Amerikan kaynaklı ve platform verileri, yapılan tüm işi değil, yayınlanan talebi ölçüyor. Maruziyet ölçütleri modelden türetilmiş durumda, bu yüzden sonuçlar kısmen sınıflandırıcının varsayımlarını miras alıyor. Zaman ufukları kısa: Danimarka'da iki yıl, Amerika Birleşik Devletleri'nde dörtten az ve Yale'deki yazarların yaygın etkilerin daha uzun sürebileceği yönündeki noktası haklı bir uyarı. Karşılaştırma testleri iş değildir; GDPval görevleri kendi içinde tamamlanmış çıktılardır ve WorkBench sentetik bir ofistir, oysa gerçek iş kesintiye uğrar, belirsizdir ve politiktir. Yetkinlik, bu çalışmadaki her rakamın bir anlık görüntü olacağı kadar hızlı ilerliyor ve yerini başka bulguların alması en muhtemel olan çalışmalar, emek rakamları değil, yetkinlik rakamları. Son olarak, önümüzdeki on yıl için en önemli etki, yani daha ince bir çıraklık hattının deneyimli profesyonel arzını bozup bozmadığı, henüz hiç ölçülemiyor.

Sonuç

Yapay zeka ajanları serbest çalışanların yerini alıyor mu? Şimdilik görevlerin yerini alıyorlar ve bunu bir görevin çıktısının rutin olarak üretilip değerlendirilebildiği yerlerde yapıyorlar. Bu, meta haline gelmiş yazı, çeviri ve görsel işi pazarını küçültmeye, bu kategorilerdeki referanslar için işe alım primini zayıflatmaya ve maruz kalan mesleklerde giriş seviyesi işe alımı keskin biçimde kesmeye yetti, bunu yaparken bütün ekonomiler genelinde kazançları ve çalışma saatlerini büyük ölçüde değişmeden bıraktı. Veride başarılı olan serbest çalışan, muhakeme, hesap verebilirlik ve makine işini yönlendirme ve kontrol etme becerisini satan kişi; fayda gören işletme ise rutini devretmeyi ve onu incelemeyi öğrenen ve geri alınamayacak her şeyde bir insanı tutan işletme. Pazar, işlemin bir tarafını kaybetmiyor. Aralarındaki devir teslim etrafında yeniden düzenleniyor ve kanıtların lehte gördüğü platformlar, bu devir teslimi kolaylaştıran platformlar.

Sıkça sorulan sorular

Yapay zeka ajanları serbest çalışanların yerini alıyor mu?

Bir kategori olarak değil. 2022'den 2026'ya kadarki en iyi kanıt, yapay zekanın belirli görevlerin, başta rutin yazı, çeviri, görsel oluşturma ve basit kodlamanın yerini aldığını gösteriyor; bu alanlarda iş ilanları, ChatGPT'den sonraki aylar içinde elle yapılan işe kıyasla kabaca beşte bir düştü. Aynı kategorilerdeki karmaşık işlere olan talep, ücret ve rekabette arttı ve ulusal veriler ekonomi genelinde bir yer değiştirme göstermiyor. En net kaybedenler, deneyimli serbest çalışanlar değil, maruz kalan mesleklerdeki giriş seviyesi çalışanlar.

Yapay zekadan en çok hangi serbest çalışma işleri etkileniyor?

Yazı, çeviri, içerik düzenleme, görsel ve tasarım üretimi ve rutin kodlama. Upwork ve diğer platformlar üzerine yapılan çalışmalar, bu kategorilerin ilan kaybettiğini ve müşteriler işe alırken referansların daha az, fiyatın daha çok önem kazandığını buluyor. Fiziksel, yerel, ilişki temelli olan veya sonuç için hesap verebilirlik taşıyan iş, şimdiye kadar büyük ölçüde etkilenmedi.

Bir yapay zeka ajanı kullanmak bir serbest çalışan tutmaktan daha mı ucuz?

Rutin, kontrol edilebilir iş için genellikle evet, ama öne çıkan karşılaştırmaların ima ettiğinden daha az. OpenAI'nin GDPval değerlendirmesi, modellerin ham anlamda profesyonel çıktıları kabaca doksan kat daha hızlı ürettiğini buldu, ancak insan incelemesi ve düzeltmesi hesaba katıldığında, tasarruf yaklaşık 12% ile 39% arasına düşüyor. İşletmede kimse çıktıyı inceleyemiyorsa, gerçekçi seçenek, işi bir ajanın üretmesi ve bir insan uzmanın kontrol etmesidir.

Küçük bir işletme hâlâ hangi işi bir insana vermeli?

Geri döndürülemez, duygusal, fiziksel veya hesap verebilir olan her şeyi: ödemeler ve silmeler, üzgün müşteriler, yerinde yapılan işler ve birinin arkasında durması gereken sonuçlar. Alibaba'da yapılan 2026 tarihli bir saha deneyi, ajanın yönettiği hizmet sohbetlerinin daha hızlı ama daha düşük puanlı olduğunu ve insan müdahalesinin teknik hataları duygusal olanlardan çok daha iyi telafi ettiğini buldu. Jobbit gibi platformlar, dijital görevler için bir ajanı, tam da bu arta kalan kısım için bir insan ağıyla eşleştiriyor.

Çalışmalar yapay zeka ve işler konusunda neden birbiriyle çelişiyor?

Çoğunlukla farklı şeyleri ölçüyorlar. Kontrollü deneyler, yapay zekanın seçilmiş görevlerde neler yapabildiğini ölçüyor ve büyük kazançlar buluyor; platform verileri belirli görev kategorilerine olan talebi ölçüyor ve keskin yerel düşüşler buluyor; bordro ve idari veriler ekonomi genelindeki istihdamı ve kazançları ölçüyor ve şimdiye kadar çok az değişiklik buluyor. Görev düzeyindeki ikame, dengesiz destekleme ve yavaş toplam uyum birlikte okunduğunda tablo tutarlı hale geliyor.

Related guides