
Model geliştirmede işin çoğunu artık AI ajanları yapıyor, kararları ise hâlâ insanlar veriyor
Fudan Üniversitesi'nden bir ekip kendi model projesindeki 700'den fazla görev kaydını inceledi: AI görevlerin %96,5'inde kullanıldı, ama yöntem kararlarının %85,5'ini ve hedef kararlarının %93,4'ünü insanlar verdi.
Çin'deki Fudan Üniversitesi'nden araştırmacılar, AI ajanları bir AI modelinin geliştirilmesine yardım ederken kararları gerçekte kimin verdiğini görmek için kendi projelerini inceledi ve 56 katılımcının 700'den fazla görev kaydını analiz etti.
Projenin sonucu, mixture-of-experts mimarisine sahip 744 milyar parametreli agentic dil modeli Atria Dawn Preview oldu. Her eğitim görevi gerçek bir uygulama ortamına bağlanıyor ve testler, metrikler ya da kaynak kanıtlarıyla denetleniyor. Ekibe göre model, web araması ve siber güvenlik dahil 16 kıyaslamanın beşinde lider; ancak genel bir üstünlüğü yok.
Ajanlar işin daha fazlasını üstleniyor
İncelenen görevlerin %96,5'inde AI kullanıldı. Dört hafta içinde, insan girdisi başına düşen ajan eylemi medyanı 11'den 28,5'e çıktı; ekip bunu artan özerklik olarak okumamak gerektiği uyarısını yapıyor: her insan kararı yalnızca daha fazla ajan adımını tetikledi.
Katılımcılar ayrıca görevdeki paylarını AI olmadan tamamlayıp tamamlayamayacaklarını değerlendirdi. AI desteğiyle tamamlanan 455 görevden 151'i, yaklaşık üçte biri, AI olmadan imkânsız çıktı ve bu görevler 56 katılımcının 27'sine dağılmıştı. AI aksi halde hiç başlanmayacak işi mümkün kıldı.
AI önerir, insan seçer
Yöntemler ve parametreler için en yaygın örüntü "AI önerir, insan seçer" oldu: yüzde 55,4. Bu konulardaki kararların yüzde 85,5'ini insanlar verirken AI yüzde 9,2'de kaldı; hedefler ve kapsamda son söz vakaların yüzde 93,4'ünde insanlarındı.
Aynı tablo işler ters gittiğinde de görülüyor. Zorluk kaydedilen 588 görevin yüzde 76'sı insan müdahalesiyle ilerledi, yüzde 23'ünü ajan kendi başına çözdü; yardım çoğunlukla ek bağlam (yüzde 35,2) ya da teşhis (yüzde 34,7) olarak geldi, elle yapılan iş olarak değil.
Kaşe onayı riski
Her karar, bir insanın inceleyebileceğinden daha uzun bir ajan çalışması zincirine dayandığında denetim zorlaşıyor; ekip, en kötü senaryoda insanların yalnızca gördüklerine kaşe basan denetçilere dönüştüğünü yazıyor. Katılımcıların çoğu ajanları otonom modlarda kolaylık olsun diye çalıştırdı, AI'nin yetkisinin ne olması gerektiğine dair bilinçli bir tercihle değil.
Makale, özyinelemeli kendini geliştirme tartışmasının ortasında yayımlandı: Anthropic, kendi halefini geliştiren bir AI'nin beklenenden erken mümkün olabileceğini düşünüyor ve CEO'su Dario Amodei sektör için hız sınırı çağrısı yapıyor; önde gelen AI şirketlerinde binden fazla çalışan da kuruluşlarının AI araştırmasını otomatikleştirme eşiğinde olabileceği uyarısında bulundu.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.