Navier-Stokes sonrasında LLM'ler hakkında neden hâlâ karamsarım
İlgi gören bir blog yazısı, manşetlere taşınan yapay zekâ sonuçlarının gerçek otonomi anlamına gelmediğini savunuyor: modeller hâlâ yoğun denetime ihtiyaç duyuyor ve bunu çözecek titiz şartnamelerin maliyeti çoğu firma için engel.
Hype'a karşı tez
15 Eylül'de dank.systems blogunda yayımlanan bir yazı, büyük dil modelleri (LLM) etrafındaki heyecanın sistemlerin gerçekte yapabildiklerinin önüne geçtiğini savunuyor. Yazar, öncü laboratuvarların değerlemesinin, "bilgi çalışanlarının çoğunun yerini alacak tam otomatik bir ikame" üretecekleri anlatısına dayandığını, oysa mevcut modellerin "en basit görevlerde bile zahmetli denetime ve koruma kurallarına" ihtiyaç duyduğunu yazıyor.
Navier-Stokes çalışması, FreeBSD uzaktan kod çalıştırma bulguları ve Hugging Face olayı gibi manşete taşınan gösterilerin anlamlı bir otonomiye işaret etmediğini savunan yazar, kanıt olarak bugünün kıyaslamalarında kendilerini denetleyen modellerden daha düşük puan alacak mühendisleri hâlâ işe alan yazılım şirketlerini gösteriyor.
Dar genelleme ve şartname maliyeti
İkinci tez genellemeyle ilgili: modeller yalnızca eğitildikleri görevlerin küçük bir komşuluğunda iyi çalışıyor ve orada bile "kapsanan bir görev sınıfı içindeki küçük sapmalar tam başarısızlık ya da ödül kırılmasıyla sonuçlanıyor". Bunu düzeltmek, alan uzmanlarının yazdığı titiz bir şartname gerektiriyor; uzmanların zamanı pahalı — üstelik şartname yazmak başlı başına ayrı bir beceri, bu yüzden yazar alanı bilenlerle onu kesin biçimde tanımlayabilenlerin kesişiminin çok küçük olduğunu söylüyor.
Donanım mühendisliğinde tipik bir CPU projesinde şartname ve doğrulama mühendislerinin sayısı tasarım mühendislerinin yaklaşık üç katı; 5:1 oranı da duyulmadık bir şey değil, diye belirtiyor yazı.
En iyi durum matematik, yedek plan insan denetimi
Matematiksel sonuçlar, yazarın ifadesiyle titiz bir şartnameye karşı çalışmak için "mutlak en iyi senaryo": teorem ifadesi zaten bir şartname, matematik camiası tarafından onlarca yıldır denetlenmiş ve Lean'deki formalizasyonu mathlib'den iyi test edilmiş nesnelerin çevirisi. Buna rağmen Lean de kusursuz değil; tutarlılık hataları daha önce LLM'lerin sahte ispatları Lean'in çekirdeğinden geçirmesine izin verdi.
Alternatif olan insan denetimi, modellerin ürettiği hacme ölçeklenmiyor ve kendisi de manipülasyona açık; yazar xz arka kapısını ve Linux çekirdeğindeki "ikiyüzlü commit'ler" olayını örnek veriyor. İnsan denetimi döngüde kalırsa üretim hızı insan dikkatiyle sınırlanıyor.
Hangi firmalar otonom yapay zekâyı kullanabilir
Yazının sonucu şu: çoğu alanda LLM'ler "kırık bir stajyer gibi: bir yetişkinin elinde hızlı ve etkili, ama işin başına geçirilecek biri değil". Tam otonom kullanımı kabul edebilecek yalnızca üç firma sınıfı var: başarısızlığı ucuza karşılayabilenler (hızlı prototipleme ekipleri gibi); iyi korunmuş, dar bir görev kümesine sahip olanlar (kontrollü ortamda tekrarlayan işler, müşteri hizmetleri sohbeti); ve titiz şartname ile doğrulamanın bedelini zaten ödeyenler (çip tasarımı, ilaç keşfi).
İlk iki grup fiyata duyarlı ve muhtemelen öncü modellerin muhakeme gücüne hiç ihtiyaç duymuyor; yazar ucuz donanımda çalışan açık modelleri öneriyor. Onun vardığı sonuç: etkiler öncü laboratuvarların çok ötesine uzanacak.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.