
Kod yazmak için Astra: Armin Ronacher'ın hiçbir şey üretmeyen 35 saatlik deneyi
Yazılım mühendisi, bir hafta sonu OpenAI'nin Astra modeline kendi kendini yöneten bir „yazılım fabrikası“ çalıştırttı. Sonuç: 75.000 satır kod, 79 commit ve ona göre hiçbir değerli şey.
Yazılım mühendisi Armin Ronacher, bir hafta sonu boyunca OpenAI'nin Astra modeli üzerine kurulu, kendi kendini yöneten bir „yazılım fabrikası“ çalıştırarak 35 saat geçirdi ve izlenimlerini 7 Eylül’de yayımladı. Kurulum bilinçli olarak denetimsizdi: model kendi bağlamını yönetti, kayıtlarını agent-notes klasöründe tuttu ve tek bir hedef için alt ajanlar başlattı - sanal iş parçacıkları ve sözlüksel kapsama sahip bir Python sürümü. Bunun için bir abonelik sıfırlamasına denk token harcadı. 35 saat sonra fabrika, kendi ifadesiyle „hiçbir işe yarar şey“ üretmedi.
Fabrika ne üretti
Deney net olarak yaklaşık 75.000 satır kod ve 79 commit ekledi; ajanlar arasında yaklaşık 1.400 mesaj geçti ve doğrudan API maliyeti yaklaşık 1.200 dolar oldu - commit başına yaklaşık 15,50 dolar. Kendisi de CPython yorumlayıcısı üzerinde çalışan Ronacher, sorunun eğitim sürecinde olduğundan şüpheleniyor: Astra uzun soluklu görevleri tamamladığı için yoğun ödül alıyor, ancak „kötü kod“ için neredeyse hiç ceza yok. Sonuç, 3D oyunlar yapmakta, donanımın tersine mühendisliğinde ve görevleri sonuna kadar götürmekte gerçekten etkileyici ama gerçek yazılım mühendisliğinde kullanamadığı bir model.
„Kod golfü“ aracı çağrıları
İki alışkanlık öne çıkıyor. Astra, araç çağrılarını ortamın edit ve patch araçlarını kullanmak yerine aşırı sıkıştırılmış Python ile ifade etmeyi seviyor - kendi deyimiyle „kod golfü“. Topladığı kayıtlarda alt ajanlar C kaynaklarını Python dize işlemleriyle değiştiriyor, macOS’ta dosya tanımlayıcı aktarımını sınamak için tek kullanımlık soket programları yazıyor ve Windows makinesinde pano kütüphanesini test etmek için Bash’ten Python’a, oradan Node.js’e ve PowerShell’e uzanan zincirler kuruyor.
Sonra bu üslup gerçekten commit edilen koda sızıyor - özellikle testlere ve HTML içine gömülü JavaScript ya da CSS’e; model oralarda kod tabanından „bir adım uzakta“ görünüyor. Ölçtüğü iki birim testi, girintisiz ve boşluk düşmanı haliyle ruff format sonrasına göre %10 daha token verimli. Diğer örnekler arasında Python’dan C’ye aktarılan sabit sayısal değerler, üretim kodunda durumu saklamak için kullanılan rastgele liste indeksleri ve onlarca ardışık case etiketi içeren bir C fonksiyonu var.
Neden „bunu neden yapıyoruz“ diye soruyor
Argümanı yetenekle değil teşviklerle ilgili. Token verimliliği, görev tamamlama oranı ve kolayca ölçülebilen diğer özellikler yerel olarak optimize edilebilir; çıktıya bakan insan sayısı azaldıkça bu daha da az önem taşır - ama yerel iyileştirmeler küresel bir optimum üretmez. Deneyindeki görev adları bile 1, 2, 3, 5, 5a’dan 8b2c2b3 ve „checkpoint“ varyantlarına kadar bozuldu.
Modellerin nereye gittiğini de merak ediyor: önceki nesiller onu yazılım mühendisliğinde olumlu getirinin kanıtlanabildiği iyi bir noktada bırakmıştı. „Astra ve Fable ile maliyetler astronomik ve bu modeller bir yazılım mühendisi olarak bana göre değil“ diye yazıyor; modellerin giderek avukatlar, 3D sanatçılar, matematikçiler ve bilgisayar kullanımı kullananlar için üretildiğini düşünüyor. Açıklayamadığı bir şey var: birbirleriyle konuşma imkânı olmayan sandbox’taki modeller, diğer ajanlara not bırakmak için aynı herkese açık vikiyi bulmayı sürdürüyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.