
Yerel modeller artık gerçekten iyi: 2022 model bir Mac'te geliştirici kurulumu
Mühendis Vicki Boykis, yerel modellerin sonunda ajan tabanlı kodlama için yeterince iyi hale geldiğini söylüyor: 64 GB RAM'li 2022 model bir M2 Mac'te öncü modellerin doğruluk ve hızının yaklaşık %75'ine ulaşıyorlar; her oturum Docker'da yalıtılıyor.
Mühendis Vicki Boykis, yerel modeller çıktığından beri onlarla çalışıyor ve 15 Haziran 2026 tarihli yazısında tabloyu özetliyor: sonunda gerçekten iyi oldular. Test makinesi 64 GB RAM ve 1 TB depolamaya sahip 2022 model bir M2 Mac.
Mistral 7B, Gemma 3, OpenAI OSS-20B, Qwen 3 MoE ve Qwen 2.5 Coder gibi diğer Qwen sürümlerini pek çok kurulumda denedi: Open WebUI ile saf llama.cpp, llama-cpp-python, Ollama, llamafiles ve LM Studio.
Yerel modeller bugün nerede
Boykis, GPT-OSS sürümünü dönüm noktası olarak işaretliyor: bir API modeliyle karşılaştırarak doğrulamayı bıraktığı ilk model. Kişisel ölçütü basit — bunu bir API modeliyle doğrulamam gerekiyor mu?
Gemma 4 ailesinin en yeni sürümleriyle nihayet yerelde ajan tabanlı kodlama yapmaya başladı; döngüler, öncü modellerin doğruluk ve hızının yaklaşık %75'inde çalışıyor. Varsayılan yerel modeli LM Studio içindeki gemma-4-26b-a4b. Onunla bir not defteri betiğini beş-altı modüllük bir depoya dönüştürdü, generic tür ipuçlarını düzeltti, blog yazılarını düzeltti, birim testleri yazdı ve boş bir sayfadan two-tower öneri modeli deposu kurdu. K-V önbelleği 64 GB'a kadar büyüyor ve bu görevler altı ay önce yerel modeller için imkânsızdı.
Yerel ajanlar bugün nasıl çalıştırılır
Üç parça gerekiyor: yerel bir çıkarım motoru, bir ajan çatısı ve model dosyası; çatı yerel uç noktaya yönlendirilir. Boykis çatı olarak Pi'yi, çıkarım sunucusu olarak LM Studio'yu kullanıyor ve doğrudan llama.cpp'nin muhtemelen daha hızlı olacağını belirtiyor.
Güvenlik için her Pi oturumu yalnızca bash izni verilen bir Docker konteynerinde çalışıyor; böylece Python kodu çalıştıramıyor ya da web'de gezemiyor. Model olarak gemma-4-12b-qat'ı seçti: daha yeni, daha küçük ve daha hızlı, doğruluktan ciddi bir kayıp olmadan.
Hâlâ çalışmayanlar
Çıkarım yavaş olabiliyor, bağlam pencereleri küçük ve kendi donanımınızla sınırlı, erken sürümler ise istem şablonu uyumsuzluklarından mustarip — gerçi bunlar hızla düzeltiliyor. Ekosistemi LM Studio ve HuggingFace'in Use This Model düğmesi çok kolaylaştırıyor.
Ona göre bu, üretim yazılım geliştirme için henüz hazır değil. Buna karşılık avantaj şeffaflık: token üretimini canlı izleyebilir, bağlam penceresini, sistem istemini ve niceleme ayarlarını değiştirebilir, modelleri birbirine karşı test edebilirsiniz.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.