
macOS’ta Gemma 4 ve llama.cpp ile yerel kodlama aracısı kurmak
Kyle Howells, macOS için yerel bir kodlama aracısı kurulumunu belgeliyor: Metal destekli llama.cpp, Gemma 4 26B-A4B, MTP taslak modeli ve Pi. Üretim hızı saniyede 58,2 tokendan 72,2 tokene çıktı.
Kodlama aracısını neden yerelde çalıştırmalı
Kyle Howells birkaç kez interneti kesildiğinde kodlama aracısız kaldı; bu yüzden Multi-Token Prediction için yayımlanan “Gemma 4 artık MTP ile 2 kat hızlı” güncellemesini görünce aracıyı kendi Mac’inde çalıştırmaya karar verdi.
Gereksinimleri pratiktı: gerçekten kullanılacak kadar hızlı olması; diğer araçların da bağlanabilmesi için OpenAI uyumlu bir API sunması; ve mümkünse ekran görüntüsü ile görselleri işleyebilmesi.
Üzerinde karar kıldığı yığın
Son kurulum şöyle: macOS’ta Metal ile derlenmiş llama.cpp, GGUF formatında Gemma 4 26B-A4B, spekülatif çözümleme için Q8 MTP taslak modeli, Gemma 4 çok kipli projeksiyon modülü ve terminal kodlama aracısı olarak Pi. Testler 64 GB birleşik belleğe sahip bir Apple M1 Max üzerinde, macOS 15.7.7 ile yapıldı.
Ana model Unsloth’un Hugging Face deposundaki gemma-4-26B-A4B-it-UD-Q4_K_XL.gguf, yaklaşık 16 GB; taslak model ve projeksiyonla birlikte klasör yaklaşık 17 GB’a çıkıyor. Ölçümlerde unified diff ayrıştıran kompakt bir Python fonksiyonu isteyen tek bir istem kullanıldı ve her çalıştırmada yaklaşık 128 token üretildi.
MTP üretimi yaklaşık %24 hızlandırıyor
Metal hızlandırmalı temel llama.cpp, istem işlemede saniyede 298,0 token ve üretimde 58,2 token elde etti — kullanılabilir, ancak çok sayıda araç çağrısı yapan bir aracı için yavaş. Q8 MTP taslak modelinin eklenmesi üretimi saniyede 72,2 tokene çıkardı. Howells taslak uzunluğunu 1’den 6’ya kadar taradı: en hızlısı 3 oldu (72,2), 2 neredeyse aynıydı (72,0), daha büyük değerler ise 63,7 ve 61,2’ye düştü. İstem işleme neredeyse değişmedi — yaklaşık 296 token/s — ve toplam hızlanma 1,24 kat oldu.
Mac donanımında MLX’in kazanmasını bekleyerek MLX-LM’i de karşılaştırdı: en iyi MLX çalıştırması saniyede 45,8 tokene ulaştı, topluluk 4-bit sürümleri ise daha da yavaştı — 43,9 ve 38,1. gemma-4-swift-mlx üzerinden MTP denemesi başarısız oldu, çünkü 26B 4-bit MLX kontrol noktaları yükleyicinin beklediği ağırlık anahtarlarıyla eşleşmedi.
Görseller, kurulum ve Qwen alternatifi
Ekran görüntüleri için llama.cpp sunucusuna Gemma 4 çok kipli projeksiyon dosyası gerekiyor, çünkü yalnızca 12B model doğal olarak çok kipli; projeksiyon yüklendiğinde sunucu çok kipli desteği duyuruyor ve Pi görsel gönderebiliyor. Pi’nin model kaydına da metin ve görsel birlikte yazılmalı, aksi halde görsel içeren araç çıktısı modele ulaşmıyor. Projeksiyonla yapılan metin testi bir yavaşlama göstermedi.
Derleme standart: Homebrew ile cmake, git, tmux ve Python 3.11 kurun; llama.cpp’yi Metal ve Accelerate açıkken derleyin; modeli, MTP taslağını ve mmproj-BF16.gguf dosyasını indirin; ardından llama-server’ı 127.0.0.1:8080 üzerinde --spec-type draft-mtp, --spec-draft-n-max 3 ve 65.536 token bağlamla başlatın. Böylece Pi’nin models.json dosyasında işaret ettiği OpenAI uyumlu /v1 uç noktası elde edilir.
Sonuç: MTP taslak modeli kullanmaya değer — Gemma 4’ü saniyede 58,2 tokendan 72,2 tokene çıkarıyor ve kurulumu basit tutuyor. Yaygın bir öneri olarak Qwen3.6 35B-A3B’ye geçmeyi de anıyor: bulduğu ölçümlere göre Qwen daha iyi bir kodlama aracısı, ancak daha yavaş — aynı yapılandırmada saniyede yaklaşık 55 token, Gemma 4’ün 72’sine karşı.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.