
macOS-da Gemma 4 və llama.cpp ilə yerli kodlaşdırma agentini necə qurmaq olar
Kayl Haouells macOS üçün yerli kodlaşdırma agenti yığımını təsvir edir: Metal ilə llama.cpp, Gemma 4 26B-A4B, MTP ehtiyat modeli və Pi. Generasiya sürəti saniyədə 58,2 tokendən 72,2 tokene qalxdı.
Kodlaşdırma agentini niyə yerli işlətmək lazımdır
Kayl Haouells bir neçə dəfə internet kəsiləndə kodlaşdırma agenti olmadan qaldı; buna görə Multi-Token Prediction üçün yayımlanan “Gemma 4 artıq MTP ilə 2 dəfə sürətlidir” yeniləməsini görəndə agenti öz Mac-ında işlətməyə qərar verdi.
Tələblər praktik idi: həqiqətən istifadə oluna biləcək sürət; digər alətlərin də qoşulması üçün OpenAI uyğun API; və mümkünsə ekran şəkli ilə təsvirləri emal etmə qabiliyyəti.
Hansı yığımda dayandı
Yekun konfiqurasiya belədir: macOS-da Metal ilə qurulmuş llama.cpp, GGUF formatında Gemma 4 26B-A4B, spekulyativ dekodlaşdırma üçün Q8 MTP ehtiyat modeli, Gemma 4-ün multimodal proyektoru və terminal kodlaşdırma agenti kimi Pi. Testlər 64 GB vahid yaddaşa malik Apple M1 Max-da, macOS 15.7.7 ilə aparıldı.
Əsas model Unsloth-un Hugging Face deposundakı gemma-4-26B-A4B-it-UD-Q4_K_XL.gguf faylıdır, təxminən 16 GB; ehtiyat model və proyektorla qovluq təxminən 17 GB-a çatır. Ölçmələrdə unified diff-i analiz edən kompakt Python funksiyası tələb edən bir sorğu istifadə edildi və hər işə salmada təxminən 128 token yaradıldı.
MTP generasiyanı təxminən 24% sürətləndirir
Metal sürətləndirməli əsas llama.cpp sorğu emalında saniyədə 298,0 token, generasiyada 58,2 token verdi — istifadə edilə bilər, lakin çoxsaylı alət çağırışı edən agent üçün yavaş. Q8 MTP ehtiyat modelinin əlavə edilməsi generasiyanı saniyədə 72,2 tokenə qaldırdı. Haouells ehtiyat uzunluğunu 1-dən 6-ya qədər sınadı: ən sürətlisi 3 oldu (72,2), 2 demək olar ki, eyni idi (72,0), daha böyük dəyərlər isə 63,7 və 61,2-yə düşdü. Sorğu emalı demək olar ki, dəyişmədi — təxminən 296 token/san — ümumi sürətlənmə isə 1,24 dəfə oldu.
Mac aparatında MLX-in qalib gələcəyini gözləyərək MLX-LM ilə də müqayisə etdi: ən yaxşı MLX işə salması saniyədə 45,8 tokenə çatdı, icma 4-bit versiyaları isə daha yavaş idi — 43,9 və 38,1. gemma-4-swift-mlx vasitəsilə MTP cəhdi uğursuz oldu, çünki 26B 4-bit MLX yoxlama nöqtələri yükləyicinin gözlədiyi çəki açarları ilə uyğun gəlmədi.
Təsvirlər, quraşdırma və Qwen alternativi
Ekran şəkilləri üçün llama.cpp serverinə Gemma 4-ün multimodal proyektoru lazımdır, çünki yalnız 12B model təbii olaraq multimodaldır; proyektor yüklənəndə server multimodal dəstəyini elan edir və Pi təsvir göndərə bilir. Pi-nin model qeydində də mətn və təsvir birlikdə göstərilməlidir, əks halda təsvirli alət çıxışı modelə çatmır. Proyektorla mətn ölçməsi yavaşlama göstərmədi.
Qurma standartdır: Homebrew ilə cmake, git, tmux və Python 3.11 quraşdırın; llama.cpp-ni Metal və Accelerate aktiv şəkildə kompilyasiya edin; modeli, MTP ehtiyatını və mmproj-BF16.gguf faylını yükləyin; sonra llama-server-i 127.0.0.1:8080 ünvanında --spec-type draft-mtp, --spec-draft-n-max 3 və 65 536 token kontekstlə başladın. Beləcə Pi-nin models.json faylında göstərdiyi OpenAI uyğun /v1 son nöqtəsi alınır.
Nəticə: MTP ehtiyat modeli istifadəyə dəyər — Gemma 4-ü saniyədə 58,2 tokendən 72,2 tokenə qaldırır və konfiqurasiyanı sadə saxlayır. O, tez-tez səslənən Qwen3.6 35B-A3B təklifini də qeyd edir: tapdığı ölçmələrə görə Qwen daha yaxşı kodlaşdırma agentidir, lakin daha yavaşdır — eyni konfiqurasiyada saniyədə təxminən 55 token, Gemma 4-ün 72-sinə qarşı.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.