
Qwen3.6 27B: yerel geliştirme için pratik bir tatlı nokta
Quesma blogunda yayımlanan bir yazı, yoğun 27B modelinin dizüstü bilgisayarda iyi çalıştığını, gerçek görevlerde daha hızlı MoE sürümünü geçtiğini ve 2025 ortası ön saf benchmark seviyesine ulaştığını savunuyor.
Yerel dil modelleri günlük işler için uzun süre ciddi bir seçenek sayılmadı, ancak Quesma blogunda yayımlanan bir yazı Qwen3.6 27B'yi düzenli kullanmaya değer ilk model olarak tanımlıyor. Model iki biçimde geliyor: daha hızlı olan uzman karışımı Qwen3.6 35B A3B ve yazarın daha yavaş ama daha yetenekli bulduğu ve önerdiği yoğun Qwen3.6 27B.
Yazar neleri test etti
Alışılmış yaratıcı yazma denemelerinin yanı sıra modelden OpenCode üzerinden pnpm ile altıgen bir mayın tarlası oyunu yapması istendi. Model tek bir komutla, ilk denemede düzgün bir Node paketiyle çalışan bir proje üretti. Daha hızlı 35B A3B ise paket oluşturma talimatını yok sayıp her şeyi tek bir index.html dosyasına koydu. Mum dükkânı açılış sayfası için verilen daha uzun komut birkaç dakika çalıştı ve makul varsayılanlarla uyumlu bir sayfa döndürdü. Yazarın değerlendirmesi: ön saf modellerin ölçütlerine göre sıradan, ama artık işe yarar bir sonuç.
Yerelde çalıştırma
Kurulum Ollama yerine llama.cpp'ye dayanıyor ve Hugging Face'ten 8 bitlik bir niceleme alıyor: unsloth'un çoklu token tahminini (MTP) destekleyen Qwen3.6-27B-MTP-GGUF Q8_0 sürümü. Tek bir llama-server komutu modeli MTP taslağıyla, tüm katmanlar GPU'da, flash attention açık, 64k bağlam ve sabitlenmiş portla başlatıyor; modelin doğal bağlamı 256k. 8 bitlik niceleme BF16 sürümünün boyutunu neredeyse kalite kaybı olmadan yarıya indiriyor; 4 bitlik sürüm ise 18 GB'ın altında kalıyor ve 32 GB'lık bir cihaza sığıyor.
Performans ve konum
128 GB birleşik belleğe sahip bir MacBook M5 Max'te model saniyede yaklaşık 30 token üretiyor — ön saf API aralığının içinde — ve GPU'nun yaklaşık yüzde 95'ini kullanıyor. llama.cpp, Apple silicon için özel hazırlanmış olmasına rağmen mlx-lm'den daha hızlı çıktı ve iki Qwen3.6 sürümü de 48 GB bellek içinde kalıyor. Tüketici sınıfı bir Nvidia RTX 5090'da bir Hacker News kullanıcısı, Q6_K niceleme ve Q4_0 KV önbelleğiyle 123k bağlamda saniyede yaklaşık 50 token bildirdi. Artificial Analysis zekâ endeksinde 27B 37 puan alıyor; yazı bunu 2025 ortası ön saf kalitesine denk görüyor — 32 puanlı 35B A3B ve 29 puanlı Gemma 4 31B'nin önünde. Yazar yine de 27B'yi tercih ediyor: üçte biri kadar kod, ama daha yüksek kalitede. Daha geniş argümanı ise şu: yerel modeller ince ayara açık, ellerinden alınamaz ve hassas veriler için uygundur.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.