
Qwen3.8-Flash-Next: Alibaba'nın Qwen ekibi Qwen4 mimarisini tanıttı
Qwen ekibi, 125 milyar parametreli ve yalnızca 6 milyarı etkin açık ağırlıklı Qwen3.8-Flash-Next'i yayımladı; model hibrit seyrek dikkat ve 262 bin token bağlam sunuyor.
Alibaba'nın Qwen ekibi 26 Ağustos'ta Qwen3.8-Flash-Next'i yayımladı: şirketin Qwen4'ün temelini oluşturacağını söylediği, açık ağırlıklı deneysel bir model. Ağırlıklar Hugging Face'te qwen-community-1.0 lisansıyla paylaşıldı ve Transformers, vLLM, SGLang ile TokenSpeed ile uyumlu.
Hibrit dikkat ve QSA
En önemli değişiklik mimaride: Gated DeltaNet ve Gated Attention eşleşmesi, Gated DeltaNet ile Qwen Sparse Attention (QSA) olarak yeniden tasarlandı. QSA tek tek token seçmek yerine ilgili bağlamı mikro blok düzeyinde seçiyor; bu, uzun bağlamlarda gecikmeyi belirgin biçimde düşürüyor. Ekip bunu, ajan tabanlı iş yüklerinin gerçek kullanımda ağırlık kazanması nedeniyle kritik bir kazanım olarak tanımlıyor.
Gated Residual ve n-gram gömme
Gated Residual, genişletilmiş residual akışlarındaki bilgiyi veriye bağlı öğe düzeyinde bir okuma kapısı ve her dal için skaler bir yazma kapısıyla düzenliyor; eğitim kararlılığını korurken ifade gücünü artırıyor. N-gram gömme ise parametre ölçeklemesi için ayrı bir eksen sunuyor: mixture-of-experts'e göre daha az hesaplama gerektiriyor ve belleği kısıtlı hızlandırıcılarda dışarı taşınmaya daha uygun.
Ölçek ve test sonuçları
Modelde 125 milyar parametre var; bunların yalnızca 6 milyarı aynı anda etkin, ayrıca 51 milyar n-gram gömme ve 4 milyar MTP parametresi bulunuyor. 48 katman ve 512 uzmandan (10 yönlendirilen, bir paylaşılan) oluşuyor. Bağlam penceresi doğal olarak 262.144 token ve bir milyona kadar genişletilebiliyor. Yayımlanan sonuçlarda Qwen3.8-Flash-Next SWE-bench Pro'da 62,5; DeepSWE 1.1'de 58,7; SWE-bench Multilingual'de 81,0; NL2Repo-Bench'te 48,1 ve CoWorkBench'te 73,9 puan alıyor.
Geliştiriciler için anlamı
Eğitim tarafında Qwen, Muon ve AdamW iyileştiricilerinin belirli ağırlık kategorilerine uygulandığını, geleneksel parti boyutu ısınmasının kaldırıldığını ve eğitimin doğrudan hedef boyutta başladığını belirtiyor. Üretim sürümü Qwen3.8-Flash bulutta varsayılan bir milyon token bağlamı ve yerleşik araçlarla çalışırken, açık ağırlıklar kendi sunucunuzda çalıştırmak için kalıyor. Teknik rapor Qwen'in GitHub deposunda yayımlandı.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.