Geri Dön
Yerel Qwen daha ucuz bir Opus değil, farklı bir araç, diyor OpenFaaS kurucusu
SiTech AI Team2 წთ. საკითხავი

Yerel Qwen daha ucuz bir Opus değil, farklı bir araç, diyor OpenFaaS kurucusu

OpenFaaS kurucusu Alex Ellis, yerel Qwen modellerinin ekibine ne kazandırdığını anlatıyor: dar görevlerde gizlilik ve gerçek tasarruf, uzun soluklu işlerde ise sonsuz döngüler.

OpenFaaS, SlicerVM, Actuated ve Inlets'in arkasındaki kurucu Alex Ellis, küçük bir yazılım şirketinde yerel dil modellerini kullanma deneyimini ayrıntılı biçimde yazdı. Vardığı sonuç, sosyal medyada dolaşan popüler iddiayla çelişiyor: yerel bir Qwen, daha ucuz bir Claude Opus değil; doğru işlere yöneltilmesi gereken farklı bir araç.

Donanımın maliyeti

İlk deneme 2023'te tek bir RTX 3090 kartıydı ve kullanımı o kadar zordu ki deney terk edildi. Qwen 3.5, saklanmaya değer sonuçlar üreten ilk nesildi. Bugün işler 96 GB VRAM'e sahip bir RTX 6000 Pro Blackwell üzerinde yürüyor; kart yaklaşık 12.000 dolara alındı, aynı kart bugün yaklaşık 15.400 dolar. İki akıllı priz duvardaki tüketimi ölçüyor: RTX 6000 Pro çıkarım sırasında yaklaşık 600 W çekiyor ve sessiz kalıyor; iki 3090 ise birlikte 750 W'a yaklaşıyor ve son derece gürültülü.

Kıyaslama farkı gerçek

Qwen 3.6 27B, SWE-Bench Verified testinde 77.2 alırken Claude Opus 4.8 %88.6'da kalıyor. Ellis'e göre kıyaslamalar hareketli bir hedeftir ve modeller bunlara göre ayarlanabilir: SWE-Bench Python sorunlarından oluşurken şirketin kodu Go ile yazılmış. Öncü modellerin 0.5 ile 2 trilyon parametre arasında olduğu tahmin ediliyor; bu, tek bir tüketici ekran kartının tam kalitede tutabileceğinden bambaşka bir kapasite sınıfı. 27B'lik bir modeli tek karta sığdırmak için nicemlemek ise en kötü davranışların ortaya çıktığı yer.

Para nerede geri döndü

Satın almayı iki iş akışı haklı çıkardı. diag adlı araç, bir müşterinin OpenFaaS kurulumunun tam anlık görüntüsünü topluyor; bu görüntü geçici bir VM içinde yerel modelle analiz ediliyor, böylece müşteri verisi bulut sağlayıcısına ulaşmıyor. Ayrıca telemetri veritabanının yerel modelden geçirilmesi, lisansları eksik bildiren ve bir yıldan uzun süre yaklaşık dört-beş kat az ödeme yapan bir müşteriyi ortaya çıkardı; yalnızca bu gelir geri kazanımı kartın bedelini karşıladı.

Döngüler, halüsinasyonlar ve operasyon

Ellis'in sürekli karşılaştığı arıza biçimi döngü: yeni faas-cli komutları önermesi istendiğinde model yarım saat boyunca aynı beş öneriyi yineleyip 600 W tüketti; otomatik kod incelemesinde ise eşzamanlılık sorunları ve yarış koşulları uydurdu ve o deney sona erdi. Modeli sunmak başlı başına bir operasyon sorunu: kimlik, kotalar, yönlendirme, güç izleme ve tam bağlam uzunluğu için iki ayrı llama.cpp örneği. Spekülatif kod çözme, hızı istikrarlı 67'den saniyede 130–200 tokene çıkardı. Tavsiyesi, yerel modelleri destek analizi ve uçtan uca test gibi sınırlı işlerde tutmak ve uzun soluklu görevlerde gözetimsiz bırakmamak. Maliyet de gerçek bir argüman olmayı sürdürüyor: bulut kodlama planları ayda yaklaşık 200 dolar ve Uber kısa süre önce çalışanlarının yapay zekâ harcamasını geliştirici ve araç başına ayda 1.500 dolarla sınırladı.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.