
Yerli Qwen ucuz Opus deyil, fərqli alətdir — OpenFaaS qurucusunun nəticəsi
OpenFaaS qurucusu Aleks Ellis izah edir ki, yerli Qwen modelləri komandasına nə qazandırdı: dar tapşırıqlarda məxfilik və real qənaət, uzunmüddətli işlərdə isə sonsuz döngələr.
OpenFaaS, SlicerVM, Actuated və Inlets-in arxasındakı qurucu Aleks Ellis kiçik bir proqram şirkətində yerli dil modellərindən istifadə təcrübəsini ətraflı yazıb. Onun nəticəsi sosial şəbəkələrdə yayılmış iddiaya ziddir: yerli Qwen daha ucuz Claude Opus deyil, düzgün işlərə yönəldilməli olan fərqli bir alətdir.
Avadanlıq nə qədər başa gəldi
İlk cəhd 2023-cü ildə tək RTX 3090 kartı idi və istifadəsi o qədər çətin oldu ki, təcrübə dayandırıldı. Qwen 3.5 saxlanmağa dəyər nəticələr verən ilk nəsil oldu. Bu gün işlər 96 GB VRAM-li RTX 6000 Pro Blackwell üzərində gedir; kart təxminən 12 000 dollara alınıb, indi eyni kart təqribən 15 400 dollardır. İki ağıllı rozetka divardakı istehlakı ölçür: RTX 6000 Pro inferens zamanı təxminən 600 Vt çəkir və sakit qalır, iki 3090 isə birlikdə 750 Vt-a yaxınlaşır və çox səs-küylüdür.
Benchmark fərqi realdır
Qwen 3.6 27B SWE-Bench Verified testində 77.2 bal toplayır, Claude Opus 4.8 isə 88.6% göstərir. Ellisin fikrincə, benchmarklar hərəkətli hədəfdir və modelləri onlara uyğunlaşdırmaq mümkündür: SWE-Bench Python məsələlərindən qurulub, şirkətin kodu isə Go ilə yazılıb. Aparıcı modellərin 0.5–2 trilyon parametr aralığında olduğu təxmin edilir — bu, tək istehlakçı qrafik kartının tam keyfiyyətlə saxlaya biləcəyindən tamam fərqli tutum sinfidir. 27B modeli bir karta sığdırmaq üçün kvantlaşdırma isə ən pis davranışların ortaya çıxdığı yerdir.
Pul harada geri qayıtdı
Alışı iki iş axını doğruldu. diag adlı alət müştərinin OpenFaaS quraşdırmasının tam görüntüsünü toplayır; bu görüntü müvəqqəti VM-də yerli modellə analiz edilir, beləliklə müştəri məlumatları bulud provayderinə çatmır. Bundan başqa, telemetriya bazasının yerli modeldən keçirilməsi lisenziyaları natamam bildirən və bir ildən çox müddətdə dörd-beş dəfə az ödəyən bir müştərini üzə çıxardı; yalnız bu gəlirin bərpası kartın dəyərini ödədi.
Döngələr, halüsinasiyalar və əməliyyat
Ellisin daim rastlaşdığı nasazlıq döngədir: faas-cli üçün yeni əmrlər təklif etməsi istənəndə model yarım saat ərzində eyni beş təklifi təkrarladı və 600 Vt sərf etdi; avtomatik kod baxışında isə eyni vaxtlılıq problemləri və race condition uydurdu və həmin təcrübə bununla bitdi. Modelin xidməti özlüyündə əməliyyat məsələsidir: kimlik, kvotalar, marşrutlaşdırma, enerji monitorinqi və tam kontekst üçün iki ayrı llama.cpp nüsxəsi. Spekulyativ dekodlaşdırma sürəti sabit 67-dən saniyədə 130–200 tokenə qaldırdı. Tövsiyəsi budur: yerli modelləri dəstək analizi və end-to-end test kimi sərhədli işlərdə saxlayın və uzunmüddətli tapşırıqlarda nəzarətsiz buraxmayın. Xərc də real arqument olaraq qalır: bulud kodlaşdırma planları ayda təxminən 200 dollardır və Uber bu yaxınlarda işçilərin AI xərclərini hər tərtibatçı və hər alət üçün ayda 1 500 dollarla məhdudlaşdırdı.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.