
Qwen المحلي ليس Opus أرخص بل أداة مختلفة، بحسب مؤسس OpenFaaS
يشرح أليكس إيليس، مؤسس OpenFaaS، ما حققته نماذج Qwen المحلية لفريقه فعليًا: خصوصية وتوفير حقيقي في المهام الضيقة، لكن حلقات لا نهائية وهلوسة في مراجعة الشيفرة خلال العمل الطويل.
نشر أليكس إيليس، المؤسس وراء OpenFaaS وSlicerVM وActuated وInlets، تقريرًا مطوّلًا عن استخدام نماذج لغوية محلية داخل شركة برمجيات صغيرة. وتخالف نتيجته الادعاء الشائع على الشبكات الاجتماعية: نموذج Qwen المحلي ليس نسخة أرخص من Claude Opus، بل أداة مختلفة يجب توجيهها إلى المهام المناسبة.
كم كلّفت العتاد
كانت المحاولة الأولى بطاقة RTX 3090 واحدة عام 2023، وتبيّن أن استخدامها صعب لدرجة التخلي عن التجربة. وكان Qwen 3.5 أول جيل ينتج نتائج تستحق الاحتفاظ بها. اليوم يجري العمل على بطاقة RTX 6000 Pro Blackwell بذاكرة 96 GB، اشتراها الفريق بنحو 12,000 دولار؛ وسعر البطاقة نفسها اليوم يقارب 15,400 دولار. ويقيس مقبسان ذكيان الاستهلاك عند الجدار: تسحب البطاقة نحو 600 واط أثناء الاستدلال وتبقى هادئة، بينما تستهلك بطاقتا 3090 معًا قرابة 750 واط وتصدران ضجيجًا شديدًا.
الفارق في الاختبارات حقيقي
يحقق Qwen 3.6 27B نتيجة 77.2 في اختبار SWE-Bench Verified مقابل 88.6% لـ Claude Opus 4.8. ويرى إيليس أن الاختبارات هدف متحرك يمكن ضبط النماذج لتحسين نتيجتها فيه، إذ بُني SWE-Bench على مشكلات Python بينما شيفرة الشركة مكتوبة بلغة Go. وتُقدَّر النماذج الرائدة بنطاق يتراوح بين 0.5 و2 تريليون معامل، وهو حجم من فئة مختلفة عما يمكن لبطاقة رسوميات استهلاكية أن تحمله بجودة كاملة. والتكميم لتقليص نموذج بحجم 27B إلى بطاقة واحدة هو تحديدًا موضع أسوأ السلوكيات.
من أين عاد المال
برّر الشراء سير عمل اثنان. أداة diag تجمع صورة كاملة لتنصيب OpenFaaS عند العميل، ثم يحللها نموذج محلي داخل آلة افتراضية مؤقتة، فلا تصل بيانات العملاء إلى مزود سحابي. وبشكل منفصل، كشف تمرير قاعدة بيانات القياس عن بعد عبر النموذج المحلي عميلًا كان يصرّح بعدد تراخيص أقل ويدفع أقل بنحو أربعة إلى خمسة أضعاف لأكثر من عام، وهو استرداد وحده غطّى ثمن البطاقة.
الحلقات والهلوسة والتشغيل
نمط الفشل المتكرر عند إيليس هو الحلقة: عندما طُلب من النموذج اقتراح أوامر جديدة لأداة faas-cli، أعاد الاقتراحات الخمسة نفسها لمدة نصف ساعة وهو يستهلك 600 واط، وفي مراجعة الشيفرة الآلية اخترع مشكلات تزامن وحالات تسابق، ما أنهى تلك التجربة. وتشغيل النموذج نفسه مشكلة عملياتية: الهوية والحصص والتوجيه ومراقبة الطاقة ونسختان مستقلتان من llama.cpp للحفاظ على طول السياق الكامل. ورفع الفك التخميني السرعة من 67 مستقرة إلى 130–200 رمز في الثانية. ونصيحته هي إبقاء النماذج المحلية في مهام محدودة مثل تحليل الدعم واختبارات من الطرف إلى الطرف، وعدم تركها دون إشراف في المهام الطويلة. وتبقى الكلفة حجة واقعية أيضًا: خطط البرمجة السحابية تقارب 200 دولار شهريًا، وحدّت Uber مؤخرًا إنفاق الموظفين على الذكاء الاصطناعي عند 1,500 دولار لكل مطوّر ولكل أداة شهريًا.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.