
تحدي شهر واحد مع GLM 5.3 Flash ينتهي بنسبة 50% استخدام
محاولة لمدة شهر لإنجاز جميع مهام الذكاء الاصطناعي باستخدام GLM 5.3 Flash انتهت باستخدام نصف 2B رمز. كشفت الاختبارات عن تكاليف النماذج الأولية وقيود مقدمي الخدمة وأهمية قياس الكفاءة.
توزيع الاستخدام وتكاليف النموذج الأولي
تجربة أجريت في سبتمبر باستخدام نموذج مفتوح فعال أعطتنا مؤشر استخدام بنسبة 50%. من أصل 2B رمز، تمت معالجة 1B فقط باستخدام GLM 5.3 Flash، رغم أنه أنجز جميع المهام في النصف الأول من الشهر. استخدامه المبلغ عنه بقي ضمن ميزانية 68 دولاراً، حوالي 4kWh من الطاقة و365 غرام من انبعاثات الكربون. النصف الثاني تطلب 1B رمز على نماذج أخرى.
شيء غير متوقع واحد اتصل بخادم Wagtail MCP التجريبي، الذي وُصف بأنه نموذج أولي vibe-coded. اختيار النموذج تسبب في استهلاك 450M رمز و150 دولاراً و5kWh من الطاقة في ليلة واحدة تقريباً. كان الخادم يعمل بشكل جيد وأظهر إمكانيات، رغم أن الفريق قيّم أن تحقيق نتائج مشابهة كان يمكن أن يتم بربع التكلفة وبجهد إضافي صغير. هذه الحلقة أظهرت مرة أخرى أن التخطيط للميزانية واختيار النماذج بعناية أمران ضروريان للتجارب.
توفر البنية التحتية
كان توفر مقدمي الخدمة مشكلة أخرى. مقدمو الاستدلال الذين استخدمهم الفريق كانوا يعملون غالباً، لكن الخيار الشائع لم يكن يملك قوة مماثلة للمختبرات الكبيرة. أظهر GLM 5.3 Flash تدهوراً في الأداء، ربما لأن عمل الفريق كان مرتفعاً على جبهة Pareto. الخيار المتاح كان أيضاً محصوراً بالنماذج المفتوحة المعتمدة في مراكز البيانات الأوروبية. هذا تسبب في التحول إلى نماذج مشابهة، DeepSeek V4.1 Flash وQwen 3.8 Flash، تغيير بسيط لم يكونوا يتوقعونه.
القيمة في التطوير الروتيني
استخدام نموذج واحد للهندسة الروتينية لم يلغِ الحاجة لاختبار خيارات واسعة. يبدأ الفريق بتقييم النماذج على مهام Wagtail ويحتاج إلى بيانات قابلة للمقارنة ليوصي بخيارات أخف لقدرات الوكيل ونموذج أولي جديد لـ CLI مصمم للعمل بشكل جيد مع الوكلاء.
تم تقييم GLM 5.3 Flash بشكل ممتاز على أي حال للعمل الإنتاجي بسبب نافذة السياق 1M رمز ودعم الرؤية وتوفره لدى عدة مقدمي خدمة. تم استخدامه على Wagtail والمواقع المبنية به، وعلى مهام UI، وأبحاث الذكاء الاصطناعي والتطوير، والتوثيق والمراجعات.
دروس للاختبار التالي
تحدي أكتوبر سيستمر فقط على العمل الإنتاجي الروتيني، وليس على البحث والتطوير. التغييرات المخططة تشمل الإبلاغ المحلي المستمر عن استخدام الرموز واستهلاك الطاقة والتكاليف والنتائج المحددة. يخطط الفريق أيضاً لوضع ميزانيات منفصلة للتجارب، وتحسين اختيار المطالبات، واستخدام سير عمل متعدد الوكلاء قائم على الأدوار، ومواصلة اختبار النماذج الفعالة.
الهدف الأوسع هو أن معظم عمل استدلال الذكاء الاصطناعي يستخدم نموذج flash-tier رخيصاً واحداً أو اثنين، وأن يتم تقييم التقدم ليس فقط بعدد الرموز بل بالتكلفة أو استهلاك الطاقة. سيراقب الفريق أيضاً نماذج الانتشار لحل المشكلات بأسلوب Jev، إذا كانت تعمل بفعالية، بينما تبدو النماذج الرائدة الأحدث خطوة في الاتجاه الصحيح.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.