هل تريد استخدام OpenRouter؟ دروس من 18 مليون رسالة
يشرح مؤلف مساعد يعمل داخل iMessage لماذا يتصرف النموذج المفتوح نفسه بشكل مختلف عند كل مزوّد: فوارق تصل إلى 20 نقطة في القياسات، ونقاط رؤية عمياء، وردود 200 OK فارغة.
النموذج ليس المزوّد
نشر Mo Moustafa، الذي يدير Olly، مساعداً ذكياً يعيش داخل iMessage، دليلاً عملياً لاستخدام OpenRouter. وقد عالج Olly أكثر من 18 مليون رسالة، نحو ثلثها على نماذج مفتوحة عبر الخدمة؛ وهو حجم كافٍ، على حد قوله، لتظهر كل حالة حدودية مرة واحدة على الأقل. مصطلحاته واضحة: النموذج هو الأوزان، أما المزوّد فهو من يوجّهك OpenRouter إليه، ويستضيف تلك الأوزان على وحدات معالجة خاصة، بالدقة التي يختارها، وبمحللاته الخاصة، وبالتالي بقائمة أخطائه الخاصة. وعند طلب deepseek/deepseek-v4-flash تحصل على واحدة من نحو 20 شركة. "النموذج نفسه على الورق، لكنه نماذج مختلفة تماماً في الواقع".
القياسات والرؤية ومفتاح effort
تنشر OpenRouter قياسات لكل مزوّد على الأوزان ذاتها. في لوحة DeepSeek V4 Flash 0731 بتاريخ 7 أيلول/سبتمبر سجّل DeepSeek الأصلي 90% في GPQA Diamond و81% في TAU-Bench Airline، وهي مهمة استدعاء أدوات، بينما سجّل DigitalOcean 75% و58%. ويقل معظم المضيفين بخمس إلى سبع نقاط عن المزود الأصلي في استدعاء الأدوات، بينما ينهار أربعة منهم في المعرفة؛ وفي تموز/يوليو سجّل Fireworks نسبة 46% في TAU بفارق 30 نقطة. والرؤية متفاوتة بالقدر نفسه: عند إرسال ثلاث صور صغيرة إلى كل مضيف لنموذجَي رؤية مفتوحين، قرأ نقطة Qwen لدى DeepInfra حرف K على أنه R، ووصف الأحمر بالأزرق، ووصف كلمة "umbrella" بأنها "funny"، في حين أصابت أربعة مضيفين آخرين بالأوزان نفسها كل شيء. ولم يرَ Venice وTogether صور MiniMax إطلاقاً، ومع ذلك أعادا 200 OK. ويُقبل reasoning.effort في كل مكان لكنه لا يُحترم في كل مكان: إذ يتجاهله عملياً digitalocean وgmi-cloud وmancer وvenice.
التكميم والتحليل والردود الفارغة
التصفية حسب الدقة المعلنة لا تشتري الجودة. بعد شهر من تشغيل فلتر fp8 على DeepSeek، استقرّ مضيفو fp4 في وسط مجموعة fp8، وكانت أسوأ ثلاث نتائج في GPQA لمضيف fp4 وآخر fp8 وثالث لا يعلن شيئاً؛ وفي GLM لا يعلن الأفضل في اللوحتين شيئاً على الإطلاق. الدقة مؤشر سيئ للجودة، والفلتر الصارم يقلّص أيضاً مجموعة الخيارات التي يمكن لـ OpenRouter الرجوع إليها. وتظهر أخطاء المحلل كنص خام في الرد، لذا ينتقل التحليل إلى جانب المطوّر. وتختبئ الأعطال أيضاً خلف رموز النجاح: قد يعيد نموذج استدلالي رمز HTTP 200 مع content: null وfinish_reason "stop" بعد 345 رمزاً، وبعض النقاط لا تعيد كائن usage إطلاقاً. وفي تموز/يوليو شكّل StreamLake نحو 20% من حركته على DeepSeek و92% من ردوده الفارغة.
قواعد السياق والاختبار والتثبيت
العقد مرتبط بالمزوّد لا بالنموذج: يعيد SiliconFlow رمز 400 مع الكود 20015 عندما يصل سياق وضع التفكير مع reasoning فارغ، بينما يقبل Baidu وAlibaba وCloudflare السياق نفسه. ويجب الاختبار من بيئة الإنتاج لا من حاسوب محمول: فقد عمل Venice وNovita من جهاز Moustafa، لكن كل طلب تقريباً من بنيته التحتية في الدقيقة نفسها وبالمفتاح نفسه حصل على 429. وتثبيت المزوّد ليس أماناً أيضاً: مع تثبيت cloudflare وbaidu وalibaba وتعطيل البدائل فشلت الثلاثة في النهاية، وسقط أفضل نموذج في OpenRouter مع Olly.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.