
Qwen3.8-27B على بطاقة RTX 3090 واحدة مقابل بطاقتين: زيادة 20% في فك التشفير و14% في الـprefill البارد
قياس شخصي لـQwen3.8-27B في vLLM: بطاقة RTX 3090 واحدة مقابل بطاقتين بنمط tensor parallelism. البطاقة الثانية تضيف 15–30% إلى سرعة فك التشفير و14% في المتوسط إلى الـprefill البارد، أما معظم مكسب الطلبات الدافئة فيعود إلى prefix cache.
النموذج الكثيف Qwen3.8-27B ذو 27.8 مليار معامل، الصادر في 14 أغسطس، يتسع بترميز W4A16 على بطاقة واحدة بسعة 24 جيجابايت. وقد قاس Arsen Apostolov ما تضيفه فعلاً بطاقة RTX 3090 ثانية بنمط tensor parallelism.
بيئة الاختبار
يعمل الخادمان على vLLM مع تفعيل prefix caching، ومن صورة واحدة وبأوزان Qwen3.8-27B-W4A16-AutoRound-fast نفسها. تحتفظ البطاقة الواحدة بـ22.6 جيجابايت من الذاكرة وبسياق يبلغ 131,072 رمزاً، أما الزوج فيوزّع الأوزان على 21.7 جيجابايت لكل بطاقة ويضاعف السياق إلى 262,144 رمزاً. وتضم الآلة ثلاث بطاقات RTX 3090 ومعالجَي Xeon E5-2660 v4 و60 جيجابايت من الذاكرة وUbuntu 26.04.
القياس سكربت من 150 سطراً: طلبات إكمال محادثة بأربعة أحجام (من 600 إلى 9,300 رمز)، كل طلب ثلاث مرات مع أخذ الوسيط، وبإعدادَي max_tokens=256 وtemperature=0. ويحمل كل طلب بارد سطراً أول فريداً حتى لا يطابقه أي prefix مخزّن.
فك التشفير: 15–30% من البطاقة الثانية
تحافظ البطاقة الواحدة على 123–154 رمزاً في الثانية عبر كل الأحجام، بينما يصل الزوج إلى 146–193. بلغ متوسط المكسب 22%+ في هذه الجولة و13%+ في جولة قبلها بساعة، لأن فك التشفير أحادي التدفق يتغير بنحو 10% بين جولتين تفصلهما ساعة. ويترك المؤلف الرقم دون تقريب عن قصد: 15–30%، وتوقّع الحد الأدنى.
الـprefill: البارد للبطاقات والدافئ للذاكرة المؤقتة
الـprefill البارد مرتبط بالحساب: تعالج البطاقة الواحدة 1,100–1,220 رمزاً في الثانية، والزوج 1,230–1,360. ويتصاعد الوقت حتى أول رمز من 0.53 ثانية إلى 8.5 على بطاقة واحدة حين يكبر الطلب من 600 إلى 9,300 رمز، ومن 0.50 إلى 6.9 على بطاقتين — فجوة 6% عند 600 رمز و23% عند 9,300 و14% في المتوسط.
أما الطلبات الدافئة فتحكي قصة أخرى: يعود الطلب المكرر في 0.5–0.75 ثانية على الزوج مقابل 0.5–1.7 ثانية على البطاقة الواحدة؛ وهذا الفارق بمعامل 2–3 يعود إلى prefix cache لا إلى العتاد. والدليل حسابي: 8,600 رمز في 0.56 ثانية تعني 15,000 رمز في الثانية، عشرة أضعاف ما تقدّمه بطاقتان من طراز 3090 على نموذج 27B.
كم يبلغ الثمن
عندما تقدّم الحاويتان الخدمة تسحب الآلة 620 واط من المقبس. ومليون رمز ناتج بسرعة 150 رمزاً في الثانية يستغرق نحو 6,667 ثانية، أي 1.15 كيلوواط ساعة — وبتعرفة بلغاريا المزدوجة يبلغ 0.34 BGN نهاراً أو 0.21 BGN ليلاً، أي نحو 0.20 أو 0.12 دولار. وتُدرج DeepInfra سعر Qwen3.8-27B عند 3.00 دولارات لكل مليون رمز ناتج.
لا يزعم Apostolov أن هذا يجعل الواجهة صفقة سيئة: فسعرها يشمل طاقة مركز البيانات وتبريده وسعته العاطلة. النقطة الأضيق أن كل رمز يُقدَّم على عتاد يعمل أصلاً هو هامش شبه صافٍ. ويشير أيضاً إلى حدود الاختبار — قياس لطلب واحد، ولم يُختبر continuous batching.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.