العودة
Muon: ماذا يحدث عندما يتعامل محسّن نماذج اللغة مع مصفوفة الأوزان كمصفوفة
SiTech AI Team3 წთ. საკითხავი

Muon: ماذا يحدث عندما يتعامل محسّن نماذج اللغة مع مصفوفة الأوزان كمصفوفة

يشرح مقال منشور على dev.to كيف يستبدل Muon تحديثات AdamW الإحداثية بهندسة مصفوفية متعامدة، وكيف انتقلت تجربة من مسابقة السرعة عام 2024 إلى حزمة PyTorch القياسية، وما الذي يعنيه ذلك للمطوّرين.

يتعامل Muon مع مصفوفة أوزان الشبكة العصبية كمصفوفة، لا ككومة مسطّحة من الإحداثيات القياسية. يحتفظ AdamW بمتوسط متحرك لكل عنصر ويطبّع الإحداثيات بشكل مستقل، بينما يأخذ Muon تحديث الزخم ويطرح مقادير القيم المفردة ويحتفظ بالاتجاهات، مقرّباً هذه العملية ببضع تكرارات من Newton–Schulz. ويتتبّع شرح منشور على dev.to مسار هذه الفكرة.

تحتوي مصفوفة أوزان بمقاس 4096×4096 في نموذج transformer على أكثر من 16 مليون قيمة: يرى AdamW فيها 16 مليون إحداثي، بينما يرى Muon تحويلاً خطياً باتجاهات ذات معنى.

يحوّل Muon تحديثاً مثل U diag(20, 3, 0.2) V^T إلى ما يقارب U diag(1, 1, 1) V^T: Ortho(G) ≈ UV^T. تبقى الاتجاهات وتتساوى المقادير.

ظهرت الفكرة علناً في أكتوبر 2024 خلال مسابقة السرعة NanoGPT. في 15 أكتوبر 2024 حقّقت تجربة قائمة على Muon رقماً قياسياً في سرعة التدريب محسّنةً النتيجة السابقة بنحو 35%؛ كما أظهرت التجارب الأولى أن Q وK وV تعمل بشكل أفضل كمصفوفات منفصلة.

Newton–Schulz بدلاً من SVD

سيكون حساب SVD كامل عند كل خطوة تحسين بطيئاً جداً، لذلك لا يحسبه Muon إطلاقاً. يقسم المصفوفة على معيار Frobenius ثم يطبّق متعددة حدود مراراً — X_next = aX + b(XX^T)X + c(XX^T)²X — بمعاملات مضبوطة وعادةً عبر خمس تكرارات. ولأن متعددة الحدود تؤثر في القيم المفردة فقط، فهي تتقارب نحو 1 بينما تبقى المتجهات المفردة في مكانها؛ وتعمل العملية كلها بكفاءة في bfloat16، والتكلفة الإضافية نحو 0.5% في مثال الكاتب.

من سباق السرعة إلى تدريب النماذج الفعلية

عالجت Moonshot AI مسألة التوسّع في ورقة 2025 بعنوان “Muon is Scalable for LLM Training”. يعتمد سلوك RMS للمصفوفة المُتعامدة على أبعادها، لذا توائم قاعدة Moonshot قيمة RMS لتحديث Muon مع AdamW؛ وأفادت تجاربهم بكفاءة حسابية تبلغ نحو 2× في التدريب الأمثل حسابياً وبأداء مماثل بنحو 52% من FLOPs نظرائهم على AdamW. كما درّبوا Moonlight، نموذج mixture-of-experts بحجم 3B/16B، على 5.7 تريليون رمز.

تختلف الذاكرة أيضاً: تحتفظ محسّنات من نوع Adam بمَوثِّرَي moment لكل معامل، بينما تحتوي الحالة الأساسية في Muon على مخزن زخم واحد — نحو 400 GB بدلاً من 800 GB عند 100B معامل. وتوثّق PyTorch الآن الوحدة torch.optim.Muon بعدة أنماط لمقياس التحديث، وأضاف فريق DeepSpeed الدعم في يونيو 2026.

استبدال AdamW في كل مكان ليس الهدف: يستهدف Muon مصفوفات الأوزان المخفية ثنائية الأبعاد، بينما تبقى embeddings والانحيازات ومعاملات LayerNorm ورؤوس الإخراج على AdamW. ولا يُنصح بنسخ الأمثلة المبكرة ذات معدل التعلّم الثابت 0.02 بشكل أعمى، لأن قواعد القياس لدى Jordan وMoonshot وBernstein تختلف.

في مقارنة مضبوطة تبقى البنية والبيانات والرموز وحجم الدفعة والعتاد ثابتة، ويُقاس validation loss مقابل الرموز وFLOPs وساعات GPU. ويحمل المُحسِّن افتراضات حول ماهية المعامل: يعتبره Adam إحداثيات، بينما يعتبره Muon مؤثرات خطية.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.