
Muon: Bir LLM Optimizatörü Ağırlık Matrisini Matris Gibi Görürse Ne Olur
dev.to'da yayımlanan bir açıklama, Muon'un AdamW'nin koordinat bazlı güncellemelerini ortogonalleştirilmiş matris geometrisiyle değiştirmesini ve 2024 hız yarışı deneyinin PyTorch'a girişini anlatıyor.
Muon, bir sinir ağının ağırlık matrisini düz bir skaler koordinat yığını olarak değil, gerçekten bir matris olarak ele alır. AdamW her eleman için hareketli ortalama tutup koordinatları bağımsız normalize eder; Muon ise momentum güncellemesini alıp tekil değerlerin büyüklüklerini atar ve tekil yönleri korur, bu işlemi birkaç Newton–Schulz iterasyonuyla yaklaşık olarak hesaplar. dev.to'daki açıklama fikrin izini sürüyor.
4096×4096 boyutunda bir transformer ağırlık matrisi 16 milyondan fazla değer taşır: AdamW burada 16 milyon koordinat görür, Muon ise anlamlı yönleri olan bir doğrusal dönüşüm görür.
Muon, U diag(20, 3, 0.2) V^T gibi bir güncellemeyi yaklaşık olarak U diag(1, 1, 1) V^T'ye dönüştürür: Ortho(G) ≈ UV^T. Yönler kalır, büyüklükler eşitlenir.
Fikir ilk kez Ekim 2024'te, NanoGPT speedrun yarışması sırasında kamuya açıldı. 15 Ekim 2024'te Muon tabanlı bir deneme eğitim hızı rekoru kırarak önceki sonucu yaklaşık %35 iyileştirdi; ilk deneyler ayrıca Q, K ve V'nin ayrı matrisler olarak daha iyi çalıştığını gösterdi.
SVD yerine Newton–Schulz
Her optimizasyon adımında tam bir SVD hesaplamak çok yavaş olurdu; Muon bu yüzden SVD'yi hiç hesaplamaz. Matrisi Frobenius normuna böler ve bir polinomu tekrar tekrar uygular — X_next = aX + b(XX^T)X + c(XX^T)²X — ayarlanmış katsayılarla, genellikle beş iterasyonla. Polinom yalnızca tekil değerler üzerinde etki ettiği için bunlar 1'e yakınsar, tekil vektörler ise yerinde kalır; işlemin tamamı bfloat16'da verimli çalışır ve yazarın örneğinde ek maliyet yaklaşık %0.5'tir.
Hız rekorundan gerçek eğitim koşularına
Moonshot AI ölçeklenme sorusunu 2025 tarihli “Muon is Scalable for LLM Training” makalesiyle ele aldı. Ortogonallaştırılmış bir matrisin RMS davranışı boyutlarına bağlıdır; Moonshot'ın kuralı Muon güncellemesinin RMS'ini AdamW'ninkiyle eşler. Deneyleri, hesaplama-optimal eğitimde yaklaşık 2× hesaplama verimliliği ve AdamW muadillerinin eğitim FLOPs'inin yaklaşık %52'siyle benzer performans bildirdi. Muon ile ayrıca 3B/16B mixture-of-experts modeli Moonlight, 5,7 trilyon token üzerinde eğitildi.
Bellek tarafı da farklı: Adam benzeri algoritmalar parametre başına iki moment tensörü tutarken Muon'un temel durumu tek bir momentum tamponu içerir — 100B parametre için 800 GB yerine yaklaşık 400 GB. PyTorch artık birkaç update-scaling moduyla torch.optim.Muon'u belgeliyor ve DeepSpeed Haziran 2026'da desteğini ekledi.
AdamW'yi her yerde değiştirmek amaç değil: Muon 2B gizli ağırlık matrislerine yöneliktir; embeddings, biases, LayerNorm parametreleri ve çıkış başlıkları AdamW'de kalır. Sabit 0.02 learning rate kullanan erken örnekler körü körüne kopyalanmamalı, çünkü Jordan, Moonshot ve Bernstein'ın ölçekleme kuralları farklıdır.
Kontrollü bir karşılaştırmada mimari, veri, token sayısı, batch boyutu ve donanım sabit tutulur; validation loss ise token, FLOPs ve GPU-saatine göre ölçülür. Optimizasyon algoritması, parametrenin ne olduğuna dair varsayımlar taşır: Adam parametreleri koordinat olarak görür, Muon ise doğrusal operatörler olarak.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.