Geri qayıt
Muon: LLM optimizatoru çəki matrisini matris kimi qəbul edəndə nə olur
SiTech AI Team3 წთ. საკითხავი

Muon: LLM optimizatoru çəki matrisini matris kimi qəbul edəndə nə olur

dev.to-da dərc olunan izahat Muon-un AdamW-nin koordinat əsaslı yeniləmələrini ortoqonallaşdırılmış matris həndəsəsi ilə əvəz etməsini və 2024-cü il sürət yarışı təcrübəsinin PyTorch-a necə daxil olduğunu izah edir.

Muon neyron şəbəkəsinin çəki matrisinə skalyar koordinatlar yığını kimi deyil, məhz matris kimi baxır. AdamW hər element üçün hərəkətli orta saxlayır və koordinatları ayrı-ayrılıqda normallaşdırır; Muon isə momentum yeniləməsini götürüb sinqulyar qiymətlərin böyüklüklərini atır və istiqamətləri saxlayır, bu əməliyyatı bir neçə Newton–Schulz iterasiyası ilə yaxınlaşdırır. dev.to-dakı izahat ideyanın izini sürür.

4096×4096 ölçülü transformer çəki matrisi 16 milyondan çox dəyər daşıyır: AdamW burada 16 milyon koordinat görür, Muon isə mənalı istiqamətləri olan xətti çevirmə görür.

Muon U diag(20, 3, 0.2) V^T kimi yeniləməni təqribən U diag(1, 1, 1) V^T-yə çevirir: Ortho(G) ≈ UV^T. İstiqamətlər qalır, böyüklüklər bərabərləşir.

İdeya ilk dəfə 2024-cü ilin oktyabrında, NanoGPT speedrun yarışı zamanı ictimaiyyətə çıxdı. 15 oktyabr 2024-cü ildə Muon əsaslı sınaq təlim sürəti rekordu qurdu və əvvəlki nəticəni təqribən 35% yaxşılaşdırdı; ilk təcrübələr həmçinin göstərdi ki, Q, K və V ayrı matrislər kimi daha yaxşı işləyir.

SVD əvəzinə Newton–Schulz

Hər optimizator addımında tam SVD hesablamaq çox yavaş olardı, ona görə Muon onu heç vaxt hesablamır. Matrisi Frobenius normasına bölür və polinomu dəfələrlə tətbiq edir — X_next = aX + b(XX^T)X + c(XX^T)²X — tənzimlənmiş əmsallarla və adətən beş iterasiya ilə. Polinom yalnız sinqulyar qiymətlərə təsir etdiyi üçün onlar 1-ə yaxınlaşır, sinqulyar vektorlar isə yerində qalır; bütün əməliyyat bfloat16-da səmərəli işləyir və müəllifin nümunəsində əlavə xərc təqribən 0.5%-dir.

Sürət rekordundan real təlimə

Miqyaslama sualını Moonshot AI 2025-ci il tarixli “Muon is Scalable for LLM Training” məqaləsində araşdırdı. Ortoqonallaşdırılmış matrisin RMS davranışı ölçülərindən asılıdır, ona görə Moonshot qaydası Muon yeniləməsinin RMS-ni AdamW-ninki ilə uyğunlaşdırır. Təcrübələri compute-optimal təlimdə təqribən 2× hesablama səmərəliliyi və AdamW analoqlarının təlim FLOPs-nin təqribən 52%-i ilə oxşar nəticə bildirdi. Muon ilə həmçinin 3B/16B mixture-of-experts modeli Moonlight 5,7 trilyon token üzərində öyrədildi.

Yaddaş da fərqlidir: Adam tipli optimizatorlar hər parametr üçün iki moment tensoru saxlayır, Muon-un əsas vəziyyəti isə bir momentum buferi saxlayır — 100B parametr üçün 800 GB əvəzinə təqribən 400 GB. PyTorch artıq bir neçə update-scaling rejimi ilə torch.optim.Muon-u sənədləşdirir, DeepSpeed isə dəstəyi 2026-cı ilin iyununda əlavə edib.

AdamW-ni hər yerdə əvəz etmək məqsəd deyil: Muon 2D gizli çəki matrisləri üçündür, embeddings, biases, LayerNorm parametrləri və çıxış başlıqları isə AdamW-də qalır. Sabit 0.02 learning rate ilə erkən nümunələri kor-koranə kopyalamaq lazım deyil, çünki Jordan, Moonshot və Bernstein-ın miqyaslama qaydaları fərqlidir.

Nəzarətli müqayisədə arxitektura, məlumatlar, tokenlər, batch ölçüsü və aparat sabit qalır, validation loss isə tokenlərə, FLOPs-ə və GPU-saatına görə ölçülür. Optimizator parametrin nə olduğuna dair fərziyyələr daşıyır: Adam parametrləri koordinat sayır, Muon isə xətti operatorlar.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.