Geri Dön
LLM'leri fizikçi gibi budamak: blok çıkarma bir Ising optimizasyon problemi olarak
SiTech AI Team2 წთ. საკითხავი

LLM'leri fizikçi gibi budamak: blok çıkarma bir Ising optimizasyon problemi olarak

Multiverse Computing'in yeni makalesi, transformer bloklarının seçimini Ising camına eşlenen kısıtlı bir ikili optimizasyon problemi olarak yeniden formüle ediyor ve derin sıkıştırmada MMLU'da en güçlü rakibini neredeyse 23 puan geçiyor.

Transformer bloklarının tamamını silmek büyük bir dil modelini hızlandırmanın en ucuz yollarından biri: model gerçekten kısalıyor, bu yüzden block removal (depth pruning) bellek tasarrufunun yanında öngörülebilir bir çıkarım hızlanması sağlıyor ve kuantizasyonla iyi birleşiyor. Zor kısım hangi blokların kesileceği: bir bloğu çıkarmanın etkisi yanına hangi blokların çıkarıldığına bağlı. LLM Compression by Block Removal with Constrained Binary Optimization makalesi (Hugging Face blogu, 21 Eylül 2026) bu seçimi, Ising camına eşlenen kısıtlı ikili optimizasyon (CBO) problemi olarak yeniden formüle ediyor; enerji, model kalitesinin ucuz bir göstergesi.

Bloklar neden birbirinden bağımsız değil

Mevcut yöntemler her bloğu tek başına puanlıyor — büyüklük, hassasiyet veya block influence ile — ve en önemsizleri kaldırıyor: bu, bloğun katkısını diğerlerinden bağımsız sayan bir ortalama alan kısayolu. Gerçekte 20. bloğu çıkarmak ancak 19. veya 24. blok da kaldırıldıysa zarar veriyor ve kombinasyon sayısı üstel büyüyor.

Blok seçiminden enerji minimizasyonuna

Her bloğa ikili bir değişken ekleniyor: 0 tut, 1 çıkar. Kayıp fonksiyonunun ikinci dereceden Taylor açılımı yaklaşık bir Hessian matrisi veriyor: köşegen her bloğun tek başına önemini, köşegen dışı terimler ise ortalama alan yöntemlerinin attığı ikili eşleşmeleri gösteriyor. Görev, N blok içinden enerjiyi en aza indiren M bloğu bulmak. Yöntemin şeması: blok çıkarma bir Ising optimizasyon problemi olarak Hessian yalnızca bir kez, küçük bir kalibrasyon veri kümesindeki ileri ve geri geçişlerle hesaplanıyor; sonrasında her aday yapılandırma tek bir ucuz enerji hesabıyla değerlendiriliyor. Aynı Hessian birçok M değerine hizmet ediyor.

Çözücüler, spektrum ve sonuçlar

Tek bir GPU'da on milyarlarca yapılandırma kaba kuvvetle taranıyor; en zor izlenebilir durum olan Llama-3.3-70B'nin 80 bloğundan 8'inin çıkarılması (yaklaşık 29 milyar yapılandırma) iki gün sürüyor. Bunun ötesinde görev QUBO biçiminde klasik, kuantum ve kuantum esinli çözücülere geçiyor — tavlama, QAOA, tabu search, branch-and-bound; açık kaynaklı bir tabu çözücü en düşük enerjili durumlara saniyeler içinde ulaşıyor. Gerçek taban durumu gerekmiyor: birkaç iyi düşük enerjili durum yeterli. Llama-3.1-8B-Instruct: taban durumu ile 17. uyarılmış durum Llama-3.1-8B-Instruct'ta 32 bloğun 16'sı çıkarıldığında 17. uyarılmış durum modelin başında bir bloğu kesmeyi öneren ilk durum oluyor ve hafif yeniden eğitimden sonra taban durumunu geçiyor. Yeniden eğitim olmadan Llama-3.3-70B-Instruct, 80 bloktan 32'si ve 40'ı çıkarıldığında 76,6 ve 76,9 MMLU alırken block influence 59,3 ve 54,0'ta kalıyor; Qwen3-14B'de 40 bloktan 12'si için fark yaklaşık 10 puan. Yöntem hibrit NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 modeline de aktarılıyor ve AIME25 ile GPQA'da block influence'ı geçiyor. Kod açık kaynak.
SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.