Geri qayıt
LLM-ləri fizikçi kimi budamaq: blokların çıxarılması İzinq optimizasiyası problemi kimi
SiTech AI Team2 წთ. საკითხავი

LLM-ləri fizikçi kimi budamaq: blokların çıxarılması İzinq optimizasiyası problemi kimi

Multiverse Computing-in yeni məqaləsi transformer bloklarının seçimini İzinq şüşəsinə uyğunlaşdırılan məhdud ikili optimizasiya kimi yenidən formalaşdırır və dərin sıxılmada MMLU üzrə ən güclü bazanı təxminən 23 bənd üstələyir.

Transformer bloklarının hamısını silmək böyük dil modelini sürətləndirməyin ən ucuz yollarından biridir: model hərfi mənada qısalır, buna görə block removal (depth pruning) yaddaş qənaətindən əlavə proqnozlaşdırıla bilən inferens sürətlənməsi verir və kvantizasiya ilə yaxşı birləşir. Çətin hissə hansı blokların kəsiləcəyidir: bir blokun çıxarılmasının təsiri yanında hansı blokların çıxarıldığından asılıdır. LLM Compression by Block Removal with Constrained Binary Optimization məqaləsi (Hugging Face bloqu, 21 sentyabr 2026) bu seçimi İzinq şüşəsinə uyğunlaşdırılan məhdud ikili optimizasiya (CBO) problemi kimi yenidən formalaşdırır; enerji model keyfiyyətinin ucuz göstəricisidir.

Bloklar nə üçün bir-birindən asılı deyil

Mövcud metodlar hər bloku təkbaşına qiymətləndirir — böyüklük, həssaslıq və ya block influence ilə — və ən az vacibləri silir: bu, blokun töhfəsini digərlərindən asılı olmayan sayan orta sahə yaxınlaşmasıdır. Reallıqda 20-ci bloku çıxarmaq yalnız 19-cu və ya 24-cü blok da silindikdə zərər verir və kombinasiyaların sayı eksponensial artır.

Blok seçimindən enerji minimallaşdırmasına

Hər bloka ikili dəyişən verilir: 0 saxla, 1 çıxar. İtk funksiyasının ikinci tərtib Teylor açılımı təxmini Hessian matrisi verir: diaqonal hər blokun təkbaşına əhəmiyyətini, diaqonaldan kənar elementlər isə orta sahə metodlarının atdığı cüt əlaqələri göstərir. Vəzifə N blokdan enerjini minimuma endirən M bloku tapmaqdır. Metodun sxemi: blokların çıxarılması İzinq optimizasiyası problemi kimi Hessian yalnız bir dəfə, kiçik kalibrasiya verilənlər toplusunda irəli və geri keçişlərlə hesablanır; sonra hər namizəd konfiqurasiya modeli işə salmadan bir ucuz enerji hesablaması ilə qiymətləndirilir. Eyni Hessian bir çox M dəyərinə xidmət edir.

Həlledicilər, spektr və nəticələr

Tək GPU-da müəlliflər on milyardlarla konfiqurasiyanı kobud qüvvə ilə yoxlayır; ən çətin izlənilə bilən hal — Llama-3.3-70B-nin 80 blokundan 8-inin çıxarılması (təxminən 29 milyard konfiqurasiya) — təxminən iki gün çəkib. Bundan sonra vəzifə QUBO formasında klassik, kvant və kvant təsirli həlledicilərə keçir — annealing, QAOA, tabu search, branch-and-bound; açıq kodlu tabu həlledici ən aşağı enerji hallarına saniyələr içində çatır. Əsl əsas hal tələb olunmur: bir neçə yaxşı aşağı enerji halı kifayətdir. Llama-3.1-8B-Instruct: əsas hal ilə 17-ci həyəcanlanmış halın müqayisəsi Llama-3.1-8B-Instruct-da 32 blokdan 16-sı çıxarıldıqda 17-ci həyəcanlanmış hal modelin əvvəlindəki bloku kəsməyi təklif edən ilk haldır və yüngül yenidən təlimdən sonra əsas halı üstələyir. Yenidən təlim olmadan Llama-3.3-70B-Instruct 80 blokdan 32-si və 40-ı çıxarıldıqda 76,6 və 76,9 MMLU alır, block influence isə 59,3 və 54,0-da qalır; Qwen3-14B-də 40 blokdan 12-si üçün fərq təxminən 10 bənddir. Metod hibrid NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 modelinə də keçir və AIME25 ilə GPQA-da block influence-ı üstələyir. Kod açıqdır.
SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.