Назад
Обрізання LLM по-фізичному: видалення блоків як задача оптимізації Ізінга
SiTech AI Team2 წთ. საკითხავი

Обрізання LLM по-фізичному: видалення блоків як задача оптимізації Ізінга

Нова стаття Multiverse Computing переформульовує вибір блоків трансформера як обмежену бінарну оптимізацію, що зводиться до скла Ізінга, і за глибокого стиснення випереджає найсильніший базовий метод майже на 23 пункти MMLU.

Видалення цілих блоків трансформера — дешевий спосіб прискорити велику мовну модель: модель буквально коротшає, тож block removal (depth pruning) дає передбачуване прискорення інференсу поверх економії пам'яті та добре поєднується з квантуванням. Складність у тому, які блоки різати: ефект від видалення одного блоку залежить від того, які інші блоки видалили разом із ним. У роботі LLM Compression by Block Removal with Constrained Binary Optimization (блог Hugging Face, 21 вересня 2026 року) вибір блоків переформульовано як обмежену бінарну оптимізацію (CBO), що відображається на скло Ізінга; його енергія — дешевий показник якості моделі.

Чому блоки не незалежні

Наявні методи оцінюють кожен блок окремо — за величиною, чутливістю чи евристикою block influence — і видаляють найменш важливі: це наближення середнього поля, яке вважає внесок блоку незалежним від інших. Насправді видалення 20-го блоку шкодить лише тоді, коли разом із ним прибрали 19-й або 24-й, а кількість комбінацій зростає експоненційно.

Від вибору блоків до мінімізації енергії

Кожному блоку приписують бінарну змінну: 0 — залишити, 1 — видалити. Розклад функції втрат у ряд Тейлора другого порядку дає наближену матрицю Гессе: діагональ показує важливість кожного блоку окремо, а позадіагональні елементи — парні зв'язки, які методи середнього поля ігнорують. Задача — знайти M блоків із N, видалення яких мінімізує енергію. Схема методу: видалення блоків як задача оптимізації Ізінга Матрицю Гессе обчислюють лише раз, із прямого та зворотного проходів на невеликому калібрувальному наборі даних; далі будь-яку конфігурацію оцінюють одним дешевим розрахунком енергії, без запуску моделі. Одна матриця обслуговує багато значень M.

Рішачі, спектр і результати

На одному GPU автори перебирають десятки мільярдів конфігурацій; найважчий доступний випадок — 8 із 80 блоків Llama-3.3-70B (близько 29 мільярдів конфігурацій) — зайняв приблизно два дні. Далі задача у формі QUBO переходить до класичних, квантових і квантово-інспірованих рішачів — відпалювання, QAOA, tabu search, branch-and-bound; відкритий tabu-рішач досягає найнижчих енергій за секунди. Справжній основний стан не потрібен: достатньо кількох хороших низькоенергетичних станів. Llama-3.1-8B-Instruct: основний стан проти 17-го збудженого Для Llama-3.1-8B-Instruct із 16 видаленими блоками з 32 17-й збуджений стан першим пропонує видалити блок на початку моделі й після легкого перенавчання перевершує основний стан. Без перенавчання Llama-3.3-70B-Instruct сягає 76,6 і 76,9 MMLU за 32 і 40 видалених блоків із 80 проти 59,3 і 54,0 у block influence; Qwen3-14B за 12 із 40 має перевагу близько 10 пунктів. Метод переноситься і на гібридну модель NVIDIA-Nemotron-3-Nano-30B-A3B-FP8, перевершуючи block influence на AIME25 і GPQA. Код відкритий.
SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.