უკან დაბრუნება
ბლოკების მოჭრა ფიზიკოსის მიდგომით: LLM-ების გაპრუნინგება იზინგის ოპტიმიზაციად
SiTech AI Team2 წთ. საკითხავი

ბლოკების მოჭრა ფიზიკოსის მიდგომით: LLM-ების გაპრუნინგება იზინგის ოპტიმიზაციად

Multiverse Computing-ის ახალი ნაშრომი ტრანსფორმერის ბლოკების შერჩევას იზინგის მინაზე გადაყვანილ შეზღუდულ ბინარულ ოპტიმიზაციად აქცევს და ღრმა შეკუმშვისას MMLU-ზე უძლიერეს ბეისლაინს თითქმის 23 პუნქტით აღემატება.

ტრანსფორმერის მთელი ბლოკების მოდელის დაჩქარების იაფი გზაა: მოდელი ფაქტობრივად მოკლდება, ამიტომ block removal (depth pruning) პროგნოზირებად დაჩქარებას იძლევა და კვანტიზაციასაც ერწყმის. სირთულე იმაშია, თუ რომელი ბლოკები მოიჭრას: ერთი ბლოკის ამოღების ეფექტი მასთან ერთად ამოღებულ სხვა ბლოკებზეა დამოკიდებული. ნაშრომი „LLM Compression by Block Removal with Constrained Binary Optimization“ (Hugging Face, 2026 წლის 21 სექტემბერი) ამ არჩევანს შეზღუდულ ბინარულ ოპტიმიზაციად (CBO) აქცევს, რომელიც იზინგის მინაზე აისახება; მისი ენერგია მოდელის ხარისხის იაფი მაჩვენებელია.

რატომ არ არის ბლოკები დამოუკიდებელი

არსებული მეთოდები ყოველ ბლოკს ცალკე აფასებენ — სიდიდით, მგრძნობელობით ან block influence-ით — და ყველაზე ნაკლებად მნიშვნელოვნებს შლიან. ფიზიკის ენაზე ეს საშუალო ველის მიდგომაა. ერთი ზედიზედ მონაკვეთის წაშლა საძიებო სივრცის დიდ ნაწილს კარგავს, თუმცა მე-20 ბლოკის ამოღება ზიანს მხოლოდ მაშინ აყენებს, თუ მასთან ერთად მე-19 ან მე-24 ბლოკიც მოაშორეთ — კომბინაციების რაოდენობა კი ექსპონენციალურად იზრდება.

ბლოკების შერჩევიდან ენერგიის მინიმიზაციამდე

ყოველ ბლოკს ენიჭება ბინარული ცვლადი: 0 — დატოვე, 1 — ამოიღე, როგორც სპინი, რომელიც ქვემოთ ან ზემოთ არის მიმართული. მოდელის დანაკარგის მეორე რიგის ტეილორის გაშლა იძლევა სავარაუდო ჰესიანს: დიაგონალი თითოეული ბლოკის ცალკეულ მნიშვნელობას აჩვენებს, არადიაგონალური ელემენტები კი წყვილთა კავშირებია — სწორედ ის, რასაც საშუალო ველის მეთოდები უგულებელყოფენ. ამოცანაა N ბლოკიდან M-ის არჩევანი, რომლის ამოღებაც ენერგიას მინიმუმამდე ამცირებს. მეთოდის სქემა: ბლოკების ამოღება იზინგის ოპტიმიზაციის ამოცანად ჰესიანი მხოლოდ ერთხელ გამოითვლება — პატარა კალიბრაციის მონაცემებზე წინ და უკან გავლებით. შემდეგ ნებისმიერი კანდიდატი ენერგიის ერთი იაფი გამოთვლით ფასდება, მოდელის გაშვების გარეშე, და ერთი ჰესიანი ბევრ M-ს ემსახურება.

სოლვერები, სპექტრი და შედეგები

ერთ GPU-ზე ავტორები ათეულობით მილიარდ კონფიგურაციას ძალით გადათვლიან; ყველაზე რთული მიზანშეწონილი შემთხვევა — Llama-3.3-70B-ის 80 ბლოკიდან 8-ის ამოღება (დაახლოებით 29 მილიარდი კონფიგურაცია) — დაახლოებით ორ დღეს იკავებს. ამის შემდეგ ამოცანა QUBO ფორმით გადაეცემა სოლვერებს — annealing-ს, QAOA-ს, tabu search-სა და branch-and-bound-ს, სადაც ღია კოდის tabu-სოლვერი ყველაზე დაბალი ენერგიის მდგომარეობებს წამებში აღწევს. ზუსტად ყველაზე დაბალი ენერგიის მდგომარეობა საჭირო არ არის: საკმარისია რამდენიმე კარგი დაბალენერგიული მდგომარეობა. Llama-3.1-8B-Instruct: საბოლოო მდგომარეობა მე-17 აღგზნებულის წინააღმდეგ Llama-3.1-8B-Instruct-ზე, 32 ბლოკიდან 16-ის ამოღებისას, მე-17 აღგზნებული მდგომარეობა პირველია, რომელიც დასაწყისში მდებარე ბლოკს ჭრის და მსუბუქი გადატვირთვის შემდეგ რამდენიმე ბენჩმარკზე აღემატება საბოლოო მდგომარეობას. გადატვირთვის გარეშე Llama-3.3-70B-Instruct 80 ბლოკიდან 32-ისა და 40-ის ამოღებისას 76.6 და 76.9 MMLU-ს აღწევს block influence-ის 59.3 და 54.0-ის წინააღმდეგ; Qwen3-14B 40 ბლოკიდან 12-ის ამოღებისას დაახლოებით 10 პუნქტით უსწრებს. მეთოდი ჰიბრიდულ NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 მოდელზეც გადადის და AIME25-სა და GPQA-ზე სჯობს block influence-ს. კოდი ღიადაა გამოქვეყნებული.
SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.