
Muse Glimmer: 30-მილიარდიანი ღია მოდელი ლოკალური აგენტებისთვის
Meta Superintelligence Labs-მა Apache 2.0 ლიცენზიით გამოუშვა Muse Glimmer — 30 მილიარდი პარამეტრის მქონე მოდელი, რომელიც ერთ სამომხმარებლო GPU-ზე მუშაობს და მუდმივად ჩართული ლოკალური აგენტებისთვისაა ოპტიმიზებული.
Meta Superintelligence Labs-მა წარადგინა Muse Glimmer — 30 მილიარდი პარამეტრის მქონე მოდელი, რომლის წონებიც ღიად, Apache 2.0 ლიცენზიით გამოქვეყნდა. მოდელი მუდმივად ჩართული ლოკალური აგენტური სამუშაო ნაკადებისთვისაა ოპტიმიზებული: ის საკმარისად მცირეა, რომ ერთი სამომხმარებლო GPU-ის მქონე Mac-ზე ან PC-ზე გაეშვას. მწარმოებელი მის ძირითად გამოყენებად ლოკალურ აგენტებს, ფუნქციების გამოძახებას, ლოკალურ კოდინგსა და LLM-as-a-judge შეფასებას ასახელებს.
რას აკეთებს მოდელი
Muse Glimmer სრულ აგენტურ ამოცანებზე შეფასდა DeepSearch QA, MCP-Atlas, τ-Bench და SWE-Bench ბენჩმარკებით, შედარებისთვის კი Gemma4-31B და Qwen3.6-27B გამოიყენეს. მწარმოებლის თანახმად, მოდელი ხანგრძლივ სამუშაო ნაკადებში ინსტრუმენტებს ზუსტი სქემებით იძახებს, გრძელ ჰორიზონტზე თანმიმდევრულ გეგმას ინარჩუნებს და შეცდომის შემთხვევაში მუშაობის შეწყვეტის ნაცვლად პრობლემის დიაგნოსტიკასა და ხელახლა ცდას სწავლობს. ცალკე perception-ენკოდერის მეშვეობით მოდელი ტექსტსა და სურათებს ერთად ამუშავებს — ეკრანის ანაბეჭდებს, დიაგრამებსა და დოკუმენტებს.
როგორ გაწვრთნეს
ტრენინგი სამ ეტაპად წარიმართა. წინასწარ ტრენინგზე მოდელი უფრო დიდი მასწავლებელი მოდელის, Muse Spark-ის, შედეგებზე logit distillation-ის მეთოდით გაწვრთნა, მსგავსი მონაცემთა ნაკრებით. შუალედურ ეტაპზე დაემატა გრძელი კონტექსტისა და უფრო აგენტური მონაცემები უფრო მდიდარი მსჯელობის კვალით. საბოლოო ეტაპზე გამოყენებულ იქნა ზედამხედველობითი დახვეწა, on-policy distillation და გაძლიერებითი სწავლება ზოგად, მსჯელობის, კოდინგისა და აგენტურ სფეროებში. კომპანიის თანახმად, მოდელი 100-ზე მეტი ენის მონაცემებზეა გაწვრთნილი, ხოლო გამოშვება Meta-ს Advanced AI Scaling Framework-ის სტანდარტებით შეფასდა.
როგორ ჯდება 30 მილიარდი პარამეტრი მოწყობილობაზე
სრული სიზუსტით 30-მილიარდიან მოდელს 55 GB-ზე მეტი მეხსიერება სჭირდება — მეტი, ვიდრე რომელიმე სამომხმარებლო GPU სთავაზობს. წონების კვანტიზაცია დაახლოებით 4-ბიტიან სიზუსტემდე ამცირებს ზომას და ენობრივი მოდელი 20 GB-ზე ნაკლებს იკავებს, რაც 24 ან 32 GB-იან ჩარჩოში KV cache-ის, perception-ენკოდერისა და speculative drafter-ის ერთდროულ მუშაობასაც იტევს. დაჩქარებას DFlash-ზე დაფუძნებული drafter-მოდელი უზრუნველყოფს: მცირე ქსელი ტოკენების მთელ ბლოკებს სთავაზობს, ძირითადი მოდელი კი მათ პარალელურად ამოწმებს. გაშვების სიჩქარის ზრდა RTX 5090-ზე 3.1-ჯერ, M5 Max-ზე 1.8-ჯერ, M4 Max-ზე კი 1.5-ჯერ შეადგინა.
წონები უკვე ხელმისაწვდომია Hugging Face-ზე, დეველოპერის დოკუმენტაცია კი Meta-ს პორტალზეა. უახლოეს დღეებში დაგეგმილია ოპტიმიზებული ინტეგრაციები llama.cpp-სთან, MLX-თან და ExecuTorch-თან, ასევე მუშაობა Ollama-ს, LM Studio-ს, vLLM-ისა და SGLang-ის მეშვეობით.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.