
ლოკალური მოდელები ახლა ნამდვილად გამოსადეგია — ავტორის გამოცდილება 2022 წლის Mac-ზე
ინჟინერი ვიკი ბოიკისი წერს, რომ ლოკალური მოდელები ბოლოს და ბოლოს საკმარისად კარგი გახდა აგენტური კოდინგისთვის: 64 GB ოპერატიულის მქონე 2022 წლის M2 Mac-ზე ისინი ფრონტიერ მოდელების სიზუსტისა და სიჩქარის დაახლოებით 75%-ს აღწევს.
ინჟინერი ვიკი ბოიკისი წლების განმავლობაში ლოკალურ მოდელებზე მუშაობდა და 2026 წლის 15 ივნისის პოსტში აჯამებს: ბოლოს და ბოლოს ისინი მართლაც საკმარისად კარგი გახდა. მისი სატესტო მანქანა 2022 წლის M2 Mac-ია — 64 GB ოპერატიული მეხსიერებითა და 1 TB დისკით.
მან გამოსცადა Mistral 7B, Gemma 3, OpenAI OSS-20B, Qwen 3 MoE და Qwen-ის სხვა ვარიანტები, მათ შორის Qwen 2.5 Coder, სხვადასხვა გარემოში: სუფთა llama.cpp Open WebUI-თი, llama-cpp-python, Ollama, llamafiles და LM Studio.
სად დგას ლოკალური მოდელები ახლა
გარდატეხად ავტორი GPT-OSS-ის გამოშვებას მიიჩნევს — პირველი მოდელი, რომლის პასუხებიც API-მოდელთან შედარებით იშვიათად სჭირდებოდა გადამოწმებას. მისი პირადი კრიტერიუმი მარტივია: „მჭირდება თუ არა ამის შედარება API-მოდელთან?“
Gemma 4-ის ოჯახის ბოლო გამოშვებებით მან ლოკალურად აგენტური კოდინგიც დაიწყო: ციკლები ფრონტიერ მოდელების სიჩქარისა და სიზუსტის დაახლოებით 75%-ზე მუშაობს. ნაგულისხმევ მოდელად LM Studio-ში gemma-4-26b-a4b გამოიყენება. მან ლოკალურად ნოუთბუქის სკრიპტი 5-6 მოდულის რეპოზიტორიად გადააკეთა, ტიპების ჰინტები გაასწორა, ბლოგის ტექსტები გადაამოწმა, unit-ტესტები დაწერა და ნულიდან ააგო two-tower რეკომენდაციის მოდელის რეპოზიტორია. K-V ქეში 64 GB-მდე იზრდება, ეს ამოცანები კი ნახევარი წლის წინ ლოკალური მოდელებისთვის შეუძლებელი იყო.
როგორ გავუშვათ ლოკალური აგენტები დღეს
საჭიროა სამი კომპონენტი: ინფერენსის ძრავა, აგენტური გარსი და მოდელის ფაილი, რომელსაც გარსი ლოკალურ მისამართზე მიუთითებს. ავტორი იყენებს Pi-ს როგორც გარსს და LM Studio-ს როგორც ინფერენსის სერვერს; მისივე აზრით, სუფთა llama.cpp უფრო სწრაფი იქნებოდა.
უსაფრთხოებისთვის ყოველი Pi-ს სესია Docker-კონტეინერში მუშაობს და მხოლოდ bash-ის უფლება აქვს — Python-ის კოდის გაშვება და ვებ-დათვალიერება აკრძალულია. მოდელად რჩეულია gemma-4-12b-qat: უფრო ახალი, პატარა და სწრაფი, სიზუსტის მცირე დანაკარგით.
რა რჩება პრობლემად
ინფერენსი შეიძლება ნელი იყოს, კონტექსტის ფანჯრები მცირეა და მხოლოდ საკუთარი ტექნიკით შემოიფარგლება. ადრეულ გამოშვებებს prompt-ის შაბლონების შეუთავსებლობა აწუხებს, თუმცა ამას სწრაფად ასწორებენ; ეკოსისტემას კი LM Studio და HuggingFace-ის „Use This Model“ ღილაკი აადვილებს.
ავტორის აზრით, ეს ჯერ კიდევ არ არის მზად საწარმოო პროგრამული უზრუნველყოფისთვის. სამაგიეროდ, ლოკალური მოდელების უპირატესობა გამჭვირვალობაა: ჩანს ტოკენების გენერაცია რეალურ დროში, შეიძლება კონტექსტის ფანჯრის, სისტემური prompt-ისა და კვანტიზაციის შეცვლა და მოდელების ერთმანეთთან შეჯიბრება.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.