უკან დაბრუნება
ლოკალური მოდელები ახლა ნამდვილად გამოსადეგია — ავტორის გამოცდილება 2022 წლის Mac-ზე
SiTech AI Team2 წთ. საკითხავი

ლოკალური მოდელები ახლა ნამდვილად გამოსადეგია — ავტორის გამოცდილება 2022 წლის Mac-ზე

ინჟინერი ვიკი ბოიკისი წერს, რომ ლოკალური მოდელები ბოლოს და ბოლოს საკმარისად კარგი გახდა აგენტური კოდინგისთვის: 64 GB ოპერატიულის მქონე 2022 წლის M2 Mac-ზე ისინი ფრონტიერ მოდელების სიზუსტისა და სიჩქარის დაახლოებით 75%-ს აღწევს.

ინჟინერი ვიკი ბოიკისი წლების განმავლობაში ლოკალურ მოდელებზე მუშაობდა და 2026 წლის 15 ივნისის პოსტში აჯამებს: ბოლოს და ბოლოს ისინი მართლაც საკმარისად კარგი გახდა. მისი სატესტო მანქანა 2022 წლის M2 Mac-ია — 64 GB ოპერატიული მეხსიერებითა და 1 TB დისკით.

მან გამოსცადა Mistral 7B, Gemma 3, OpenAI OSS-20B, Qwen 3 MoE და Qwen-ის სხვა ვარიანტები, მათ შორის Qwen 2.5 Coder, სხვადასხვა გარემოში: სუფთა llama.cpp Open WebUI-თი, llama-cpp-python, Ollama, llamafiles და LM Studio.

სად დგას ლოკალური მოდელები ახლა

გარდატეხად ავტორი GPT-OSS-ის გამოშვებას მიიჩნევს — პირველი მოდელი, რომლის პასუხებიც API-მოდელთან შედარებით იშვიათად სჭირდებოდა გადამოწმებას. მისი პირადი კრიტერიუმი მარტივია: „მჭირდება თუ არა ამის შედარება API-მოდელთან?“

Gemma 4-ის ოჯახის ბოლო გამოშვებებით მან ლოკალურად აგენტური კოდინგიც დაიწყო: ციკლები ფრონტიერ მოდელების სიჩქარისა და სიზუსტის დაახლოებით 75%-ზე მუშაობს. ნაგულისხმევ მოდელად LM Studio-ში gemma-4-26b-a4b გამოიყენება. მან ლოკალურად ნოუთბუქის სკრიპტი 5-6 მოდულის რეპოზიტორიად გადააკეთა, ტიპების ჰინტები გაასწორა, ბლოგის ტექსტები გადაამოწმა, unit-ტესტები დაწერა და ნულიდან ააგო two-tower რეკომენდაციის მოდელის რეპოზიტორია. K-V ქეში 64 GB-მდე იზრდება, ეს ამოცანები კი ნახევარი წლის წინ ლოკალური მოდელებისთვის შეუძლებელი იყო.

როგორ გავუშვათ ლოკალური აგენტები დღეს

საჭიროა სამი კომპონენტი: ინფერენსის ძრავა, აგენტური გარსი და მოდელის ფაილი, რომელსაც გარსი ლოკალურ მისამართზე მიუთითებს. ავტორი იყენებს Pi-ს როგორც გარსს და LM Studio-ს როგორც ინფერენსის სერვერს; მისივე აზრით, სუფთა llama.cpp უფრო სწრაფი იქნებოდა.

უსაფრთხოებისთვის ყოველი Pi-ს სესია Docker-კონტეინერში მუშაობს და მხოლოდ bash-ის უფლება აქვს — Python-ის კოდის გაშვება და ვებ-დათვალიერება აკრძალულია. მოდელად რჩეულია gemma-4-12b-qat: უფრო ახალი, პატარა და სწრაფი, სიზუსტის მცირე დანაკარგით.

რა რჩება პრობლემად

ინფერენსი შეიძლება ნელი იყოს, კონტექსტის ფანჯრები მცირეა და მხოლოდ საკუთარი ტექნიკით შემოიფარგლება. ადრეულ გამოშვებებს prompt-ის შაბლონების შეუთავსებლობა აწუხებს, თუმცა ამას სწრაფად ასწორებენ; ეკოსისტემას კი LM Studio და HuggingFace-ის „Use This Model“ ღილაკი აადვილებს.

ავტორის აზრით, ეს ჯერ კიდევ არ არის მზად საწარმოო პროგრამული უზრუნველყოფისთვის. სამაგიეროდ, ლოკალური მოდელების უპირატესობა გამჭვირვალობაა: ჩანს ტოკენების გენერაცია რეალურ დროში, შეიძლება კონტექსტის ფანჯრის, სისტემური prompt-ისა და კვანტიზაციის შეცვლა და მოდელების ერთმანეთთან შეჯიბრება.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.