
ლოკალური Qwen ცუდი Opus არ არის — ეს სხვა ხელსაწყოა, აჩვენებს OpenFaaS-ის დამფუძნებელი
ალექს ელისმა აღწერა, რა მისცა მის გუნდს ლოკალურმა Qwen-მა ორი წლის განმავლობაში: კონფიდენციალურობა და რეალური დანაზოგი ვიწრო ამოცანებზე, უსასრულო ციკლები და ჰალუცინაციები კი გრძელ ჰორიზონტზე.
ალექს ელისი — OpenFaaS-ის, SlicerVM-ის, Actuated-ისა და Inlets-ის დამფუძნებელი — დეტალურად აღწერს, როგორ იყენებს მისი მცირე პროგრამული კომპანია ლოკალურ ენის მოდელებს. დასკვნა სოციალურ ქსელებში გავრცელებულ მოსაზრებას ეწინააღმდეგება: ლოკალური Qwen იაფი Claude Opus არ არის, ის სხვა ხელსაწყოა, რომელსაც სათანადო ამოცანები სჭირდება.
რა დაჯდა აპარატურა
პირველი მცდელობა 2023 წელს ერთი RTX 3090 იყო — იმდენად რთული გამოსაყენებლად, რომ ექსპერიმენტი შეწყდა. Qwen 3.5 იყო პირველი თაობა, რომლის შედეგებიც რეალურად გამოსადეგი აღმოჩნდა. დღეს სამუშაოები მიდის RTX 6000 Pro Blackwell-ზე 96 GB VRAM-ით, რომელიც დაახლოებით 12 000 დოლარად შეიძინეს; ახლა იგივე ბარათი დაახლოებით 15 400 დოლარი ღირს. ორი ჭკვიანი შტეფსელი ზომავს ენერგიის მოხმარებას: RTX 6000 Pro inference-ის დროს დაახლოებით 600 ვატს მოიხმარს და შედარებით ჩუმია, ორი 3090 კი ერთად ~750 ვატს აღწევს და ძალიან ხმაურიანია.
ბენჩმარკებს შორის სხვაობა რეალურია
Qwen 3.6 27B SWE-Bench Verified-ზე 77.2 ქულას იღებს, Claude Opus 4.8-ის 88.6%-ის წინააღმდეგ. ელისი აღნიშნავს, რომ ბენჩმარკები მოძრავი სამიზნეა და მათზე მორგება შესაძლებელია: SWE-Bench პითონის პრობლემებზეა აგებული, კომპანიის კოდი კი Go-ზეა. ფრონტირის მოდელები, შეფასებით, 0.5–2 ტრილიონი პარამეტრით მუშაობს — ეს სხვა კლასის მოცულობაა, ვიდრე ერთ სამომხმარებლო GPU-ს ძალუძს სრული სიზუსტით. სწორედ დაკვანტვისას ჩნდება ყველაზე ცუდი ქცევები.
სად დაბრუნდა ფული
შესყიდვა ორმა სამუშაო პროცესმა გაამართლა. ხელსაწყო diag აგროვებს კლიენტის OpenFaaS-ის ინსტალაციის სრულ სურათს, რომელსაც შემდეგ ეფემერულ VM-ში ლოკალური მოდელი აანალიზებს — ასე მომხმარებლის მონაცემები ღრუბლოვან პროვაიდერამდე არ აღწევს. გარდა ამისა, ტელემეტრიის მონაცემთა ბაზის ლოკალურ მოდელზე გატარებით გამოავლინეს კლიენტი, რომელიც ლიცენზიებს არასწორად აცხადებდა და წელიწადზე მეტი ხნის განმავლობაში ოთხ-ხუთჯერ ნაკლებს იხდიდა — მხოლოდ ამ თანხის აღდგენამ ბარათის ფასი დაფარა.
ციკლები, ჰალუცინაციები და ოპერაციები
მთავარი ჩავარდნა უსასრულო ციკლია: faas-cli-ის ახალი ბრძანებების შეთავაზებისას მოდელმა ერთი და იგივე ხუთი წინადადება ნახევარი საათის განმავლობაში გაიმეორა, 600 ვატის მოხმარებით, ხოლო ავტომატურ კოდ-რევიუში გამოიგონა concurrency-ს პრობლემები და race condition-ები — ექსპერიმენტი ამით დასრულდა. თავად მოდელის მომსახურება ოპერაციული ამოცანაა: იდენტიფიკაცია, კვოტები, მარშრუტირება, ენერგიის მონიტორინგი და ორი დამოუკიდებელი llama.cpp ინსტანსი სრული კონტექსტის შესანარჩუნებლად. სპეკულაციურმა დეკოდირებამ გამტარობა სტაბილური 67-დან 130–200 ტოკენამდე წამში აამაღლა. მისი რჩევაა, ლოკალური მოდელები შემოსაზღვრულ სამუშაოებზე დატოვოთ — მხარდაჭერის ანალიზი, end-to-end ტესტირება — და არასოდეს დატოვოთ ზედამხედველობის გარეშე ხანგრძლივ ამოცანებზე. ღირებულებაც რეალური არგუმენტია: ღრუბლოვანი კოდინგ-გეგმები თვეში დაახლოებით 200 დოლარია, Uber-მა კი თანამშრომლების AI-ხარჯი 1500 დოლარით შეზღუდა დეველოპერზე და თითო ხელსაწყოზე.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.