უკან დაბრუნება
ერთთვიანი GLM 5.3 Flash გამოწვევა 50% გამოყენებით დასრულდა
SiTech AI Team2 წთ. საკითხავი

ერთთვიანი GLM 5.3 Flash გამოწვევა 50% გამოყენებით დასრულდა

ერთთვიანი ცდა, ყველა AI სამუშაო GLM 5.3 Flash-ზე გადაეტანათ, 50% გამოყენებით დასრულდა: 2 მილიარდი ტოკენიდან ნახევარი სამიზნე მოდელმა დაამუშავა. გამოვლინდა პროტოტიპის ხარჯები, პროვაიდერის ლიმიტები და ეფექტურობის გაზომვის ღირებულება.

გამოყენების განაწილება და პროტოტიპის ხარჯები

სექტემბრის ერთი ეფექტური ღია მოდელით გატარების ექსპერიმენტმა 50% გამოყენების მაჩვენებელი მოგვცა. 2 მილიარდი ტოკენიდან მხოლოდ 1 მილიარდი დამუშავდა GLM 5.3 Flash-ით, მიუხედავად იმისა, რომ თვის პირველ ნახევარში მან მთელი სამუშაო შეასრულა. მისი დაფიქსირებული გამოყენება ბიუჯეტში ჩაეტია: 68 დოლარი, დაახლოებით 4 კვტ/სთ ენერგია და 365 გრამი ნახშირბადის გამონაბოლქვი. მეორე ნახევარს სხვა მოდელებზე 1 მილიარდი ტოკენი დასჭირდა.

ერთი მოულოდნელი რამ ექსპერიმენტულ Wagtail MCP სერვერს უკავშირდებოდა, რომელსაც „vibe-coded“ პროტოტიპად აღწერდნენ. მოდელის არჩევანმა თითქმის ერთ ღამეში 450 მილიონი ტოკენი, 150 დოლარი და 5 კვტ/სთ ენერგია დახარჯა. სერვერი კარგად მუშაობდა და შესაძლებლობებიც აჩვენა, თუმცა გუნდი ვარაუდობს, რომ მსგავსი შედეგი ხარჯის მეხუთედით და მცირე დამატებითი ძალისხმევით მიიღწევა. ამ ეპიზოდმა კიდევ ერთხელ დაანახა, რომ ექსპერიმენტებისთვის ბიუჯეტია საჭირო და მოდელები ფრთხილად უნდა შეირჩეს.

ინფრასტრუქტურის ხელმისაწვდომობა

პროვაიდერების ხელმისაწვდომობა კიდევ ერთი პრობლემა იყო. გუნდის მიერ გამოყენებული ინფერენს პროვაიდერები ხშირად მუშაობდნენ, მაგრამ პოპულარულ არჩევანს დიდი ლაბორატორიების მსგავსი შესაძლებლობები არ ჰქონდა. GLM 5.3 Flash-მა შესრულების გაუარესება აჩვენა, სავარაუდოდ იმიტომ, რომ გუნდის სამუშაოსთვის პარეტოს ფრონტზე მაღლა იჯდა. ხელმისაწვდომი არჩევანი ასევე შემოიფარგლებოდა ევროპულ დატაცენტრებში დადასტურებული ღია მოდელებით. ამან მსგავს მოდელებზე გადართვა გამოიწვია: DeepSeek V4.1 Flash და Qwen 3.8 Flash, რაც მარტივი ცვლილება იყო და არ იყო მოსალოდნელი.

ღირებულება რუტინულ დეველოპმენტში

ერთი მოდელის რუტინულ ინჟინერიაში გამოყენებამ არ მოხსნა ფართო არჩევანის ტესტირების საჭიროება. გუნდი იწყებს მოდელების ბენჩმარკირებას Wagtail-ის ამოცანებზე და შედარებადი მონაცემები სჭირდება, რათა რეკომენდაცია მისცეს უფრო მსუბუქ ვარიანტებს აგენტის უნარებისთვის და ახალი CLI პროტოტიპისთვის, რომელიც აგენტებთან კარგად მუშაობას ისახავს მიზნად.

GLM 5.3 Flash მაინც შესანიშნავად შეფასდა საწარმოო სამუშაოსთვის, 1 მილიონი ტოკენის კონტექსტის ფანჯრის, ვიზუალური მხარდაჭერისა და მრავალ პროვაიდერთან ხელმისაწვდომობის გამო. ის გამოიყენებოდა Wagtail-ზე და მასზე აწყობილ საიტებზე, ასევე UI ამოცანებში, AI კვლევასა და განვითარებაში, დოკუმენტაციასა და შეფასებებში.

გაკვეთილები შემდეგი ტესტისთვის

ოქტომბრისთვის გამოწვევა მხოლოდ რუტინულ საწარმოო სამუშაოზე გაგრძელდება და არა კვლევასა და განვითარებაზე. დაგეგმილი ცვლილებები მოიცავს ტოკენების გამოყენების, ენერგიის მოხმარების, ხარჯებისა და კონკრეტული შედეგების უწყვეტ ლოკალურ რეპორტინგს. გუნდი ასევე გეგმავს ექსპერიმენტებისთვის მკაფიო ბიუჯეტების დაწესებას, პრომპტების შერჩევის გაუმჯობესებას, როლზე დაფუძნებული მრავალაგენტიანი სამუშაო ნაკადების გამოყენებას და ეფექტური მოდელების ტესტირების გაგრძელებას.

უფრო ფართო მიზანია, რომ AI ინფერენსის სამუშაოების უმეტესობა ერთ ან ორ იაფ flash-დონის მოდელს იყენებდეს, პროგრესი კი ფასით ან ენერგიის მოხმარებით შეფასდეს და არა მხოლოდ ტოკენების რაოდენობით. გუნდი ასევე დააკვირდება Jev-სტილის გადაწყვეტილების დიფუზიის მოდელებს, თუ ისინი ეფექტურად იმუშავებენ, მაშინ როცა ახალი ფლაგმანი მოდელები სწორი მიმართულების ნაბიჯად გამოიყურება.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.