უკან დაბრუნება
AI-ის აგენტმა AI-ზე ხარჯვა შეამცირა: ქეშის ტესტი 6,53 მილიონი გამოძახებით
SiTech AI Team2 წთ. საკითხავი

AI-ის აგენტმა AI-ზე ხარჯვა შეამცირა: ქეშის ტესტი 6,53 მილიონი გამოძახებით

ავტორმა Thomson Nguy-მ აღწერა ექსპერიმენტი, რომელშიც მისმა FinOps აგენტმა Tycho-მ ერთი შეფასების სამუშაოს პროექტირებული ღირებულება 6541 დოლარიდან დაახლოებით 600 დოლარამდე შეამცირა. სამუშაო 6,53 მილიონ გამოძახებას მოიცავდა.

დეველოპერმა Thomson Nguy-მ აღწერა ექსპერიმენტი, რომელშიც მისმა FinOps აგენტმა, Opus 5.5-ზე მომუშავე Tycho-მ, ერთი შეფასების სამუშაოს პროექტირებული ღირებულება 6541 დოლარიდან დაახლოებით 600 დოლარამდე შეამცირა. ეს აგენტის დანიშვნიდან ოთხ დღეში მოხდა. საწყისი სამუშაო დაახლოებით 6,53 მილიონ გამოძახებას მოიცავდა, თითოეულ მათგანს კი დაახლოებით 2800 ტოკენა იდენტური ინსტრუქცია გადაჰქონდა.

პირველი ტესტი: ქეში არ მუშაობდა

თავდაპირველად ავტორი Haiku-ს იყენებდა, თუმცა Tycho-მ DeepSeek-ის მარშრუტი შეამოწმა. პირველი ოთხი მოთხოვნა იდენტური პრეფიქსით გაიგზავნა, და ოთხივემ ნულოვანი ქეშირებული ტოკენა დააბრუნა. შეცდომა არ მომხდარა, უბრალოდ ყოველ ჯერზე სტანდარტული ფასი იხდებოდა. მიზეზი Fireworks-ის prompt cache-ის აგებულება აღმოჩნდა: ის თითოეულ რეპლიკაზე ლოკალურად ინახება, ამიტომ იდენტური ინსტრუქცია ხელახლა არ გამოიყენება, თუ შემდეგი მოთხოვნა სხვა სერვერზე მოხვდა.

Tycho-მ მარშრუტირება ისე შეცვალა, რომ მომდევნო მოთხოვნები ერთსა და იმავე რეპლიკას უბრუნდებოდნენ (session affinity), და ტესტი ხელახლა გაუშვა. ხუთ თბილ გამოძახებაზე დაახლოებით 2960 შემავალი ტოკენიდან 2812 ქეშიდან წამოვიდა. რვა მოთხოვნის პარტიაზე 23 677 ტოკენიდან 19 688 ქეშირებული აღმოჩნდა, რაც ერთ ცივ და შვიდ თბილ მოთხოვნას შეესაბამება. ამან დაადასტურა, რომ ქეშის გამოყენება პარტიულ მარშრუტზეც შენარჩუნდა.

რა დაემართა პროექტირებულ გადასახადს

იმავე DeepSeek-ის სამუშაოსთვის ოთხი პროექცია გამოვიდა: ჩვეულებრივი გამოძახებები ქეშის გარეშე 6541 დოლარი, პარტიული რეჟიმი ქეშის გარეშე 3271 დოლარი, ჩვეულებრივი გამოძახებები მომუშავე ქეშით 1105 დოლარი და პარტიული რეჟიმი მომუშავე ქეშით დაახლოებით 600 დოლარი. მოდელი და 6,53 მილიონი გამოძახების მოცულობა ოთხივეში ერთი და იმავე იყო, იცვლებოდა მხოლოდ მოთხოვნების მომსახურების გზა.

Haiku-ს ხაზი, დაახლოებით 2800 დოლარი, უფრო ძველი კონფიგურაციიდან მოდის, სადაც უფრო გრძელი რუბრიკა გამოიყენებოდა. ავტორის თქმით, ეს საორიენტაციო წერტილია და არა კონტროლირებადი ოთხმხრივი შედარება. შენიშვნებში ის აზუსტებს, რომ Haiku 4.5 თავდაპირველი მოდელი იყო, სანამ პროდაქშენი ივნისში Gemini-ზე გადავიდა; 300 ატომის ტესტმა 98,6% ქეშის დაჭერა აჩვენა, 43 747 ატომის საშუალო ფასი კი 0,000426 დოლარი იყო.

რას არ ამბობს ეს ციფრები

ავტორი ცალკე აღნიშნავს, რომ დოლარებში მოცემული რიცხვები სრული სამუშაოს პროექციაა, მცირე ტესტებიდან ექსტრაპოლირებული, და არა დასრულებული 6,53 მილიონი გამოძახების ინვოისი. თავად სამუშაო ამ მოცულობით არ გაშვებულა. მთავარი დასკვნა პრაქტიკულია: სანამ განმეორებადი პრომპტების დატვირთვას გააფართოებ, გაგზავნე იდენტური პრეფიქსები, შეამოწმე ქეშირებული ტოკენების რაოდენობა, გაიმეორე session affinity-ით და ცალკე შეამოწმე პარტიული მარშრუტი. ფასების ცხრილი ნომინალურ ტარიფს გიჩვენებს, ეს ტესტები კი სრული სამუშაოს პროექციას ცვლის.

ექსპერიმენტს ავტორი ირონიულადაც აფასებს: ძვირადღირებული ფრონტიერ მოდელი იმის გასარკვევად დაინიშნა, სად შეიძლებოდა AI-ზე ნაკლების დახარჯვა. Anthropic და OpenAI ფრონტიერ ინტელექტს სთავაზობენ, თუმცა იგივე ინტელექტი ახლა იმისთვისაც გამოიყენება, რომ ამავე ლაბორატორიებზე ნაკლები თანხა დაიხარჯოს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.