
AI agenti AI xərclərini necə azaltdı: 6,53 milyon çağırışlıq keş sınağı
Thomson Nguy bir FinOps agenti olan Tycho-nun tək bir qiymətləndirmə işinin proqnozlaşdırılan xərcini 6541 dollardan təxminən 600 dollara endirdiyini yazıb. Nəticə replika üzrə lokal prompt keşinin düzəldilməsi və toplu endirimlə alınıb.
Developer Thomson Nguy, Opus 5.5 üzərində işləyən FinOps agenti Tycho-nun tək bir qiymətləndirmə işinin proqnozlaşdırılan xərcini 6541 dollardan təxminən 600 dollara endirdiyi təcrübəni təsvir edib. Bu, agentin AI xərclərinə cavabdeh təyin edilməsindən dörd gün sonra baş verib. İş təxminən 6,53 milyon çağırışı əhatə edirdi və hər çağırış eyni təlimatın təxminən 2800 tokenini göndərirdi.
İlk sınaq: keş işləmirdi
Bu iş üçün əvvəlcə Haiku seçilmişdi, lakin Tycho DeepSeek marşrutunu yoxladı. İlk sınaqda eyni prefiksə malik dörd sorğu göndərdi və dördü də sıfır keşlənmiş token bildirdi. Xəta yox idi, sadəcə hər çağırış adi qiymətlə hesablanırdı. Səbəb marşrutlaşdırmada idi: Fireworks-un prompt keşi hər replikada lokal işləyir, ona görə də növbəti sorğu başqa replikaya düşdükdə eyni təlimatların təkrarı keş yazısından istifadə etmir.
Tycho marşrutlaşdırmanı elə dəyişdi ki, sonrakı sorğular eyni replikaya qayıtsın, və sınağı təkrar etdi. Beş isti çağırışda hər çağırışın təxminən 2960 giriş tokenindən 2812-si keşdən gəldi. Səkkiz sorğulu toplu, 23 677 giriş tokeninin 19 688-ni keşdən bildirdi ki, bu da bir soyuq prefiks və yeddi isti uyğunluğa uyğundur. Bu iş üçün vacib olan sual cavablandı: kiçik sınaqda keşin təkrar istifadəsi toplu marşrutda da saxlanıldı.
Proqnozlaşdırılan hesaba təsiri
Eyni DeepSeek qiymətləndirmə işi üçün dörd proqnoz alındı: keşsiz adi çağırışlar 6541 dollar, keşsiz toplu rejim 3271 dollar, işləyən keşlə adi çağırışlar 1105 dollar və işləyən keşlə toplu rejim təxminən 600 dollar. Model və 6,53 milyon çağırışlıq iş həcmi dörd halda da eyni qaldı, yalnız çağırışların təqdim edilmə üsulu dəyişdi.
Təxminən 2800 dollarlıq Haiku göstəricisi daha uzun rubrikadan istifadə edən əvvəlki quraşdırmadan gəlir və idarəolunan dördtərəfli müqayisə deyil, istinad nöqtəsidir. Müəllif qeydlərində əlavə edir ki, Haiku 4.5 istehsal iyun ayında Gemini-yə keçməzdən əvvəl əsas qiymətləndirmə modeli idi, 300 atomlu sınaq 98,6% keş uyğunluğu qeydə aldı və Haiku ilə qiymətləndirilən 43 747 atom orta hesabla 0,000426 dollar təşkil etdi.
Rəqəmlərin demədikləri
Müəllif açıq şəkildə bildirir ki, dollarla göstərilən məbləğlər kiçik sınaqlardan ekstrapolyasiya edilmiş tam iş proqnozlarıdır, tamamlanmış 6,53 milyon çağırışlıq faktura deyil: iş bu həcmdə işə salınmayıb və hesablanmayıb. Tövsiyə etdiyi praktik yoxlama budur: təkrarlanan promptlu yükü genişləndirməzdən əvvəl eyni prefiksləri göndər, keşlənmiş token sayına bax, sessiya bağlılığı ilə təkrar et və toplu marşrutu ayrıca yoxla. Qiymət cədvəli nominal token tarifini göstərir, bu sınaqlar isə hər marşrut seçimində tam iş proqnozunu dəyişdi.
Müəllif nəticəni bir qədər ironiya ilə də çərçivəyə alır: şirkətin AI-a harada daha az xərcləyə biləcəyini tapmaq üçün bahalı sərhəd modeli təyin edildi. Anthropic və OpenAI sərhəd intellekti təklif edir, amma həmin intellekt indi elə bu laboratoriyalara daha az pul xərcləməyin yolunu tapmaq üçün istifadə olunur.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.