
AI ile AI harcamasını azaltmak: 6,53 milyon çağrılık önbellek deneyi
Thomson Nguy, FinOps ajanı Tycho'nun bir puanlama işinin öngörülen maliyetini 6541 dolardan yaklaşık 600 dolara indirdiğini anlattı. Düzeltme, kopya yerel istem önbelleği ve toplu iş indirimiyle geldi. İş hacmi 6,53 milyon çağrı.
Geliştirici Thomson Nguy, Opus 5.5 üzerinde çalışan FinOps ajanı Tycho'nun tek bir puanlama işinin öngörülen maliyetini 6541 dolardan yaklaşık 600 dolara indirdiği bir deneyi anlattı. Bu, ajanın AI harcamalarından sorumlu tutulmasından dört gün sonra gerçekleşti. İş yaklaşık 6,53 milyon çağrı içeriyordu ve her çağrı aynı istem talimatının yaklaşık 2800 tokenını gönderiyordu.
İlk deneme: önbellek çalışmıyordu
Görev için önce Haiku seçilmişti, ancak Tycho DeepSeek rotasını test etti. İlk denemede aynı ön eke sahip dört istek gönderdi ve dördü de sıfır önbelleklenmiş token bildirdi. Hata yoktu; her çağrı yalnızca normal fiyattan ücretlendirildi. Neden yönlendirmedeydi: Fireworks'ün istem önbelleği her kopyada yerel çalışır, dolayısıyla aynı talimatların yinelenmesi, sonraki istek başka bir kopyaya düştüğünde önbellek kaydını yeniden kullanmaz.
Tycho yönlendirmeyi, sonraki isteklerin aynı kopyaya dönmesini sağlayacak şekilde değiştirdi ve denemeyi yineledi. Beş sıcak çağrıda, çağrı başına yaklaşık 2960 girdi tokenının 2812'si önbellekten geldi. Sekiz istekli bir toplu iş, 23 677 girdi tokenının 19 688'ini önbellekten bildirdi; bu, bir soğuk ön ek ve yedi sıcak isabetle tutarlı. Bu iş için önemli olan soruyu da yanıtladı: küçük testte önbellek kullanımı toplu iş rotasında da sürdü.
Öngörülen faturaya etkisi
Aynı DeepSeek puanlama işi için dört tahmin çıktı: önbelleksiz normal çağrılar 6541 dolar; önbelleksiz toplu iş 3271 dolar; önbellek çalışırken normal çağrılar 1105 dolar; önbellek çalışırken toplu iş yaklaşık 600 dolar. Model ve 6,53 milyon çağrılık iş hacmi dört tahminde de aynı kaldı; değişen tek şey çağrıların nasıl sunulduğuydu.
Yaklaşık 2800 dolarlık Haiku çizgisi, daha uzun bir değerlendirme ölçütü kullanan eski bir kurulumdan geliyor ve kontrollü bir dörtlü karşılaştırma değil, bir referans noktası. Yazar notlarında, üretim haziranda Gemini'ye geçmeden önce Haiku 4.5'in asıl puanlama modeli olduğunu, 300 atomluk bir denemenin %98,6 önbellek isabeti kaydettiğini ve Haiku ile puanlanan 43 747 atomun ortalama 0,000426 dolar ettiğini ekliyor.
Rakamların söylemedikleri
Yazar, dolar tutarlarının küçük denemelerden dışdeğerlemeyle hesaplanan tüm iş tahminleri olduğunu, tamamlanmış 6,53 milyon çağrılık bir fatura olmadığını açıkça belirtiyor: iş bu ölçekte çalıştırılmadı ve faturalandırılmadı. Önerdiği pratik kontrol şu: yinelenen istemli bir iş yükünü büyütmeden önce aynı ön ekleri gönderin, önbelleklenmiş token sayısını inceleyin, oturum bağlılığıyla yineleyin ve toplu iş rotasını ayrıca test edin. Fiyat listesi nominal token ücretini gösterir; bu denemeler ise her yönlendirme seçeneğinde tüm iş tahminini değiştirdi.
Yazar sonucu bir ölçüde ironiyle de çerçeveliyor: şirketin AI'da nerede daha az harcayabileceğini bulmak için pahalı bir sınır modeli görevlendirildi. Anthropic ve OpenAI sınır zekâsı sunuyor, ancak aynı zekâ artık bu laboratuvarlara daha az para harcamanın yolunu bulmak için kullanılıyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.