
Як AI-агент скоротив витрати на AI: експеримент із кешем на 6,53 млн викликів
Thomson Nguy розповів, як його FinOps-агент Tycho знизив прогнозовану вартість одного завдання оцінювання з 6541 долара до приблизно 600 доларів, виправивши локальний кеш підказок і додавши пакетну знижку. Обсяг роботи оцінюється у 6,53 млн викликів.
Розробник Thomson Nguy описав експеримент, у якому його FinOps-агент Tycho на базі Opus 5.5 зменшив прогнозовану вартість одного завдання оцінювання з 6541 долара до приблизно 600 доларів. Це сталося через чотири дні після того, як агента призначили відповідальним за витрати на AI. Завдання охоплювало близько 6,53 млн викликів, і кожен із них передавав приблизно 2800 токенів однакової інструкції.
Перша перевірка: кеш не працював
Спочатку для цього завдання обрали Haiku, але Tycho перевірив маршрут через DeepSeek. Перша спроба надіслала чотири запити з ідентичним префіксом, і всі чотири повідомили нуль кешованих токенів. Помилки не було, просто кожен виклик тарифікувався за звичайною ціною. Причина виявилася в маршрутизації: кеш підказок у Fireworks працює локально на кожній репліці, тому повторення тих самих інструкцій не використовує запис кешу, якщо наступний запит потрапляє на іншу репліку.
Tycho змінив маршрутизацію так, щоб наступні запити поверталися на ту саму репліку, і повторив перевірку. На п'яти теплих викликах із приблизно 2960 вхідних токенів кешованими виявилися 2812. Пакет із восьми запитів показав 19 688 кешованих токенів із 23 677, що відповідає одному холодному префіксу та семи влучанням. Для цього завдання важливо, що повторне використання кешу збереглося і на пакетному маршруті.
Що сталося з прогнозованим рахунком
Для того самого завдання DeepSeek вийшло чотири оцінки: звичайні виклики без кешу, 6541 долар; пакетний режим без кешу, 3271 долар; звичайні виклики з працюючим кешем, 1105 доларів; пакетний режим із працюючим кешем, близько 600 доларів. Модель і обсяг у 6,53 млн викликів у всіх чотирьох випадках однакові, змінювався лише спосіб обслуговування запитів.
Лінія Haiku, близько 2800 доларів, походить із давнішої конфігурації з довшою рубрикою і є точкою відліку, а не контрольованим порівнянням чотирьох варіантів. У примітках автор уточнює, що Haiku 4.5 був початковою моделлю, доки в червні продакшн не перейшов на Gemini; перевірка на 300 атомах показала 98,6% влучань у кеш, а середня ціна 43 747 атомів, оцінених Haiku, становила 0,000426 долара.
Чого ці цифри не означають
Автор прямо зазначає, що суми в доларах це прогноз для всього завдання, екстрапольований із малих перевірок, а не виставлений рахунок за завершені 6,53 млн викликів: роботу в такому обсязі не запускали. Практичний висновок такий: перш ніж масштабувати навантаження з повторюваними підказками, надішліть ідентичні префікси, перевірте кількість кешованих токенів, повторіть із прив'язкою до сесії, а потім окремо протестуйте пакетний маршрут. Прайс-лист показує номінальний тариф за токени, а ці перевірки змінюють прогноз для всього завдання.
Автор також описує результат з іронією: дорогу фронтир-модель призначили шукати, де компанія може витрачати на AI менше. Anthropic і OpenAI пропонують фронтир-інтелект, але той самий інтелект тепер використовують, щоб витрачати менше грошей на ці самі лабораторії.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.