Назад
Додаткова плата GPT-6 Astra за 272K токенів подвоює вартість усього запиту, а не лише перевищення
SiTech AI Team3 хв читання

Додаткова плата GPT-6 Astra за 272K токенів подвоює вартість усього запиту, а не лише перевищення

OpenAI GPT-6 Astra рахує запити з понад 272 000 вхідних токенів за подвоєним тарифом вхідних і 1,5-кратним тарифом вихідних, що збільшує перевищення на 5 000 токенів приблизно на 3 долари за один виклик.

Межа 272K

OpenAI випустила GPT-6 Astra 3 вересня 2026 року, а в наступні дні поступово розширила її на тарифи ChatGPT, API та AWS Bedrock. Модель має контекстне вікно приблизно 1,05 мільйона токенів, краще використання інструментів і точніше дотримання інструкцій; ціна становить 10 доларів за мільйон вхідних токенів, 50 доларів за мільйон вихідних токенів і 1 долар за мільйон кешованих вхідних читань. Правило, вбудоване в документацію з ціноутворення, змінює математику: запити, де вхідний промпт перевищує 272 000 токенів, рахуються за подвоєними тарифами вхідних і кешованих токенів, а також 1,5-кратним тарифом вихідних, а не лише за перевищену частину.

Математика

Вхідні 270 000 токенів і 10 000 вихідних токенів за стандартними тарифами коштують 3,20 долари. Якщо збільшити вхідні до 275 000 токенів, той самий запит обійдеться в 6,25 долара. Додавання 5 000 токенів збільшує рахунок на 3,05 долари, оскільки кожен токен до межі перераховується ретроактивно. Якщо 5% з 10 000 щоденних запитів перевищує межу, додаткова плата додає приблизно 1 500 доларів на день, понад півмільйона доларів на рік, і це викликано повністю тими промптами, які потрапили не в ту категорію.

Чому це залишається поза телеметрією

Три фактори приховують цю межу в продакшені. Кількість токенів невідома, поки промпт не токенізовано, а оцінка за кількістю символів відрізняється на 10%-20% залежно від вмісту. Відповідь API повертає стандартні поля usage без документованого прапорця додаткової плати, тому командам доводиться самостійно порівнювати вхідні токени з 272 000 для кожного запиту у власному пайплайні метрик. І оскільки додаткова плата стосується всього запиту, промпт на 275 000 токенів коштує майже стільки ж, скільки на 500 000 токенів, тоді як промпт на 270 000 токенів коштує приблизно вдвічі дешше, ніж на 275 000 токенів. Найбільш вразливими навантаженнями є RAG-пайплайни з довгим контекстом, слід агента, який накопичує виклики інструментів і повторні спроби, та перегляд коду у великих дифах.

Виявлення та захист

Рекомендоване рішення — захист бюджету токенів: перед відправкою порахуйте токени промпта через tiktoken з безпечним порогом нижче 272 000 і розбийте прогноз, якщо p95 вхідних токенів перевищує 260 000, щоб перехопити наближення до межі. Для RAG-пайплайнів розміщуйте прочитані уривки в межах бюджету токенів, а не за фіксованою кількістю top-K. Для агентів скоротіть історію повідомлень, щойно вона наближається до 200 000 токенів. Для справді довгих навантажень кешування промпта залишається у 10 разів дешшим за тариф понад межею, а тарифи batch або flex для задач, толерантних до затримки, у 50% дешші за стандартні. Режим Fast, який у два рази дорожчий за стандартні тарифи, додає додаткову плату і разом з нею не повинен використовуватися.

Джерела: Hackernoon

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.