
OpenAI покращила кешування промптів для GPT-6
OpenAI представила вдосконалену систему кешування промптів для родини моделей GPT-6: вищі показники влучань за замовчуванням, знижки до 90 відсотків на кешовані вхідні токени та нові інструменти діагностики.
OpenAI опублікувала деталі вдосконаленої системи кешування промптів для родини моделей GPT-6. За словами компанії, вона підвищує показник влучань у кеш за замовчуванням і дає розробникам знижки до 90 відсотків на кешовані вхідні токени. Оновлення з'явилося 22 вересня 2026 року.
Кешування найважливіше для агентів, які годинами працюють над складними завданнями — від рефакторингу кодових баз до підготовки дослідницьких документів. Такі застосунки надсилають довгі серії API-запитів з однаковими інструкціями, визначеннями інструментів і попереднім контекстом, тож повторне використання обчислень скорочує і затримку, і витрати.
Вищий показник влучань
З GPT-6, як зазначає OpenAI, відповідні спільні префікси отримують знижку, якщо їх повторно використано протягом 30-хвилинного вікна. Система працює автоматично, але компанія додала й інструменти, які дозволяють командам вимірювати реальне повторне використання.
Нова панель Prompt Caching Dashboard показує, яка частина вхідних даних надходить із кешу, відстежує показник у часі та порівнює кешовані й некешовані токени. Якщо пропуск виглядає несподіваним, інструмент діагностики порівнює запит із недавньою відповіддю та називає причину — змінений модель, набір інструментів, налаштування чи вхідні дані — оцінюючи кількість уражених токенів. У прикладі OpenAI пропуск із причиною tools_changed залишив незатребуваними 5 629 токенів.

Контроль для розробників
Явні точки кешування дозволяють обирати, які префікси використовувати повторно; OpenAI також оновила відповідний посібник. На моделях GPT-6 рівень reasoning тепер можна змінювати між відповідями, додаючи configuration_update, — рівень запиту залишається незмінним, і кеш зберігається.
OpenAI також радить тримати визначення інструментів, схеми та порядок стабільними: відкривайте лише потрібні інструменти через allowed_tools або встановлюйте tool_choice у none, замість видалення визначень. Нові інструкції слід додавати developer-повідомленнями ближче до кінця контексту, а відомий контекст можна прогріти заздалегідь.
Що кажуть клієнти
Головний продуктовий директор GitHub Copilot Маріо Родрігес сказав, що робота над кешем скоротила понад 50 відсотків частки промпт-токенів, які потребують обробки з нуля, серед мільярдів запитів. Технічний директор Strawberry Browser Аріан Ханіфі повідомив про на 20 відсотків нижчі витрати та про те, що явні точки зробили відгалуження діалогів для фонових завдань економічно доцільним. Manus за менш ніж тиждень зріс із приблизно 85 до понад 90 відсотків, а Wordsmith — із 83 до 91 відсотка, скоротивши записи в кеш на дві третини, а витрати на інференс — на 36 відсотків.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.