Кешування промптів звучить як технічна дрібниця, доки AI-агент не починає щохвилини повторно надсилати моделі інструкції, схеми інструментів і сотні сторінок контексту. Тоді один і той самий текст оплачується знову й знову, а користувач чекає, поки модель його повторно обробить.
У GPT‑6 OpenAI перебудувала цей механізм: кеш працює автоматично, спільний початок промпту можна повторно використовувати щонайменше 30 хвилин, а кешований вхід коштує на 90% дешевше. Додатково з’явилися дашборд, діагностика промахів, явні контрольні точки й попереднє прогрівання кешу.
Як працює кешування промптів GPT‑6
Модель не просто читає текст — вона обчислює для нього внутрішні стани. Якщо кілька запитів мають однаковий початок, OpenAI може зберегти ці обчислення й використати їх повторно. Сам текст запиту при цьому не замінюється готовою відповіддю: модель щоразу генерує новий результат.
Ключове слово тут — початок. Кеш повторно використовує незмінний префікс: системні й developer-інструкції, визначення інструментів, історію діалогу, документи, зображення та підтримуване аудіо. Якщо змінити ранню частину промпту, усе після цієї зміни може перестати збігатися.
Для GPT‑5.6 і новіших моделей мінімальний кешований префікс становить 1024 видимі вхідні токени. Тому два короткі запити «напиши заголовок» не дадуть магічної знижки. Кеш найбільше допомагає довгим чатам, агентам, RAG-системам і автоматизаціям із великими постійними інструкціями.
Скільки можна заощадити на GPT‑6
| Модель | Звичайний вхід | Читання кешу | Запис кешу | Вихід |
|---|---|---|---|---|
| GPT‑6 Astra | $10 | $1 | $12,50 | $50 |
| GPT‑6 Sol | $2 | $0,20 | $2,50 | $10 |
| GPT‑6 Luna | $0,10 | $0,01 | $0,125 | $0,50 |
Ціни наведені за 1 млн токенів для Standard processing і короткого контексту. Читання кешу коштує 0,1 від звичайного входу, а запис — 1,25. Отже, перший запит трохи дорожчий, зате кожне успішне повторне читання економить 90% на спільній частині входу.
Наприклад, агент на GPT‑6 Sol має 100 тис. стабільних токенів інструкцій і документів та робить 100 повторних запитів. Без кешу цей шматок входу коштував би близько $20. Після створення кешу 99 читань коштуватимуть приблизно $1,98, а перший запис — $0,25. Реальна економія залежатиме від змінної частини промпту й успішності влучань.
Окремої плати за Prompt Caching Dashboard або діагностику OpenAI не заявляє. Водночас кешовані токени продовжують враховуватися в лімітах tokens per minute — знижка в рахунку не перетворюється на додаткову пропускну здатність.
Актуальні тарифи моделей ми окремо розібрали в матеріалі про GPT‑6 Sol і Luna. Для найдорожчих задач також стане в пригоді огляд GPT‑6 Astra.
Що показує Prompt Caching Dashboard
Новий дашборд у консолі OpenAI показує частку вхідних токенів, обслужених із кешу. Графік input composition розділяє кешовані й некешовані токени, тому можна побачити момент, коли після релізу або зміни конфігурації кеш раптом перестав працювати.
Одна висока цифра ще нічого не гарантує. Якщо агент робить мало запитів або кешує невеликий фрагмент, 90% hit rate може майже не вплинути на рахунок. Дивіться разом на чотири показники:
- частку влучань у кеш;
- кількість кешованих токенів;
- вартість записів і повторних читань;
- час до першого токена для користувача.
Після кожної зміни системного промпту, списку інструментів або їхніх JSON-схем варто перевіряти графік заново. Саме такі невинні редагування часто руйнують спільний префікс.
Як діагностика пояснює промах кешу
Prompt Cache Diagnostics порівнює конкретний запит із недавньою відповіддю й показує, що завадило повторному використанню. Серед причин можуть бути зміна моделі, інструментів, параметрів або вхідного контексту. У відповіді є причина промаху та приблизна кількість токенів, які могли бути повторно використані.
Якщо діагностика повертає reason: tools_changed, проблема не обов’язково в тому, що агент викликав інший інструмент. Достатньо змінити опис, порядок або схему інструментів у запиті. Тому стабільний набір definitions краще залишати на місці, а доступність регулювати через allowed_tools або tool_choice: none.
Діагностику варто запускати не після кожного промаху, а коли hit rate несподівано просів або витрати зросли після релізу. Для масового моніторингу існує дашборд; для конкретної причини — діагностичний інструмент.
Як налаштувати кешування без зайвої магії
- Поставте стабільне на початок. Системні правила, опис ролі, схеми інструментів і довідкові матеріали мають іти перед змінним запитом користувача.
- Не редагуйте старі повідомлення. Нову інструкцію краще додати developer-повідомленням ближче до кінця контексту.
- Оберіть режим. Implicit mode автоматично ставить контрольну точку наприкінці останнього придатного повідомлення. Explicit mode дозволяє позначити потрібні межі вручну.
- Зберігайте історію. У багатокроковому агенті довга спільна історія часто дає більшу економію, ніж кешування лише стартової інструкції.
- Не змінюйте модель усередині серії. Кеш однієї моделі не можна просто передати іншій.
- Перевірте результат. У полі usage дивіться
cached_tokensіcache_write_tokens, а не припускайте, що кеш спрацював.
У GPT‑6 можна змінювати reasoning effort між відповідями через configuration_update, не руйнуючи вже придатний префікс. Це корисно, коли агент більшість кроків виконує з низьким effort, але для одного складного рішення тимчасово підвищує його.
Коли потрібні явні контрольні точки й prewarming
Автоматичного режиму достатньо для більшості застосунків. Явні breakpoints потрібні, коли у вас є великий стабільний блок і ви хочете точно визначити, де закінчується кешована частина. Наприклад: правила компанії, 40 інструментів і довідник продуктів залишаються незмінними, а історія клієнта постійно росте.
Prewarming готує відомий контекст до появи першого запиту користувача. Застосунок може прогріти інструкції, інструменти й довідкові матеріали під час запуску. Користувач не бачить швидшого «мислення» моделі — просто частина обчислень відбувається до того, як він натиснув кнопку.
Не прогрівайте все підряд. Якщо запит може не надійти протягом 30 хвилин, запис кешу протермінується без користі. Prewarming добре працює для передбачуваних піків, активних сесій і процесів, які запускаються за розкладом.
Що кешування означає для приватності
OpenAI пояснює, що кеш зберігає внутрішні KV-стани, а не окрему копію токенів. Записи не спільні між організаціями та не переносяться через межі регіональної обробки. Але це все одно частина обробки даних, яку треба врахувати у власній політиці безпеки.
Для чутливих процесів перевірте режим зберігання даних, регіон і умови конкретної моделі. Наш окремий гайд про Zero Data Retention в OpenAI API пояснює, чому прапорець у запиті не замінює налаштувань організації та договору.
Чи варто впроваджувати новий кеш GPT‑6
Якщо ви робите кілька коротких одиночних запитів на день, різниця буде майже непомітною. Якщо ж агент годинами працює з одними інструкціями, документами та інструментами, кешування стає не косметичною оптимізацією, а частиною економіки продукту.
Почніть із дашборда, знайдіть найбільші повторювані префікси й виправте очевидні промахи. Потім тестуйте explicit breakpoints і prewarming. Не оптимізуйте «відсоток кешу» заради красивого графіка — оптимізуйте вартість завершеної задачі та час, який реально чекає користувач.
Джерела: анонс OpenAI, документація Prompt Caching, тарифи OpenAI API.



