Кэш LLM API срабатывает, а расходы почти не падают: как проверить расчёт

Разделите обычный ввод, чтение и запись кэша, вывод и повторы. Пример расчёта показывает, почему высокий cache hit rate не равен экономии всей суммы.

Контурный рисунок счётов на светлой бумаге — расчёт расходов на кэш.

Процент попаданий в кэш нельзя напрямую пересчитать в снижение расходов. Отдельно посчитайте обычный ввод, чтение кэша, запись кэша и вывод по тарифам конкретной модели и маршрута. Длинный вывод, повторные записи и неудачные попытки могут сохранить высокую стоимость задачи даже при частом чтении кэша.

Официальные правила проверены 17 сентября 2026 года. Цены в расчётном примере условные: это не текущая котировка Ofox и не реальный счёт клиента.

Уточните правила своей модели

Согласно текущему руководству OpenAI, для GPT-5.6 и более поздних моделей запись кэша стоит 1,25 ставки обычного ввода, чтение — 0,1 ставки. Цена записи заменяет обычную цену для этих токенов, а не добавляется к ней вторым платежом.

У более ранних моделей правила отличаются. Нельзя распространять отсутствие дополнительной платы за запись у одной группы на все модели. Документация Anthropic также разделяет чтение, запись и срок хранения; множители OpenAI к ней автоматически не применяются.

Сравнение категорий кэша разных поколений моделей в документации OpenAI

Официальный скриншот от 16 сентября 2026 года, английский интерфейс сохранён. Это правила OpenAI API, а не тариф конкретного маршрута Ofox или лимит подписки Codex.

Исключите двойной учёт токенов

В текущем примере OpenAI Responses обычный ввод определяется так:

обычный ввод = input_tokens
             - input_tokens_details.cached_tokens
             - input_tokens_details.cache_write_tokens

Сначала проверьте определение usage в вашем API: совместимость не гарантирует одинаковую структуру. Отсутствующее поле не следует считать нулём без проверки. Отрицательный остаток означает, что расчёт или интерпретацию полей нужно пересмотреть.

Если ставки приведены к одной валюте за миллион токенов:

стоимость = (обычный ввод × ставка ввода
           + чтение кэша × ставка чтения
           + запись кэша × ставка записи
           + вывод × ставка вывода) / 1 000 000
           + другие применимые платежи

Тариф за изображение, секунду видео или вызов инструмента нельзя умножать на счётчик текстовых токенов.

Условный пример только для префикса

Пусть префикс содержит 10 000 токенов. Ставки за миллион: обычный ввод — $2, запись — $2,50, чтение — $0,20. После одной полной записи следующие девять запросов полностью читают этот префикс:

СтатьяРасчётСтоимость
Первая запись10 000 × $2,50 / 1 000 000$0,025
Девять чтений9 × 10 000 × $0,20 / 1 000 000$0,018
ВсегоЗапись плюс чтения$0,043
Без повторного использования10 × 10 000 × $2 / 1 000 000$0,200

Снижение стоимости префикса: (0,200 − 0,043) / 0,200 = 78,5%. Вывод, новые суффиксы, инструменты и дополнительные повторы сюда не входят. При новых записях или частичных попаданиях расчёт меняется.

Считайте взвешенный показатель и стоимость принятой задачи

В одном выбранном периоде делите сумму прочитанных из кэша токенов на сумму входных токенов с учётом определения API. Простое среднее процентов запросов ошибочно приравнивает короткие запросы к длинным.

Для каждой попытки сохраняйте дату, модель, маршрут, все категории usage, списание и результат приёмки. Сравнивайте стоимость всех попыток одной задачи. В сравнении Astra и Sol объясняется, почему маршрут тоже имеет значение.

Для цен Ofox сверяйте реализацию catalog в GitHub с текущим ответом сервиса. Поля pricing и provider_price.pricing различаются; код получает динамические данные, а не хранит вечную таблицу цен. Проверка поставщика API помогает оформить свидетельства.

По расходам API нельзя восстановить подписочный недельный лимит. См. время восстановления Codex, а для изображений — отдельный разбор цен.

Часто задаваемые вопросы

Попадание в кэш всегда снижает расходы?
Сравнивайте число повторных использований, ставки чтения и записи и полный состав расходов. Дешёвое чтение не означает бесплатную первую запись.
Можно умножить все input_tokens на ставку обычного ввода?
Сначала проверьте, входят ли кэшированные токены в общий счётчик. Разделите категории без пересечения и примените соответствующие ставки.
Экономия 78,5% в примере относится ко всей сумме?
Нет. Это только стоимость обработки заданного префикса, без вывода, нового суффикса и инструментов. Пример не является тарифом Ofox или счётом клиента.