Сколько стоит Sonnet 5.5 API: токены, кэш и цена выполненной задачи

Рассчитайте расходы Sonnet 5.5 на ввод, вывод, кэширование и Batch. Примеры показывают, чем цена запроса отличается от стоимости принятого результата.

Линейная иллюстрация ценников с заголовком Sonnet 5.5 API.

В стандартном Claude API Sonnet 5.5 стоит 2 доллара за миллион входных токенов и 10 долларов за миллион выходных. Чтение кэша стоит 0,20 доллара за миллион токенов. Это публичные тарифы разработчика, проверенные 29 сентября 2026 года, а не предложение Ofox и не цена подписки Claude. Для бюджета важнее другой вопрос: сколько оплачиваемых токенов приложение тратит на задачу, результат которой прошёл проверку.

При переходе с Sonnet 5 сама тарифная таблица не меняется. Заявление Anthropic о снижении затрат на значительную часть работ относится к поведению модели и расходу токенов, а не к скидке на любой запрос. Начните с официальной спецификации, затем рассчитайте свой рабочий сценарий.

Тарифы Sonnet 5.5

Категория токеновДоллары за миллион токеновЧто учитывать
Ввод без кэша2,00Ввод, не оплачиваемый как создание или чтение кэша
Вывод10,00Оплачиваемый вывод, включая тарифицируемые рассуждения
Создание кэша на 5 минут2,50Токены, записанные в кэш этого типа
Создание кэша на 1 час4,00Токены, записанные в кэш этого типа
Чтение кэша0,20Токены, действительно прочитанные из кэша промпта

На странице модели также указаны скидка 50% на ввод и вывод в Batch API и минимальная длина кэшируемого промпта — 512 токенов. Достижение этой длины не создаёт кэш автоматически: настройте кэширование и проверьте поля usage. Не прибавляйте кэшированные токены повторно к обычному вводу.

Плату за инструменты, параметры размещения данных и другие услуги проверяйте отдельно по полной документации о ценах. У стороннего провайдера могут отличаться функции, валюта и правила расчёта. Прежде чем применять этот пример к другому endpoint, изучите его действующие условия.

Небольшой запрос за 0,04 доллара — ещё не месячный бюджет

Предположим, запрос использует 10 000 входных токенов без кэша и 2 000 оплачиваемых выходных токенов:

Ввод:   10,000 / 1,000,000 × $2  = $0.02
Вывод:   2,000 / 1,000,000 × $10 = $0.02
Итого:                              $0.04

При строго таком расходе 1 000 запросов обойдутся в 40 долларов без дополнительных платежей. Это арифметический пример, а не измерение типичной длины ответа Sonnet. Более длинные рассуждения, дополнительный вызов инструмента или повторная попытка изменят сумму. Число слов в видимом ответе, умноженное на предполагаемый коэффициент, не даёт надёжного расчёта счёта.

Как кэш меняет расчёт

Пусть десять запросов используют общий префикс длиной 100 000 токенов. Предположим одну запись в пятиминутный кэш, девять реальных попаданий в течение срока его действия и отсутствие другого ввода или вывода. Запись префикса стоит 0,25 доллара, чтение — 9 × 0,02 доллара. Итого 0,43 доллара, тогда как десять некэшированных копий стоили бы 2,00 доллара. Экономия только на этом префиксе — 1,57 доллара, или 78,5%.

Это не скидка 78,5% на всё приложение. Изменение префикса, промах кэша или большой объём вывода могут уменьшить общую экономию. Записывайте объём создания и чтения кэша для каждого запроса. Подходящая структура промпта ещё не доказывает, что провайдер выставил счёт за попадание в кэш.

Для подходящих неинтерактивных работ отдельно оцените Batch. Его заявленная скидка 50% на ввод и вывод уменьшает цену некэшированного запроса из примера с 0,04 до 0,02 доллара при тех же допущениях. Здесь Batch не совмещается с кэшем; пример не описывает тарификацию всех возможных сочетаний.

Считайте стоимость принятого результата

Для исправления ошибки, документа или извлечения данных пригодится такая таблица:

ID задачи | Модель | Effort | Ввод | Запись кэша | Чтение кэша
Вывод | Плата за инструменты | Попытки | Принято? | Всего USD

Включайте неудачные и повторные попытки в расходы на задачу. Прежде чем делить общую сумму на количество принятых задач, определите критерий приёмки: пройдены тесты, заполнены правильные поля или выполнен контрольный список документа. Расход подписки учитывайте отдельно. Оценка эквивалентной стоимости API в CLI не обязательно является списанием в счёте за подписку.

Effort стоит фиксировать не случайно. Стартовая оценка Artificial Analysis показала очень большой расход выходных токенов на max. Но тестовая нагрузка не предсказывает ваш счёт. Кроме того, использовалось предварительное развёртывание с проблемой структурированного вывода; оговорка авторов о повторном тестировании существенна. Это повод измерять расход, а не объявлять Sonnet дорогим во всех случаях.

Восстановите счёт по usage, а не по длине переписки

Для стандартных тарифов выше полная формула токенной стоимости выглядит так:

USD = (2 × обычный_вход
     + 2.5 × запись_кэша_5м
     + 4 × запись_кэша_1ч
     + 0.2 × чтение_кэша
     + 10 × оплачиваемый_выход) / 1,000,000

Это отдельные, не пересекающиеся категории оплаты. В ответе Claude различайте input_tokens, cache_creation_input_tokens и cache_read_input_tokens. При разных сроках хранения сохраняйте детализацию создания кэша. Нельзя одновременно начислять стоимость по общему числу созданных токенов и повторно по его составляющим для пяти минут и часа. Если шлюз преобразует ответ, используйте определение usage этого провайдера. Отсутствующее поле означает неполную запись, а не нулевую стоимость.

Допустим, запрос содержит 8 000 обычных входных токенов, 40 000 токенов записи пятиминутного кэша, 60 000 прочитанных из кэша и 3 000 выходных. Получается $0.016 + $0.100 + $0.012 + $0.030 = $0.158. В контекст входят все три входные категории, но обычный входной тариф применяется не ко всем. Сохраняйте исходный ответ usage рядом с расчётом: так расхождение со счётом можно объяснить конкретной категорией, а не предположением о длине промпта.

Отдельная ловушка — thinking. Короткий видимый ответ может сопровождаться большим оплачиваемым объёмом рассуждения. Скрытие его текста не отменяет расход. max_tokens ограничивает рассуждение и текст вместе; это потолок, а не гарантия правильного завершения. Если попытка упёрлась в лимит, учтите её до продолжения. Исключив незавершённую попытку, вы занизите стоимость задачи.

Когда окупаются кэш на пять минут и кэш на час

Возьмём общий префикс в 100 000 токенов без прочего расхода. N запросов без кэша стоят $0.20N. Одна пятиминутная запись и N−1 реальных попаданий стоят $0.25 + $0.02(N−1). Уже два обращения дают $0.27 против $0.40 без кэша. Для часовой записи формула — $0.40 + $0.02(N−1): два обращения стоят $0.42, немного дороже обычного входа; три — $0.44 против $0.60.

Эти границы предполагают одну запись и успешное чтение во всех последующих запросах. Интервал между вызовами сам по себе не гарантирует попадание: считайте события по usage. Если все десять запросов создают пятиминутный кэш заново, префикс стоит $2.50, дороже исходных $2.00. Более долгий срок полезен только тогда, когда предотвращённые перезаписи оправдывают повышенный тариф создания.

Синтетический сценарий только для префиксаСтоимостьЧто показывает
10 обычных входов$2.00База: по 100K токенов за вызов
1 запись на 5 минут + 9 попаданий$0.43Повторное использование одной записи
1 запись на час + 9 попаданий$0.58Создание дороже, чтение по той же ставке
10 отдельных записей на 5 минут$2.50Промахи могут сделать кэш дороже обычного входа

Располагайте действительно стабильный материал перед переменной частью задания. Но не удаляйте необходимый контекст ради красивого процента попаданий. Большой кэш нерелевантного репозитория всё равно занимает контекст; небольшой нужный фрагмент без кэша иногда лучше. Смена модели также не означает повторного использования прежнего кэша. Не закладывайте межмодельное чтение в бюджет без подтверждения поддержки и тарификации сервиса.

Три воспроизводимых месячных бюджета

Ниже стандартный синхронный Claude API без кэширования, скидки Batch и отдельных платежей за инструменты. Это расчётные примеры для планирования, не результаты запуска и не прогноз типичного расхода модели.

Предположение о работеРасчёт одной задачиЗадач в месяцТокенный итог
Короткое извлечение: вход 4K, выход 500$0.008 + $0.005 = $0.01310 000$130
Черновик: вход 12K, выход 4K$0.024 + $0.040 = $0.0641 000$64
Цикл программирования: 4 хода, по 30K входа и 2K выхода4 × ($0.060 + $0.020) = $0.32500$160

В строке программирования вход оплачивается на каждом ходе. Повторная отправка истории может увеличить поздние запросы, поэтому четыре одинаковых хода — явное упрощение. До использования суммы как прогноза подставьте реальные значения каждого хода. Ответ инструмента может стать входом следующего запроса. Генерация моделью вызова инструмента и отдельная оплата его выполнения — разные статьи.

Если 100 из 500 задач требуют ещё одного хода по $0.08, прибавьте $8: всего $168. Если приёмку прошли только 480 задач, токенная стоимость принятой задачи — $168 / 480 = $0.35. Оставьте 20 неудач в отчёте: приёмка составляет 96%, а не 500 выполненных заданий. Проверка человеком, хостинг и внешние инструменты по-прежнему не входят в этот итог.

Как разобрать неожиданно высокий счёт

Начните с крупнейшей статьи. Если преобладает выход, проверьте effort, фактический thinking, обрывы по лимиту и ненужную многословность. Если вход — повторение истории и избыточный контекст поиска. Если создание кэша — сравните записи и чтения, а не сам факт настройки кэширования. Если повторы — разделите невалидные запросы, отказы инструментов и непринятые результаты. Ошибочная схема требует ремонта клиента; корректный по форме, но недостаточный ответ — анализа задания или выбора модели.

Помимо ограничения выхода одного запроса задайте в приложении общий бюджет задачи. При исчерпании остановитесь и явно покажите незавершённость. Не называйте собственный бюджет официальным rate limit и не переключайте модель незаметно, оставляя прежнее имя в учёте. Перед выбором Batch проверьте допустимость асинхронного завершения и условия конкретного сервиса. Более низкая ставка не делает задержку подходящей для интерактивного пользователя.

Что проверить дальше

Если тарифы понятны, а счёт неожиданен, сначала сравните фактический вывод, попадания в кэш и число повторов. Затем решайте, нужен ли другой провайдер. Для настройки используйте руководство по effort Sonnet 5.5, а для выбора модели — сравнение Sonnet и Opus в программировании.

Для подключения через Ofox откройте страницу модели Claude Sonnet 5.5 и проверьте ID модели, текущего провайдера, тарифы и поддерживаемые протоколы. Расчёты выше используют опубликованные тарифы Anthropic и не означают, что каждый провайдер поддерживает все функции Anthropic.

Часто задаваемые вопросы

Снизилась ли цена токена по сравнению с Sonnet 5?
Нет. В текущей официальной документации цены названы неизменными. При этом задача может потребовать больше или меньше токенов, поэтому общая сумма способна измениться без изменения тарифа.
Включает ли Claude Pro или Team кредиты API?
Не считайте лимит подписки балансом API. Уточните способ оплаты, используемый клиентом, и проверяйте условия плана отдельно от тарифов Claude API.
Max — самый дешёвый способ закончить задачу?
Общей гарантии нет. Сравните принятые результаты на нескольких уровнях effort, включая повторы и затраченное время. Более высокий уровень может значительно увеличить вывод, не повысив долю принятых результатов.