Сколько стоит API Gemini 3.8 Flash с учётом рассуждений и кэша?
Тарифы Gemini 3.8 Flash на токены и кэш, пример расчёта бюджета, ограничения бесплатного доступа и подключение через Google или Ofox. Плановые цены с 2027 года.
Стандартный тариф Google Gemini 3.8 Flash до 31 декабря 2026 года — $0.75 за миллион входных токенов и $3.75 за миллион выходных, включая рассуждения. С 1 января 2027 года запланированы ставки $1.50 и $7.50. Чтобы оценить бюджет, посчитайте фактическое потребление приложения и добавьте расходы на кэш и инструменты.
Проверено 14 сентября 2026 года. Ниже приведены тарифы прямого Gemini API: они не являются гарантированной ценой Vertex AI или маршрута провайдера в Ofox. Источник таблиц — страница цен Google.
Тарифы на токены и кэш Gemini 3.8 Flash
Все ставки указаны в долларах США за миллион токенов. В оплачиваемый вывод входят токены рассуждений.
| Режим | Ввод до конца 2026 года | Вывод до конца 2026 года | Кэшированный ввод до конца 2026 года | Ввод / вывод / кэшированный ввод с января 2027 года |
|---|---|---|---|---|
| Standard | $0.75 | $3.75 | $0.075 | $1.50 / $7.50 / $0.15 |
| Batch или Flex | $0.375 | $1.875 | $0.0375 | $0.75 / $3.75 / $0.075 |
| Priority | $1.35 | $6.75 | $0.135 | $2.70 / $13.50 / $0.27 |
Хранение кэша оплачивается отдельно: $0.50 за миллион токенов в час до конца 2026 года, с запланированным повышением до $1.00 в январе. Дешёвое чтение не делает редко используемый кэш выгодным: учитывайте срок хранения и число повторных обращений.
Пример расчёта бюджета API
Допустим, приложение отправляет 1 000 запросов, каждый с 2 000 некэшированных входных токенов и 500 оплачиваемыми выходными токенами, включая рассуждения. Это условия примера, а не измеренная типичная длина ответа Gemini.
По тарифу Standard до конца декабря 2026 года:
- Ввод: (2 млн / 1 млн) × $0.75 = $1.50.
- Вывод: (0.5 млн / 1 млн) × $3.75 = $1.875.
- Всего за токены модели: $3.375, без инструментов, хранения и повторных попыток.
При том же потреблении январские ставки увеличат сумму до $6.75. Если 500 токенов относятся только к видимому ответу, расчёт неполон: нужно добавить оплачиваемые рассуждения.
Кэшированные токены считайте по тарифу чтения кэша и вычитайте из некэшированного ввода. Один входной токен нельзя оплачивать в расчёте дважды. Добавляйте хранение, инструменты, а также неудачные и повторные попытки, если они тарифицируются.
Какие поля usage нужны для расчёта?
Сохраняйте полную запись о потреблении. В нативном generateContent проверяйте usageMetadata.promptTokenCount, cachedContentTokenCount, candidatesTokenCount и thoughtsTokenCount. Вывод кандидатов и рассуждения отражаются отдельно; учёт только этого вывода без токенов рассуждений занижает оплачиваемый объём. См. справочник UsageMetadata.
В OpenAI-совместимом ответе уточните, что провайдер включает в completion_tokens и детализацию рассуждений. Если рассуждения уже входят в итог, повторное прибавление завысит оценку. Сверяйте расчёт с биллингом выбранного провайдера, особенно для инструментов и мультимодального ввода.
Бесплатный тариф, поиск и лимиты
Google указывает бесплатный ввод и вывод модели с учётом условий аккаунта и лимитов проекта. На бесплатном тарифе Gemini 3.8 Flash grounding через Google Search недоступен. В платной колонке указаны 5 000 запросов в месяц, общих для Gemini 3.x, затем $14 за 1 000 поисковых запросов. Один пользовательский запрос может вызвать несколько поисков: нельзя заранее считать, что он соответствует ровно одному оплачиваемому поисковому запросу.
Актуальные лимиты проекта смотрите в AI Studio. Документация Google объясняет квоты на уровне проекта и уровни использования. Дополнительный ключ в том же проекте не создаёт отдельную квоту.
При ответе 429 сначала проверьте детали ошибки, квоты проекта и состояние оплаты. Кратковременный всплеск нагрузки и исчерпанная квота требуют разных действий; немедленные повторные попытки могут усилить нагрузку. См. справочник ошибок API.
Получить ключ и вызвать Gemini 3.8 Flash
Для прямого доступа создайте ключ в Google AI Studio. Новые ключи AI Studio теперь по умолчанию относятся к типу auth keys. Если у вас старый Standard key, выполните миграцию по инструкции Google: она объявляет прекращение приёма Standard keys в сентябре 2026 года, не называя конкретный день. Это касается старых ключей и не означает, что каждый новый ключ нужно преобразовывать.
Храните ключи в переменных окружения сервера. Пример нативного REST предполагает, что GEMINI_API_KEY уже задана:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{"parts": [{"text": "Return only the sum of 17 and 25."}]}],
"generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}'
Ожидаемый ответ в этом коротком примере — 42. Он показывает структуру запроса, а не качество модели. Поддерживаются low, medium и high; minimal не поддерживается. В REST поле thinkingLevel находится внутри generationConfig.thinkingConfig; в SDK имена полей могут отличаться. Уровни указаны в документации Gemini 3.8, формат REST — в справочнике generateContent.
Доступ через Ofox
Gemini 3.8 Flash есть в каталоге Ofox под ID google/gemini-3.8-flash. Страница модели указывает протоколы OpenAI и Gemini и маршрут провайдера Vertex. Базовый URL OpenAI-совместимого API — https://api.ofox.run/v1, нативного Gemini — https://api.ofox.run/gemini.
Перед запуском примера установите пакет командой pip install openai и задайте OFOX_API_KEY в окружении сервера:
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.ofox.run/v1",
api_key=os.environ["OFOX_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-3.8-flash",
messages=[{"role": "user", "content": "Return only the sum of 17 and 25."}],
)
print(response.choices[0].message.content)
if response.usage is not None:
print(response.usage.model_dump())
Используйте актуальный тариф и параметры выбранного маршрута. Бесплатный тариф Google, режимы обслуживания и льгота на grounding не переносятся на шлюз автоматически. В этом обновлении проверены каталог и заявленные протоколы; примеры не проверялись платным запросом к модели.
Изменится ли счёт после перехода с 3.7?
Прямые ставки Standard у моделей одинаковые, но объём вывода и рассуждений может отличаться. Сравнивайте принятые результаты, токены и повторные попытки на своих задачах. В сравнении 3.8 и 3.7 исторический бенчмарк отделён от практических проверок миграции.
Для выбора между поставщиками используйте сравнение DeepSeek V4.1 Flash, Gemini 3.8 Flash и Qwen3.8 Flash. Если вы пришли из старого сравнения с V4, сначала проверьте изменения версий и алиасов DeepSeek V4.
Часто задаваемые вопросы
- Сколько стоит Gemini 3.8 Flash?
- Стандартный тариф прямого Gemini API до 31 декабря 2026 года — $0.75 за миллион входных токенов и $3.75 за миллион выходных, включая рассуждения. С января 2027 года запланированы ставки $1.50 и $7.50. Тарифы Vertex и шлюзов нужно проверять отдельно.
- Можно ли пользоваться Gemini 3.8 Flash бесплатно?
- Google указывает бесплатный ввод и вывод в Gemini API с учётом доступности для аккаунта и лимитов проекта. Grounding через Google Search на бесплатном тарифе недоступен. Льгота платного тарифа не распространяется автоматически на бесплатные запросы или сторонние маршруты.
- Какие токены учитывать в бюджете?
- Учитывайте некэшированный и кэшированный ввод, видимый ответ и оплачиваемые токены рассуждений, а также хранение кэша и инструменты. В нативном generateContent поля candidatesTokenCount и thoughtsTokenCount раздельные. Если совместимый API уже включает рассуждения в completion_tokens, повторно прибавлять их нельзя.
- Какой ID модели используется в Ofox?
- В каталоге Ofox есть google/gemini-3.8-flash с протоколами OpenAI и Gemini. Базовый URL для OpenAI-совместимых запросов — https://api.ofox.run/v1. Уточняйте тариф и поддерживаемые параметры выбранного маршрута провайдера.
- Как создать API-ключ?
- Для прямого Gemini API создайте ключ в Google AI Studio. Новые ключи по умолчанию относятся к типу auth keys. Для старых Standard keys следуйте инструкции Google по миграции. Для маршрута Ofox нужен ключ Ofox. Храните любой ключ на сервере.
- Какие уровни рассуждений поддерживаются?
- Gemini 3.8 Flash поддерживает low, medium и high; по умолчанию используется medium. Уровень minimal не поддерживается. Синтаксис настройки зависит от протокола и SDK.


