Сколько стоит API Gemini 3.8 Flash с учётом рассуждений и кэша?

Тарифы Gemini 3.8 Flash на токены и кэш, пример расчёта бюджета, ограничения бесплатного доступа и подключение через Google или Ofox. Плановые цены с 2027 года.

На пыльно-розовом фоне светлая карточка с рисунком одной линией: ценник, за которым наполовину скрыт второй ценник; рядом сетка чёрных и оливковых геометрических знаков, ниже заголовок с засечками Gemini 3.8 Flash API

Стандартный тариф Google Gemini 3.8 Flash до 31 декабря 2026 года — $0.75 за миллион входных токенов и $3.75 за миллион выходных, включая рассуждения. С 1 января 2027 года запланированы ставки $1.50 и $7.50. Чтобы оценить бюджет, посчитайте фактическое потребление приложения и добавьте расходы на кэш и инструменты.

Проверено 14 сентября 2026 года. Ниже приведены тарифы прямого Gemini API: они не являются гарантированной ценой Vertex AI или маршрута провайдера в Ofox. Источник таблиц — страница цен Google.

Тарифы на токены и кэш Gemini 3.8 Flash

Все ставки указаны в долларах США за миллион токенов. В оплачиваемый вывод входят токены рассуждений.

РежимВвод до конца 2026 годаВывод до конца 2026 годаКэшированный ввод до конца 2026 годаВвод / вывод / кэшированный ввод с января 2027 года
Standard$0.75$3.75$0.075$1.50 / $7.50 / $0.15
Batch или Flex$0.375$1.875$0.0375$0.75 / $3.75 / $0.075
Priority$1.35$6.75$0.135$2.70 / $13.50 / $0.27

Хранение кэша оплачивается отдельно: $0.50 за миллион токенов в час до конца 2026 года, с запланированным повышением до $1.00 в январе. Дешёвое чтение не делает редко используемый кэш выгодным: учитывайте срок хранения и число повторных обращений.

Пример расчёта бюджета API

Допустим, приложение отправляет 1 000 запросов, каждый с 2 000 некэшированных входных токенов и 500 оплачиваемыми выходными токенами, включая рассуждения. Это условия примера, а не измеренная типичная длина ответа Gemini.

По тарифу Standard до конца декабря 2026 года:

  • Ввод: (2 млн / 1 млн) × $0.75 = $1.50.
  • Вывод: (0.5 млн / 1 млн) × $3.75 = $1.875.
  • Всего за токены модели: $3.375, без инструментов, хранения и повторных попыток.

При том же потреблении январские ставки увеличат сумму до $6.75. Если 500 токенов относятся только к видимому ответу, расчёт неполон: нужно добавить оплачиваемые рассуждения.

Кэшированные токены считайте по тарифу чтения кэша и вычитайте из некэшированного ввода. Один входной токен нельзя оплачивать в расчёте дважды. Добавляйте хранение, инструменты, а также неудачные и повторные попытки, если они тарифицируются.

Какие поля usage нужны для расчёта?

Сохраняйте полную запись о потреблении. В нативном generateContent проверяйте usageMetadata.promptTokenCount, cachedContentTokenCount, candidatesTokenCount и thoughtsTokenCount. Вывод кандидатов и рассуждения отражаются отдельно; учёт только этого вывода без токенов рассуждений занижает оплачиваемый объём. См. справочник UsageMetadata.

В OpenAI-совместимом ответе уточните, что провайдер включает в completion_tokens и детализацию рассуждений. Если рассуждения уже входят в итог, повторное прибавление завысит оценку. Сверяйте расчёт с биллингом выбранного провайдера, особенно для инструментов и мультимодального ввода.

Бесплатный тариф, поиск и лимиты

Google указывает бесплатный ввод и вывод модели с учётом условий аккаунта и лимитов проекта. На бесплатном тарифе Gemini 3.8 Flash grounding через Google Search недоступен. В платной колонке указаны 5 000 запросов в месяц, общих для Gemini 3.x, затем $14 за 1 000 поисковых запросов. Один пользовательский запрос может вызвать несколько поисков: нельзя заранее считать, что он соответствует ровно одному оплачиваемому поисковому запросу.

Актуальные лимиты проекта смотрите в AI Studio. Документация Google объясняет квоты на уровне проекта и уровни использования. Дополнительный ключ в том же проекте не создаёт отдельную квоту.

При ответе 429 сначала проверьте детали ошибки, квоты проекта и состояние оплаты. Кратковременный всплеск нагрузки и исчерпанная квота требуют разных действий; немедленные повторные попытки могут усилить нагрузку. См. справочник ошибок API.

Получить ключ и вызвать Gemini 3.8 Flash

Для прямого доступа создайте ключ в Google AI Studio. Новые ключи AI Studio теперь по умолчанию относятся к типу auth keys. Если у вас старый Standard key, выполните миграцию по инструкции Google: она объявляет прекращение приёма Standard keys в сентябре 2026 года, не называя конкретный день. Это касается старых ключей и не означает, что каждый новый ключ нужно преобразовывать.

Храните ключи в переменных окружения сервера. Пример нативного REST предполагает, что GEMINI_API_KEY уже задана:

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [{"parts": [{"text": "Return only the sum of 17 and 25."}]}],
    "generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
  }'

Ожидаемый ответ в этом коротком примере — 42. Он показывает структуру запроса, а не качество модели. Поддерживаются low, medium и high; minimal не поддерживается. В REST поле thinkingLevel находится внутри generationConfig.thinkingConfig; в SDK имена полей могут отличаться. Уровни указаны в документации Gemini 3.8, формат REST — в справочнике generateContent.

Доступ через Ofox

Gemini 3.8 Flash есть в каталоге Ofox под ID google/gemini-3.8-flash. Страница модели указывает протоколы OpenAI и Gemini и маршрут провайдера Vertex. Базовый URL OpenAI-совместимого API — https://api.ofox.run/v1, нативного Gemini — https://api.ofox.run/gemini.

Перед запуском примера установите пакет командой pip install openai и задайте OFOX_API_KEY в окружении сервера:

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.ofox.run/v1",
    api_key=os.environ["OFOX_API_KEY"],
)
response = client.chat.completions.create(
    model="google/gemini-3.8-flash",
    messages=[{"role": "user", "content": "Return only the sum of 17 and 25."}],
)
print(response.choices[0].message.content)
if response.usage is not None:
    print(response.usage.model_dump())

Используйте актуальный тариф и параметры выбранного маршрута. Бесплатный тариф Google, режимы обслуживания и льгота на grounding не переносятся на шлюз автоматически. В этом обновлении проверены каталог и заявленные протоколы; примеры не проверялись платным запросом к модели.

Изменится ли счёт после перехода с 3.7?

Прямые ставки Standard у моделей одинаковые, но объём вывода и рассуждений может отличаться. Сравнивайте принятые результаты, токены и повторные попытки на своих задачах. В сравнении 3.8 и 3.7 исторический бенчмарк отделён от практических проверок миграции.

Для выбора между поставщиками используйте сравнение DeepSeek V4.1 Flash, Gemini 3.8 Flash и Qwen3.8 Flash. Если вы пришли из старого сравнения с V4, сначала проверьте изменения версий и алиасов DeepSeek V4.

Часто задаваемые вопросы

Сколько стоит Gemini 3.8 Flash?
Стандартный тариф прямого Gemini API до 31 декабря 2026 года — $0.75 за миллион входных токенов и $3.75 за миллион выходных, включая рассуждения. С января 2027 года запланированы ставки $1.50 и $7.50. Тарифы Vertex и шлюзов нужно проверять отдельно.
Можно ли пользоваться Gemini 3.8 Flash бесплатно?
Google указывает бесплатный ввод и вывод в Gemini API с учётом доступности для аккаунта и лимитов проекта. Grounding через Google Search на бесплатном тарифе недоступен. Льгота платного тарифа не распространяется автоматически на бесплатные запросы или сторонние маршруты.
Какие токены учитывать в бюджете?
Учитывайте некэшированный и кэшированный ввод, видимый ответ и оплачиваемые токены рассуждений, а также хранение кэша и инструменты. В нативном generateContent поля candidatesTokenCount и thoughtsTokenCount раздельные. Если совместимый API уже включает рассуждения в completion_tokens, повторно прибавлять их нельзя.
Какой ID модели используется в Ofox?
В каталоге Ofox есть google/gemini-3.8-flash с протоколами OpenAI и Gemini. Базовый URL для OpenAI-совместимых запросов — https://api.ofox.run/v1. Уточняйте тариф и поддерживаемые параметры выбранного маршрута провайдера.
Как создать API-ключ?
Для прямого Gemini API создайте ключ в Google AI Studio. Новые ключи по умолчанию относятся к типу auth keys. Для старых Standard keys следуйте инструкции Google по миграции. Для маршрута Ofox нужен ключ Ofox. Храните любой ключ на сервере.
Какие уровни рассуждений поддерживаются?
Gemini 3.8 Flash поддерживает low, medium и high; по умолчанию используется medium. Уровень minimal не поддерживается. Синтаксис настройки зависит от протокола и SDK.