Gemini 3.8 Flash и 3.7 Flash: как настройки рассуждений влияют на расходы
Сравнение Gemini 3.8 и 3.7 Flash: исторические результаты при запуске, актуальные ставки, уровни рассуждений и проверки перед переходом.
Прямые ставки Standard для Gemini 3.8 Flash и 3.7 Flash одинаковы, но смена модели может изменить счёт. Проверять стоит другое: даёт ли 3.8 больше результатов, отвечающих вашим требованиям, при приемлемых расходах и задержке.
Обновлено 14 сентября 2026 года. Ниже актуальные тарифы и доступность отделены от бенчмарка, опубликованного при запуске: старые баллы не выдаются за сегодняшнюю таблицу лидеров.
Что изменилось в Gemini 3.8 Flash?
Google выпустила Gemini 3.8 Flash 2 сентября 2026 года. В анонсе описаны более интенсивные рассуждения и последовательные обращения к инструментам в сложных задачах, особенно на более высоких уровнях рассуждений. Google также отмечает, что для задач с приоритетом эффективности можно снизить уровень или оставить 3.7. Дополнительная работа может помочь решить сложную задачу, но увеличить вывод и время выполнения.
Это повод проверить обновление. Из этого не следует, что каждый запрос потребует на 30% больше токенов или что результат улучшится в любой задаче.
Тарифы и настройки рассуждений
| Параметр | Gemini 3.7 Flash | Gemini 3.8 Flash |
|---|---|---|
| Standard, ввод / вывод за миллион до конца декабря 2026 года | $0.75 / $3.75 | $0.75 / $3.75 |
| Плановые ставки Standard с января 2027 года | $1.50 / $7.50 | $1.50 / $7.50 |
| Уровни рассуждений | low, medium, high | low, medium, high |
| Уровень по умолчанию | medium | medium |
Уровень minimal | Не поддерживается | Не поддерживается |
Тарифы взяты со страницы цен Google, уровни — со страниц моделей 3.7 и 3.8. В оплату вывода входят рассуждения. В руководстве по ценам Gemini 3.8 разобраны Batch, Flex, Priority, хранение кэша и пример бюджета.
Что действительно показал бенчмарк при запуске
В статье Artificial Analysis были приведены следующие результаты. Это срез при запуске 2 сентября 2026 года, а не текущие показатели на обновляемой странице модели.
| Модель и уровень | AA Intelligence Index при запуске | Взвешенная стоимость AA Cost per Task |
|---|---|---|
| Gemini 3.8 Flash, high | 59 | $0.58 |
| Gemini 3.8 Flash, medium | 57 | $0.41 |
| Gemini 3.8 Flash, low | 52 | $0.24 |
| Gemini 3.7 Flash, high | 56 | $0.40 |
В этом анализе на уровне high у 3.8 наблюдалось примерно на 30% больше выходных токенов на задачу. Показанная взвешенная стоимость выросла с $0.40 до $0.58 — на 45%, если считать по этим округлённым значениям. Уровень medium стоит проверить, поскольку в данном бенчмарке он снижал стоимость.
Cost per Task у AA — взвешенная метрика оценки. Одна задача может содержать несколько вызовов модели и обращений к инструментам; показатель не равен цене одного запроса API. Версии бенчмарков и страницы моделей меняются. Не объединяйте эту таблицу запуска с текущими суммарными токенами всего индекса и не считайте изменение балла на обновлённой таблице доказательством ухудшения модели.
Результат в 59 баллов также не означает, что конкретному приложению «нужно 59». У классификатора обращений в поддержку, инструмента переписывания SQL и агента для программирования разные критерии приёмки.
Как проверить, оправдан ли переход по бюджету
Возьмите одинаковые характерные входные данные: и задачи, с которыми 3.7 справляется, и её ошибки. Начните с используемого в приложении уровня рассуждений; если важны расходы, дополнительно попробуйте 3.8 на medium или low. Сохраняйте сопоставимые маршруты провайдеров и режимы обслуживания.
| Что записывать | Зачем |
|---|---|
| Принятые результаты по неизменной шкале оценки | Понять пользу для приложения |
| Все оплачиваемые токены ввода, вывода и рассуждений | Увидеть изменения расходов при одинаковой цене токена |
| Вызовы инструментов, повторы и неудачные попытки | Учесть стоимость выполнения всей задачи |
| Полное время выполнения с инструментами | Оценить ожидание пользователя, а не только скорость вывода токенов |
| Обрезанные ответы и ошибки схемы | Найти проблемы, незаметные в простой текстовой демонстрации |
Считайте общие расходы всех попыток, делённые на число принятых результатов. Если ни один результат не принят, сообщайте о неудаче, а не о стоимости успеха. Длины видимого ответа недостаточно для оценки всего счёта.
Для нативного generateContent сохраняйте полную usageMetadata, включая candidatesTokenCount и thoughtsTokenCount. В совместимом API рассуждения могут уже входить в completion_tokens; уточните правила провайдера, прежде чем что-либо прибавлять. Различие разобрано в руководстве по ценам.
Что проверить при замене ID модели
Для простого текстового запроса в том же поддерживаемом API Google поле меняется так:
- model="gemini-3.7-flash"
+ model="gemini-3.8-flash"
Эта небольшая правка не заменяет проверку миграции. Проверьте:
- Рассуждения. Выберите поддерживаемый уровень. В нативном REST используется
generationConfig.thinkingConfig.thinkingLevel; имена в SDK могут отличаться. Не переноситеminimalиз настроек более старой модели. - Вывод и тайм-ауты. Учтите рассуждения, более длинные ответы и несколько шагов выполнения.
- Инструменты и структурированный вывод. Проверьте схемы, обработку результатов инструментов и сохраняемое приложением состояние диалога.
- Провайдера и регион. Подтвердите доступность и функции своего маршрута, а не только наличие в документации Google.
- Откат. Сохраните предыдущую конфигурацию, пока новая не пройдёт те же проверки приёмки.
Вызов Gemini 3.8 Flash через Ofox
Gemini 3.8 Flash есть в Ofox под ID google/gemini-3.8-flash, с протоколами OpenAI и Gemini. Для OpenAI-совместимого клиента используйте https://api.ofox.run/v1, для нативных запросов — документированный маршрут Gemini. В руководстве по ценам и доступу приведён полный пример кода.
Проверьте цену и параметры выбранного провайдера. Запись в каталоге подтверждает заявленную доступность, но не прохождение теста конкретным сценарием с инструментами. При обновлении этой статьи платное сравнение моделей не проводилось.
Когда переход оправдан?
Переносите задачи, в которых ваша проверка показывает улучшение принятых результатов в пределах бюджета и допустимой задержки. Оставляйте 3.7 там, где она уже выполняет требования, а смена не даёт измеримой пользы. Можно распределять задачи между моделями, если результаты оправдывают дополнительное сопровождение.
Для бюджета, захватывающего январь 2027 года, пересчитайте расходы по плановым прямым тарифам. Удвоение ставок удваивает только сумму за токены и только при неизменном их количестве; инструменты и хранение рассчитываются отдельно.
Часто задаваемые вопросы
- Gemini 3.8 Flash дороже, чем 3.7 Flash?
- Ставки Standard прямого Gemini API одинаковы. Счёт всё же может измениться из-за объёма вывода, рассуждений, обращений к инструментам и повторных попыток. Бенчмарк при запуске показал более высокую взвешенную стоимость на уровне high, но это не универсальное удорожание каждого запроса.
- Насколько Gemini 3.8 Flash лучше?
- В статье Artificial Analysis от 2 сентября 2026 года модели на уровне high получили 59 баллов для 3.8 и 56 для 3.7. Это исторический срез оценки, а не текущая таблица лидеров и не гарантия для отдельных задач.
- Стоит ли переходить на новую модель?
- Проверьте обе модели на характерных задачах с теми уровнями рассуждений, которые планируете использовать. Переход оправдан, если качество принятых результатов достаточно улучшается с учётом измеренных расходов и задержки. Сводный балл бенчмарка сам по себе не служит критерием приёмки.
- Достаточно ли заменить ID модели?
- Для простого текстового запроса в том же поддерживаемом протоколе этого может хватить. До миграции в рабочей системе всё равно проверьте настройки рассуждений, лимиты вывода, структурированный ответ, вызовы инструментов и состояние диалога.
- Доступна ли Gemini 3.8 Flash через Ofox?
- В Ofox есть google/gemini-3.8-flash с протоколами OpenAI и Gemini. Проверьте цену и функции выбранного маршрута провайдера: наличие в каталоге не подтверждает работоспособность каждого сценария приложения.


