Gemini 3.8 Flash API 怎么收费?思考和缓存费用也要算进去

Gemini 3.8 Flash API 输入、输出、思考与缓存如何计费?附预算算例、免费额度边界、Google 与 Ofox 接入方式,以及 2027 年计划费率。

灰粉色底上一张浅色卡纸,纸上一笔勾出一张价签,后面若隐若现地藏着第二张价签,旁边一组黑色和橄榄色的几何字形,下方是衬线字体标题 Gemini 3.8 Flash API

Google Gemini 3.8 Flash 的 Standard 档,截至 2026 年底每百万输入 tokens 为 0.75 美元、输出为 3.75 美元,输出包含思考 tokens。 2027 年 1 月 1 日起计划调整为 1.50 和 7.50 美元。估算预算时,除了单价,还要统计应用实际消耗的 tokens、缓存和工具费用。

本文于 2026 年 9 月 14 日核对。下表来自 Google 官方价目表,适用于 Gemini API 直连,不能直接当作 Vertex AI 或 Ofox 某条供应商路由的报价。

Gemini 3.8 Flash 输入、输出与缓存价格

以下单位均为美元/百万 tokens,输出价包含计费的思考 tokens。

服务档位2026 年输入2026 年输出2026 年缓存读取2027 年 1 月起:输入/输出/缓存读取
Standard$0.75$3.75$0.075$1.50 / $7.50 / $0.15
Batch 或 Flex$0.375$1.875$0.0375$0.75 / $3.75 / $0.075
Priority$1.35$6.75$0.135$2.70 / $13.50 / $0.27

缓存存储另计:2026 年为每百万 tokens 每小时 0.50 美元,2027 年 1 月起计划为 1.00 美元。缓存读取便宜,不代表任何内容都值得缓存;还要看保留时长和重复使用次数。

1,000 次请求大约多少钱?

假设应用发出 1,000 次请求,每次消耗 2,000 个未缓存输入 tokens,以及 500 个包含思考在内的计费输出 tokens。这是演示预算方法的假设,并非 Gemini 典型回复长度的实测。

按 2026 年 Standard 费率计算:

  • 输入共 200 万 tokens:2 × 0.75 = 1.50 美元。
  • 输出共 50 万 tokens:0.5 × 3.75 = 1.875 美元。
  • 模型 tokens 合计 3.375 美元,不含工具、缓存存储及重试。

用量不变时,按 2027 年计划费率计算为 6.75 美元。如果每次 500 tokens 只统计了用户看到的答案,预算还缺思考费用。

有缓存时,命中的输入按缓存读取费率计算,并从未缓存输入量中扣除,不能让同一批 tokens 同时按两种费率收费。再计入缓存存储、工具以及实际产生费用的失败或重复请求。

应该读取哪些 usage 字段?

保留完整 usage 记录。原生 generateContent 返回的 usageMetadata 中,应查看 promptTokenCountcachedContentTokenCountcandidatesTokenCountthoughtsTokenCount。候选输出与思考是两个字段,只统计候选输出会低估计费输出。字段定义见 Google UsageMetadata 文档

OpenAI 兼容响应则需核对供应商对 completion_tokens 及 reasoning 明细的定义。若总数已包含思考,不要再次相加。涉及工具或多模态输入时,应结合所选供应商账单核对,不能只凭一项 usage 数值推算全部费用。

免费层、联网搜索与限流

Google 为符合条件的账户和项目列出了免费模型输入、输出额度。Gemini 3.8 Flash 的免费层不支持 Google Search grounding。 付费列提供 Gemini 3.x 共用的每月 5,000 次请求额度,之后每 1,000 次搜索查询 14 美元。一条用户 prompt 可能触发多次搜索,不能默认它只对应一个计费查询。

具体可用额度在 AI Studio 查看。Google 限流文档 说明了项目配额与用量档位;同一项目多建一个 Key,不会多出一份配额。

遇到 429 时,先结合错误详情检查项目额度和账单状态,再决定如何重试。短时请求突增与配额耗尽需要不同处理;连续立即重试可能进一步增加负载。参见 Google API 错误说明

申请 Key 并调用 Gemini 3.8 Flash

直连时,在 Google AI Studio 创建 Key。现在新建的 Key 默认是 auth key。已有旧 Standard key 的用户,应按 Google Key 指南 迁移。官方宣布在 2026 年 9 月拒绝 Standard key,但未给出具体哪一天;这不意味着今天新建的 Key 都要再转换一次。

Key 保存在服务端环境变量中。下面的原生 REST 示例假设已设置 GEMINI_API_KEY

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [{"parts": [{"text": "Return only the sum of 17 and 25."}]}],
    "generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
  }'

这个小算术任务的预期答案是 42,用于说明请求结构,不用于证明模型能力。支持的思考档位是 lowmediumhigh,不支持 minimal,见 Gemini 3.8 模型文档。REST 使用 generationConfig.thinkingConfig.thinkingLevel,SDK 字段写法可能不同,见 generateContent 参考

Ofox 当前接入方式

Ofox 已列出 Gemini 3.8 Flash,模型 ID 为 google/gemini-3.8-flash。模型页列明 OpenAI、Gemini 两种协议以及 Vertex 供应商路由。OpenAI 兼容 base URL 为 https://api.ofox.run/v1;原生 Gemini base URL 为 https://api.ofox.run/gemini

运行下面示例前,用 pip install openai 安装 Python 包,并在服务端设置 OFOX_API_KEY

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.ofox.run/v1",
    api_key=os.environ["OFOX_API_KEY"],
)
response = client.chat.completions.create(
    model="google/gemini-3.8-flash",
    messages=[{"role": "user", "content": "Return only the sum of 17 and 25."}],
)
print(response.choices[0].message.content)
if response.usage is not None:
    print(response.usage.model_dump())

费率和支持参数以所选路由为准。Google 直连的免费额度、服务档位和搜索赠送额度不会自动沿用到网关。本次更新核对了目录与协议说明,未通过付费推理请求验证这两个示例。

从 3.7 升级,费用会变吗?

两个模型的直连 Standard 单价相同,但实际输出和思考量可能不同。应在自己的任务上比较验收通过率、tokens 和重试次数。3.8 与 3.7 迁移对比 将发布时的评测数据与实际升级检查分开说明。

跨厂商选型可看 DeepSeek V4.1 Flash、Gemini 3.8 Flash 与 Qwen3.8 Flash 对比。如果来自旧 V4 比较文章,先核对 DeepSeek V4 版本与别名变化

常见问题

Gemini 3.8 Flash API 多少钱?
Google Gemini API Standard 档截至 2026 年底的单价为每百万输入 tokens 0.75 美元、输出 3.75 美元,输出包含思考。2027 年 1 月起计划调整为 1.50 和 7.50 美元。Vertex AI 与网关应单独核对所选路由报价。
Gemini 3.8 Flash 可以免费用吗?
Google 为符合条件的项目提供模型输入和输出免费层,但有项目额度限制。该免费层不支持 Google Search grounding;付费层的搜索赠送额度不能套用到免费调用或第三方路由。
预算需要统计哪些 tokens?
统计未缓存输入、缓存输入、可见输出和计费思考 tokens,另计适用的缓存存储及工具费用。原生 generateContent 将 candidatesTokenCount 和 thoughtsTokenCount 分开返回;兼容接口若已将思考计入 completion_tokens,就不能再加一次。
Ofox 的模型 ID 是什么?
Ofox 已列出 google/gemini-3.8-flash,模型页标明支持 OpenAI 和 Gemini 协议。OpenAI 兼容 base URL 为 https://api.ofox.run/v1,实际费率与参数支持以所选供应商路由为准。
API Key 怎么申请?
直接调用 Gemini API 时,在 Google AI Studio 创建 Key,新建 Key 默认是 auth key。旧 Standard key 按 Google 指南迁移。调用 Ofox 则使用 Ofox Key;两种 Key 都应保存在服务端。
支持哪些思考档位?
Gemini 3.8 Flash 支持 low、medium 和 high,默认 medium,不支持 minimal。具体参数写法取决于协议和 SDK。