Gemini 3.8 Flash API 怎么收费?思考和缓存费用也要算进去
Gemini 3.8 Flash API 输入、输出、思考与缓存如何计费?附预算算例、免费额度边界、Google 与 Ofox 接入方式,以及 2027 年计划费率。
Google Gemini 3.8 Flash 的 Standard 档,截至 2026 年底每百万输入 tokens 为 0.75 美元、输出为 3.75 美元,输出包含思考 tokens。 2027 年 1 月 1 日起计划调整为 1.50 和 7.50 美元。估算预算时,除了单价,还要统计应用实际消耗的 tokens、缓存和工具费用。
本文于 2026 年 9 月 14 日核对。下表来自 Google 官方价目表,适用于 Gemini API 直连,不能直接当作 Vertex AI 或 Ofox 某条供应商路由的报价。
Gemini 3.8 Flash 输入、输出与缓存价格
以下单位均为美元/百万 tokens,输出价包含计费的思考 tokens。
| 服务档位 | 2026 年输入 | 2026 年输出 | 2026 年缓存读取 | 2027 年 1 月起:输入/输出/缓存读取 |
|---|---|---|---|---|
| Standard | $0.75 | $3.75 | $0.075 | $1.50 / $7.50 / $0.15 |
| Batch 或 Flex | $0.375 | $1.875 | $0.0375 | $0.75 / $3.75 / $0.075 |
| Priority | $1.35 | $6.75 | $0.135 | $2.70 / $13.50 / $0.27 |
缓存存储另计:2026 年为每百万 tokens 每小时 0.50 美元,2027 年 1 月起计划为 1.00 美元。缓存读取便宜,不代表任何内容都值得缓存;还要看保留时长和重复使用次数。
1,000 次请求大约多少钱?
假设应用发出 1,000 次请求,每次消耗 2,000 个未缓存输入 tokens,以及 500 个包含思考在内的计费输出 tokens。这是演示预算方法的假设,并非 Gemini 典型回复长度的实测。
按 2026 年 Standard 费率计算:
- 输入共 200 万 tokens:2 × 0.75 = 1.50 美元。
- 输出共 50 万 tokens:0.5 × 3.75 = 1.875 美元。
- 模型 tokens 合计 3.375 美元,不含工具、缓存存储及重试。
用量不变时,按 2027 年计划费率计算为 6.75 美元。如果每次 500 tokens 只统计了用户看到的答案,预算还缺思考费用。
有缓存时,命中的输入按缓存读取费率计算,并从未缓存输入量中扣除,不能让同一批 tokens 同时按两种费率收费。再计入缓存存储、工具以及实际产生费用的失败或重复请求。
应该读取哪些 usage 字段?
保留完整 usage 记录。原生 generateContent 返回的 usageMetadata 中,应查看 promptTokenCount、cachedContentTokenCount、candidatesTokenCount 和 thoughtsTokenCount。候选输出与思考是两个字段,只统计候选输出会低估计费输出。字段定义见 Google UsageMetadata 文档。
OpenAI 兼容响应则需核对供应商对 completion_tokens 及 reasoning 明细的定义。若总数已包含思考,不要再次相加。涉及工具或多模态输入时,应结合所选供应商账单核对,不能只凭一项 usage 数值推算全部费用。
免费层、联网搜索与限流
Google 为符合条件的账户和项目列出了免费模型输入、输出额度。Gemini 3.8 Flash 的免费层不支持 Google Search grounding。 付费列提供 Gemini 3.x 共用的每月 5,000 次请求额度,之后每 1,000 次搜索查询 14 美元。一条用户 prompt 可能触发多次搜索,不能默认它只对应一个计费查询。
具体可用额度在 AI Studio 查看。Google 限流文档 说明了项目配额与用量档位;同一项目多建一个 Key,不会多出一份配额。
遇到 429 时,先结合错误详情检查项目额度和账单状态,再决定如何重试。短时请求突增与配额耗尽需要不同处理;连续立即重试可能进一步增加负载。参见 Google API 错误说明。
申请 Key 并调用 Gemini 3.8 Flash
直连时,在 Google AI Studio 创建 Key。现在新建的 Key 默认是 auth key。已有旧 Standard key 的用户,应按 Google Key 指南 迁移。官方宣布在 2026 年 9 月拒绝 Standard key,但未给出具体哪一天;这不意味着今天新建的 Key 都要再转换一次。
Key 保存在服务端环境变量中。下面的原生 REST 示例假设已设置 GEMINI_API_KEY:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{"parts": [{"text": "Return only the sum of 17 and 25."}]}],
"generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}'
这个小算术任务的预期答案是 42,用于说明请求结构,不用于证明模型能力。支持的思考档位是 low、medium、high,不支持 minimal,见 Gemini 3.8 模型文档。REST 使用 generationConfig.thinkingConfig.thinkingLevel,SDK 字段写法可能不同,见 generateContent 参考。
Ofox 当前接入方式
Ofox 已列出 Gemini 3.8 Flash,模型 ID 为 google/gemini-3.8-flash。模型页列明 OpenAI、Gemini 两种协议以及 Vertex 供应商路由。OpenAI 兼容 base URL 为 https://api.ofox.run/v1;原生 Gemini base URL 为 https://api.ofox.run/gemini。
运行下面示例前,用 pip install openai 安装 Python 包,并在服务端设置 OFOX_API_KEY:
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.ofox.run/v1",
api_key=os.environ["OFOX_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-3.8-flash",
messages=[{"role": "user", "content": "Return only the sum of 17 and 25."}],
)
print(response.choices[0].message.content)
if response.usage is not None:
print(response.usage.model_dump())
费率和支持参数以所选路由为准。Google 直连的免费额度、服务档位和搜索赠送额度不会自动沿用到网关。本次更新核对了目录与协议说明,未通过付费推理请求验证这两个示例。
从 3.7 升级,费用会变吗?
两个模型的直连 Standard 单价相同,但实际输出和思考量可能不同。应在自己的任务上比较验收通过率、tokens 和重试次数。3.8 与 3.7 迁移对比 将发布时的评测数据与实际升级检查分开说明。
跨厂商选型可看 DeepSeek V4.1 Flash、Gemini 3.8 Flash 与 Qwen3.8 Flash 对比。如果来自旧 V4 比较文章,先核对 DeepSeek V4 版本与别名变化。
常见问题
- Gemini 3.8 Flash API 多少钱?
- Google Gemini API Standard 档截至 2026 年底的单价为每百万输入 tokens 0.75 美元、输出 3.75 美元,输出包含思考。2027 年 1 月起计划调整为 1.50 和 7.50 美元。Vertex AI 与网关应单独核对所选路由报价。
- Gemini 3.8 Flash 可以免费用吗?
- Google 为符合条件的项目提供模型输入和输出免费层,但有项目额度限制。该免费层不支持 Google Search grounding;付费层的搜索赠送额度不能套用到免费调用或第三方路由。
- 预算需要统计哪些 tokens?
- 统计未缓存输入、缓存输入、可见输出和计费思考 tokens,另计适用的缓存存储及工具费用。原生 generateContent 将 candidatesTokenCount 和 thoughtsTokenCount 分开返回;兼容接口若已将思考计入 completion_tokens,就不能再加一次。
- Ofox 的模型 ID 是什么?
- Ofox 已列出 google/gemini-3.8-flash,模型页标明支持 OpenAI 和 Gemini 协议。OpenAI 兼容 base URL 为 https://api.ofox.run/v1,实际费率与参数支持以所选供应商路由为准。
- API Key 怎么申请?
- 直接调用 Gemini API 时,在 Google AI Studio 创建 Key,新建 Key 默认是 auth key。旧 Standard key 按 Google 指南迁移。调用 Ofox 则使用 Ofox Key;两种 Key 都应保存在服务端。
- 支持哪些思考档位?
- Gemini 3.8 Flash 支持 low、medium 和 high,默认 medium,不支持 minimal。具体参数写法取决于协议和 SDK。


