Gemini 3.8 Flash 和 3.7 Flash 单价相同,实际任务费用差多少?
Gemini 3.8 Flash 与 3.7 Flash 单价一样,账单为何可能不同?区分发布时评测与当前价格,按思考档位、验收通过率、用量和延迟判断是否升级。
Gemini 3.8 Flash 与 3.7 Flash 的直连 Standard 单价相同,但切换模型后账单仍可能变化。 判断是否升级,要看 3.8 能否在可接受的总成本与延迟下,让更多任务通过验收。
本文更新于 2026 年 9 月 14 日。以下将当前价格、接入方式与发布时的历史评测分开,避免把旧分数当成今天的排行榜。
Gemini 3.8 Flash 何时发布,改了什么?
Gemini 3.8 Flash 于 2026 年 9 月 2 日发布。Google 发布说明 描述的变化包括:复杂任务上增加推理步骤和迭代工具调用,尤其是在较高思考档位。Google 同时建议,重视效率的应用可以降低思考档位,或继续使用 3.7。
更多计算可能帮助完成难题,也可能增加输出量和运行时间。这值得测试,但不代表每条请求都会多用 30% tokens,也不代表每种任务都会改善。
单价与思考档位对比
| 项目 | Gemini 3.7 Flash | Gemini 3.8 Flash |
|---|---|---|
| 2026 年底前 Standard 输入/输出,每百万 tokens | $0.75 / $3.75 | $0.75 / $3.75 |
| 2027 年 1 月起计划单价,输入/输出 | $1.50 / $7.50 | $1.50 / $7.50 |
| 思考档位 | low、medium、high | low、medium、high |
| 默认思考档位 | medium | medium |
| minimal | 不支持 | 不支持 |
价格来自 Google 官方价目表,思考档位见 3.7 模型文档 与 3.8 模型文档。输出计费包含思考。Batch、Flex、Priority、缓存存储和预算算例见 Gemini 3.8 定价指南。
发布时的评测究竟说明了什么?
下表来自 Artificial Analysis 发布分析。它是 2026 年 9 月 2 日的历史快照,不是当前模型页面上的实时评测。
| 模型与思考档位 | 发布时 AA Intelligence Index | AA 加权 Cost per Task |
|---|---|---|
| Gemini 3.8 Flash,high | 59 | $0.58 |
| Gemini 3.8 Flash,medium | 57 | $0.41 |
| Gemini 3.8 Flash,low | 52 | $0.24 |
| Gemini 3.7 Flash,high | 56 | $0.40 |
该评测在 high 档观察到 3.8 每任务输出量约增加 30%。按表中经过四舍五入的数字计算,加权成本从 0.40 美元到 0.58 美元,上升 45%。medium 在这一评测中降低了成本,因此值得纳入自己的测试。
AA 的 Cost per Task 是按评测权重计算的指标,不是一次普通 API 调用的价格。一个任务可能包含多次模型调用和工具交互。评测版本与模型页面会变化,不能把这张历史表与当前完整榜单的总 tokens 混算,也不能仅凭榜单分数改变就认定模型退步。
59 分并不意味着某个应用“必须用 59 分模型”。客服分类、SQL 改写和编程 Agent 各自需要明确的验收条件。
怎么测,才能回答自己的费用问题?
选取有代表性的输入,既包含 3.7 已能完成的任务,也包含它失败的情况。先比较当前使用的思考档位;成本敏感时,再试 3.8 的 medium 或 low。供应商路由与服务档位尽量保持可比。
| 记录项 | 用途 |
|---|---|
| 按统一标准验收通过的结果 | 判断升级是否改善业务效果 |
| 全部计费输入、输出及思考 tokens | 发现相同单价背后的用量变化 |
| 工具调用、重试及失败尝试 | 计算完成整个任务的成本 |
| 含工具执行在内的端到端延迟 | 衡量用户等待时间,而非只看输出速度 |
| 截断、格式和 schema 错误 | 找出简单文本演示看不到的回归 |
用 全部尝试的总费用 ÷ 验收通过的结果数 计算每个可用结果的成本。如果没有结果通过,直接记录失败,不给出所谓的成功成本。只统计可见答案长度,无法还原整个账单。
原生 generateContent 要保留完整 usageMetadata,包括 candidatesTokenCount 和 thoughtsTokenCount。兼容接口的 completion_tokens 可能已包含思考,不能未核对口径就再相加,详见 用量与计费字段说明。
更换模型 ID 后还要检查什么?
在 Google 同一受支持 API 上,一个简单文本请求的模型字段可以这样改:
- model="gemini-3.7-flash"
+ model="gemini-3.8-flash"
代码改动小,不代表迁移检查已经完成:
- 思考配置。 使用支持的档位。原生 REST 为
generationConfig.thinkingConfig.thinkingLevel,SDK 命名可能不同。不要沿用旧模型的minimal。 - 输出和超时预算。 测试思考、更长回复与多轮执行带来的影响。
- 工具和结构化输出。 检查 schema、工具返回值以及应用保存的对话状态。
- 供应商和地区。 核对实际路由的可用性与功能,不能只看 Google 原生文档。
- 回退。 新配置通过相同验收前,保留原有配置。
通过 Ofox 接入 Gemini 3.8 Flash
Ofox 已列出 Gemini 3.8 Flash,ID 为 google/gemini-3.8-flash,协议包括 OpenAI 和 Gemini。OpenAI 兼容客户端使用 https://api.ofox.run/v1,原生请求使用对应 Gemini 路由。定价与接入指南 提供了完整代码示例。
调用前核对所选供应商的报价和参数。目录上架说明已有公开的接入说明,不代表某个工具工作流已经测试通过。本次文章更新没有运行付费推理对比。
什么情况下值得升级?
当自己的测试表明,验收结果改善且成本、延迟在预算内,可以迁移相应任务。3.7 已满足要求而切换没有实测收益时,可以继续保留。按任务分配不同模型也可以考虑,但收益需要覆盖额外维护成本。
预算跨越 2027 年 1 月时,按计划中的直连新费率重算。只有 tokens 用量不变,单价翻倍才等于 tokens 费用小计翻倍;工具和存储仍需分别计算。
常见问题
- Gemini 3.8 Flash 比 3.7 贵吗?
- Gemini API 直连 Standard 单价相同,但输出、思考、工具轮次与重试量可能变化。发布评测在高思考档位测得更高的加权任务成本,不能据此认定所有请求都会涨价。
- Gemini 3.8 Flash 提升多少?
- Artificial Analysis 在 2026 年 9 月 2 日发布分析中给出的高思考档位得分为 3.8 的 59 分、3.7 的 56 分。这是历史评测快照,不是当前排行榜,也不能保证某个具体任务同样提升。
- 应该升级吗?
- 使用有代表性的真实任务,在准备上线的思考档位上比较。只有验收结果的改善足以覆盖实测成本与延迟时,升级才有依据;综合榜单分数不能当作具体业务验收门槛。
- 只换模型 ID 就行吗?
- 同一受支持协议的简单文本请求可能只需更换 model 字段,但上线前仍要核验思考设置、输出上限、结构化输出、工具调用与对话状态。
- Ofox 已经支持 Gemini 3.8 Flash 吗?
- Ofox 已列出 google/gemini-3.8-flash,并标明 OpenAI 和 Gemini 协议。实际报价及功能支持应核对所选路由;目录上架不等于每种业务流程都已通过测试。


