Gemini 3.8 Flash 和 3.7 Flash 单价相同,实际任务费用差多少?

Gemini 3.8 Flash 与 3.7 Flash 单价一样,账单为何可能不同?区分发布时评测与当前价格,按思考档位、验收通过率、用量和延迟判断是否升级。

鼠尾草绿底上一张浅色卡纸,纸上一笔勾出两只握着石子的手,旁边一组黑色和赤陶色的几何字形,下方是衬线字体标题 Gemini 3.8 Flash vs 3.7 Flash

Gemini 3.8 Flash 与 3.7 Flash 的直连 Standard 单价相同,但切换模型后账单仍可能变化。 判断是否升级,要看 3.8 能否在可接受的总成本与延迟下,让更多任务通过验收。

本文更新于 2026 年 9 月 14 日。以下将当前价格、接入方式与发布时的历史评测分开,避免把旧分数当成今天的排行榜。

Gemini 3.8 Flash 何时发布,改了什么?

Gemini 3.8 Flash 于 2026 年 9 月 2 日发布。Google 发布说明 描述的变化包括:复杂任务上增加推理步骤和迭代工具调用,尤其是在较高思考档位。Google 同时建议,重视效率的应用可以降低思考档位,或继续使用 3.7。

更多计算可能帮助完成难题,也可能增加输出量和运行时间。这值得测试,但不代表每条请求都会多用 30% tokens,也不代表每种任务都会改善。

单价与思考档位对比

项目Gemini 3.7 FlashGemini 3.8 Flash
2026 年底前 Standard 输入/输出,每百万 tokens$0.75 / $3.75$0.75 / $3.75
2027 年 1 月起计划单价,输入/输出$1.50 / $7.50$1.50 / $7.50
思考档位low、medium、highlow、medium、high
默认思考档位mediummedium
minimal不支持不支持

价格来自 Google 官方价目表,思考档位见 3.7 模型文档3.8 模型文档。输出计费包含思考。Batch、Flex、Priority、缓存存储和预算算例见 Gemini 3.8 定价指南

发布时的评测究竟说明了什么?

下表来自 Artificial Analysis 发布分析它是 2026 年 9 月 2 日的历史快照,不是当前模型页面上的实时评测。

模型与思考档位发布时 AA Intelligence IndexAA 加权 Cost per Task
Gemini 3.8 Flash,high59$0.58
Gemini 3.8 Flash,medium57$0.41
Gemini 3.8 Flash,low52$0.24
Gemini 3.7 Flash,high56$0.40

该评测在 high 档观察到 3.8 每任务输出量约增加 30%。按表中经过四舍五入的数字计算,加权成本从 0.40 美元到 0.58 美元,上升 45%。medium 在这一评测中降低了成本,因此值得纳入自己的测试。

AA 的 Cost per Task 是按评测权重计算的指标,不是一次普通 API 调用的价格。一个任务可能包含多次模型调用和工具交互。评测版本与模型页面会变化,不能把这张历史表与当前完整榜单的总 tokens 混算,也不能仅凭榜单分数改变就认定模型退步。

59 分并不意味着某个应用“必须用 59 分模型”。客服分类、SQL 改写和编程 Agent 各自需要明确的验收条件。

怎么测,才能回答自己的费用问题?

选取有代表性的输入,既包含 3.7 已能完成的任务,也包含它失败的情况。先比较当前使用的思考档位;成本敏感时,再试 3.8 的 medium 或 low。供应商路由与服务档位尽量保持可比。

记录项用途
按统一标准验收通过的结果判断升级是否改善业务效果
全部计费输入、输出及思考 tokens发现相同单价背后的用量变化
工具调用、重试及失败尝试计算完成整个任务的成本
含工具执行在内的端到端延迟衡量用户等待时间,而非只看输出速度
截断、格式和 schema 错误找出简单文本演示看不到的回归

全部尝试的总费用 ÷ 验收通过的结果数 计算每个可用结果的成本。如果没有结果通过,直接记录失败,不给出所谓的成功成本。只统计可见答案长度,无法还原整个账单。

原生 generateContent 要保留完整 usageMetadata,包括 candidatesTokenCountthoughtsTokenCount。兼容接口的 completion_tokens 可能已包含思考,不能未核对口径就再相加,详见 用量与计费字段说明

更换模型 ID 后还要检查什么?

在 Google 同一受支持 API 上,一个简单文本请求的模型字段可以这样改:

- model="gemini-3.7-flash"
+ model="gemini-3.8-flash"

代码改动小,不代表迁移检查已经完成:

  1. 思考配置。 使用支持的档位。原生 REST 为 generationConfig.thinkingConfig.thinkingLevel,SDK 命名可能不同。不要沿用旧模型的 minimal
  2. 输出和超时预算。 测试思考、更长回复与多轮执行带来的影响。
  3. 工具和结构化输出。 检查 schema、工具返回值以及应用保存的对话状态。
  4. 供应商和地区。 核对实际路由的可用性与功能,不能只看 Google 原生文档。
  5. 回退。 新配置通过相同验收前,保留原有配置。

通过 Ofox 接入 Gemini 3.8 Flash

Ofox 已列出 Gemini 3.8 Flash,ID 为 google/gemini-3.8-flash,协议包括 OpenAI 和 Gemini。OpenAI 兼容客户端使用 https://api.ofox.run/v1,原生请求使用对应 Gemini 路由。定价与接入指南 提供了完整代码示例。

调用前核对所选供应商的报价和参数。目录上架说明已有公开的接入说明,不代表某个工具工作流已经测试通过。本次文章更新没有运行付费推理对比。

什么情况下值得升级?

当自己的测试表明,验收结果改善且成本、延迟在预算内,可以迁移相应任务。3.7 已满足要求而切换没有实测收益时,可以继续保留。按任务分配不同模型也可以考虑,但收益需要覆盖额外维护成本。

预算跨越 2027 年 1 月时,按计划中的直连新费率重算。只有 tokens 用量不变,单价翻倍才等于 tokens 费用小计翻倍;工具和存储仍需分别计算。

常见问题

Gemini 3.8 Flash 比 3.7 贵吗?
Gemini API 直连 Standard 单价相同,但输出、思考、工具轮次与重试量可能变化。发布评测在高思考档位测得更高的加权任务成本,不能据此认定所有请求都会涨价。
Gemini 3.8 Flash 提升多少?
Artificial Analysis 在 2026 年 9 月 2 日发布分析中给出的高思考档位得分为 3.8 的 59 分、3.7 的 56 分。这是历史评测快照,不是当前排行榜,也不能保证某个具体任务同样提升。
应该升级吗?
使用有代表性的真实任务,在准备上线的思考档位上比较。只有验收结果的改善足以覆盖实测成本与延迟时,升级才有依据;综合榜单分数不能当作具体业务验收门槛。
只换模型 ID 就行吗?
同一受支持协议的简单文本请求可能只需更换 model 字段,但上线前仍要核验思考设置、输出上限、结构化输出、工具调用与对话状态。
Ofox 已经支持 Gemini 3.8 Flash 吗?
Ofox 已列出 google/gemini-3.8-flash,并标明 OpenAI 和 Gemini 协议。实际报价及功能支持应核对所选路由;目录上架不等于每种业务流程都已通过测试。