DeepSeek V4.1 Flash、Gemini 3.8 Flash 与 Qwen3.8 Flash 对比
DeepSeek V4.1 Flash、Gemini 3.8 Flash 与 Qwen3.8 Flash 如何选?按固定用量比较价格,核对多模态、工具、地区和 API 兼容性,再验证任务效果。
怎么选取决于任务:DeepSeek V4.1 Flash 的直连美元 tokens 单价低于 Gemini;Gemini 3.8 Flash 的原生多模态输入和托管工具更广;Qwen3.8 Flash 则提供 1M 上下文、地区部署选项和常见兼容协议。 这里比较文档中列明的能力,不宣布评测赢家。
本文于 2026 年 9 月 14 日根据厂商官方文档更新。不同币种、地区与优惠期的报价不能直接排序,价格也可能变化。接入和账单细节分别见 DeepSeek V4.1 Flash API 指南 与 Gemini 3.8 Flash 定价及接入指南。
三个模型的主要区别
| 项目 | DeepSeek V4.1 Flash | Gemini 3.8 Flash | Qwen3.8 Flash |
|---|---|---|---|
| 厂商 | DeepSeek | 阿里云 | |
| 上下文 | 1M | 1,048,576 tokens | 1M |
| 最大输出 | 384K | 65,536 tokens | 131,072 tokens |
| 原生输入 | 文本、图像 | 文本、图像、视频、音频、PDF | 文本、图像、视频 |
| 文档列明的 API 形式 | OpenAI、Anthropic、Responses | Gemini API;OpenAI 兼容 | OpenAI、Anthropic 兼容 |
| 工具能力 | 工具调用、JSON 输出 | 函数调用、代码执行、搜索 grounding、计算机操作(预览)、结构化输出 | 函数调用、结构化输出;北京和新加坡支持联网搜索 |
| 适合优先测试 | 成本敏感的文本、图像和编程 Agent | 多模态输入丰富或需要 Google 工具的 Agent | 指定地区部署和多模态长上下文 |
上下文大小只是容量上限,不能证明模型能找对证据、遵守工具约定,或产出可用的十万 tokens 长答案。这些行为需要分别验证。
用固定用量比较价格
假设 100 万未缓存输入 tokens,加 20 万包含计费思考在内的输出 tokens,按官方列价计算:
| 路由与价格时段 | 输入 | 输出 | 算例合计 |
|---|---|---|---|
| DeepSeek 直连,谷时 | $0.15/M | $0.60/M | $0.27 |
| DeepSeek 直连,峰时 | $0.30/M | $1.20/M | $0.54 |
| Gemini 3.8 Flash,2026 年底前优惠价 | $0.75/M | $3.75/M | $1.50 |
| Qwen3.8 Flash,北京地区原价 | ¥0.80/M | ¥2.70/M | ¥1.34 |
DeepSeek 缓存命中输入为谷时每百万 0.003 美元、峰时 0.006 美元。Gemini Standard 优惠期的缓存读取为每百万 0.075 美元,另收存储费用。Qwen 北京缓存命中价为每百万 0.10 元。
这些是固定 tokens 的算术示例,不是任务实测,不含工具费用、缓存存储和重试。Qwen 保留人民币计价:未固定汇率与账单地区就换算,会让结果看起来比实际更精确。
tokens 单价不等于完成任务的价格。还要计入重试、输出长度、缓存命中率、工具失败及搜索费用。Gemini Standard 优惠期后有计划中的新费率,Qwen 则因地区而异。
多模态与工具,往往比榜单分数更能区分需求
单次请求需要原生处理音频、视频、PDF 与图像,或工作流依赖 Google Search grounding、代码执行时,优先测试 Gemini。其原生 API 提供的托管工具范围在本次比较中更广。
同时要求图像/视频理解、1M 上下文及阿里云指定地区部署时,优先测试 Qwen。OpenAI、Anthropic 兼容协议可能减少客户端迁移工作,但仍需验证功能是否一致。Qwen 的联网搜索支持北京和新加坡;官方文档未在法兰克福、东京、弗吉尼亚和香港提供该功能。
任务主要是文本、截图或编程 Agent,且直接 tokens 费用是重要约束时,优先测试 DeepSeek。它支持图像、工具调用与常见客户端协议,公布的输出上限也更大。不过,上限高不等于每个回答都应该更长。
API 兼容不代表行为一致
OpenAI 兼容接口通常允许复用认证、聊天请求和 SDK 基础代码,但不保证工具 schema、流式事件、思考控制、多模态编码或错误响应完全一致。原生功能可能仍需厂商自己的 API。
对每个候选使用相同的测试方式:
- 准备 20–50 个有代表性的任务,包括失败与边界案例。
- 固定地区、模型 ID、temperature、工具定义和输出 schema。
- 记录验收通过率、首个可用输出耗时、总 tokens 与重试。
- 测试限流恢复,以及一个供应商不可用的场景。
- 计算每个验收通过结果的成本,而非只看单次请求费用。
先把哪两个模型放进候选名单?
| 主要需求 | 优先测试 | 接着核验 |
|---|---|---|
| 比 Gemini 更低的直连美元 tokens 单价 | DeepSeek V4.1 Flash | 质量、峰谷调度与缓存命中率 |
| 音频、视频、PDF 加托管工具 | Gemini 3.8 Flash | 原生 API 集成与优惠期后的成本 |
| 阿里云指定地区部署、多模态长上下文 | Qwen3.8 Flash | 当地价格、配额和模型可用性 |
| 已有 OpenAI 风格客户端 | 三者文档列明的兼容接口均可评估 | 流式输出、工具调用与 schema 行为 |
Ofox 已列出 Gemini 3.8 Flash,协议包括 OpenAI 和 Gemini。按工作流选择协议,并检查所选路由报价;厂商原生功能不会自动出现在所有兼容层。本次更新核对的是文档能力,没有运行付费推理对比。
仅靠参数表无法选出通用赢家。先按需求筛出两个候选,再用自己的验收测试决定。
官方来源
常见问题
- 哪个 Flash 模型最便宜?
- 本表中 DeepSeek 直连的美元 tokens 单价低于 Gemini。Qwen 按地区以人民币列价,因此不能据此给三个模型排统一的价格名次。需要统一任务、币种、地区和缓存条件。
- 哪个模型支持的多模态输入最广?
- 这里 Gemini 3.8 Flash 的原生输入类型最广,包括文本、图像、视频、音频和 PDF。Qwen3.8 Flash 支持文本、图像和视频,DeepSeek V4.1 Flash 支持文本和图像。
- 三个模型都能用 OpenAI 兼容客户端吗?
- DeepSeek 和 Qwen 在官方文档中提供 OpenAI 兼容接口,Gemini 也提供兼容层。但原生 Gemini 功能可能仍需要 Google SDK 和请求格式,不能默认所有功能完全一致。
- 可以只看参数选型吗?
- 不可以。应使用相同的代表性任务、工具和验收标准,再比较每个通过验收的结果所需的成本、延迟及运行限制。


