DeepSeek V4.1 Flash、Gemini 3.8 Flash 与 Qwen3.8 Flash 对比

DeepSeek V4.1 Flash、Gemini 3.8 Flash 与 Qwen3.8 Flash 如何选?按固定用量比较价格,核对多模态、工具、地区和 API 兼容性,再验证任务效果。

浅色纸张上的黑色望远镜墨线图,标题为 DeepSeek V4.1 Flash 跨品牌对比。

怎么选取决于任务:DeepSeek V4.1 Flash 的直连美元 tokens 单价低于 Gemini;Gemini 3.8 Flash 的原生多模态输入和托管工具更广;Qwen3.8 Flash 则提供 1M 上下文、地区部署选项和常见兼容协议。 这里比较文档中列明的能力,不宣布评测赢家。

本文于 2026 年 9 月 14 日根据厂商官方文档更新。不同币种、地区与优惠期的报价不能直接排序,价格也可能变化。接入和账单细节分别见 DeepSeek V4.1 Flash API 指南Gemini 3.8 Flash 定价及接入指南

三个模型的主要区别

项目DeepSeek V4.1 FlashGemini 3.8 FlashQwen3.8 Flash
厂商DeepSeekGoogle阿里云
上下文1M1,048,576 tokens1M
最大输出384K65,536 tokens131,072 tokens
原生输入文本、图像文本、图像、视频、音频、PDF文本、图像、视频
文档列明的 API 形式OpenAI、Anthropic、ResponsesGemini API;OpenAI 兼容OpenAI、Anthropic 兼容
工具能力工具调用、JSON 输出函数调用、代码执行、搜索 grounding、计算机操作(预览)、结构化输出函数调用、结构化输出;北京和新加坡支持联网搜索
适合优先测试成本敏感的文本、图像和编程 Agent多模态输入丰富或需要 Google 工具的 Agent指定地区部署和多模态长上下文

上下文大小只是容量上限,不能证明模型能找对证据、遵守工具约定,或产出可用的十万 tokens 长答案。这些行为需要分别验证。

用固定用量比较价格

假设 100 万未缓存输入 tokens,加 20 万包含计费思考在内的输出 tokens,按官方列价计算:

路由与价格时段输入输出算例合计
DeepSeek 直连,谷时$0.15/M$0.60/M$0.27
DeepSeek 直连,峰时$0.30/M$1.20/M$0.54
Gemini 3.8 Flash,2026 年底前优惠价$0.75/M$3.75/M$1.50
Qwen3.8 Flash,北京地区原价¥0.80/M¥2.70/M¥1.34

DeepSeek 缓存命中输入为谷时每百万 0.003 美元、峰时 0.006 美元。Gemini Standard 优惠期的缓存读取为每百万 0.075 美元,另收存储费用。Qwen 北京缓存命中价为每百万 0.10 元。

这些是固定 tokens 的算术示例,不是任务实测,不含工具费用、缓存存储和重试。Qwen 保留人民币计价:未固定汇率与账单地区就换算,会让结果看起来比实际更精确。

tokens 单价不等于完成任务的价格。还要计入重试、输出长度、缓存命中率、工具失败及搜索费用。Gemini Standard 优惠期后有计划中的新费率,Qwen 则因地区而异。

多模态与工具,往往比榜单分数更能区分需求

单次请求需要原生处理音频、视频、PDF 与图像,或工作流依赖 Google Search grounding、代码执行时,优先测试 Gemini。其原生 API 提供的托管工具范围在本次比较中更广。

同时要求图像/视频理解、1M 上下文及阿里云指定地区部署时,优先测试 Qwen。OpenAI、Anthropic 兼容协议可能减少客户端迁移工作,但仍需验证功能是否一致。Qwen 的联网搜索支持北京和新加坡;官方文档未在法兰克福、东京、弗吉尼亚和香港提供该功能。

任务主要是文本、截图或编程 Agent,且直接 tokens 费用是重要约束时,优先测试 DeepSeek。它支持图像、工具调用与常见客户端协议,公布的输出上限也更大。不过,上限高不等于每个回答都应该更长。

API 兼容不代表行为一致

OpenAI 兼容接口通常允许复用认证、聊天请求和 SDK 基础代码,但不保证工具 schema、流式事件、思考控制、多模态编码或错误响应完全一致。原生功能可能仍需厂商自己的 API。

对每个候选使用相同的测试方式:

  1. 准备 20–50 个有代表性的任务,包括失败与边界案例。
  2. 固定地区、模型 ID、temperature、工具定义和输出 schema。
  3. 记录验收通过率、首个可用输出耗时、总 tokens 与重试。
  4. 测试限流恢复,以及一个供应商不可用的场景。
  5. 计算每个验收通过结果的成本,而非只看单次请求费用。

先把哪两个模型放进候选名单?

主要需求优先测试接着核验
比 Gemini 更低的直连美元 tokens 单价DeepSeek V4.1 Flash质量、峰谷调度与缓存命中率
音频、视频、PDF 加托管工具Gemini 3.8 Flash原生 API 集成与优惠期后的成本
阿里云指定地区部署、多模态长上下文Qwen3.8 Flash当地价格、配额和模型可用性
已有 OpenAI 风格客户端三者文档列明的兼容接口均可评估流式输出、工具调用与 schema 行为

Ofox 已列出 Gemini 3.8 Flash,协议包括 OpenAI 和 Gemini。按工作流选择协议,并检查所选路由报价;厂商原生功能不会自动出现在所有兼容层。本次更新核对的是文档能力,没有运行付费推理对比。

仅靠参数表无法选出通用赢家。先按需求筛出两个候选,再用自己的验收测试决定。

官方来源

常见问题

哪个 Flash 模型最便宜?
本表中 DeepSeek 直连的美元 tokens 单价低于 Gemini。Qwen 按地区以人民币列价,因此不能据此给三个模型排统一的价格名次。需要统一任务、币种、地区和缓存条件。
哪个模型支持的多模态输入最广?
这里 Gemini 3.8 Flash 的原生输入类型最广,包括文本、图像、视频、音频和 PDF。Qwen3.8 Flash 支持文本、图像和视频,DeepSeek V4.1 Flash 支持文本和图像。
三个模型都能用 OpenAI 兼容客户端吗?
DeepSeek 和 Qwen 在官方文档中提供 OpenAI 兼容接口,Gemini 也提供兼容层。但原生 Gemini 功能可能仍需要 Google SDK 和请求格式,不能默认所有功能完全一致。
可以只看参数选型吗?
不可以。应使用相同的代表性任务、工具和验收标准,再比较每个通过验收的结果所需的成本、延迟及运行限制。