DeepSeek V4 Flash 涨价前:6 个真正省钱的杠杆(2026)
DeepSeek 官方已挂涨价预告。缓存命中比未命中便宜 50 倍,22 家托管商缓存读价差 28 倍,最顺手的 slug 买到的是旧版 0423。6 个可执行杠杆加盈亏平衡算法。
涨价通知说了什么,今天又花你多少钱
公告: DeepSeek API「显著」涨价,2026-08-06 发布,无幅度,无日期
V4 Flash 现价: $0.14/M 输入(缓存未命中)、$0.0028/M 输入(缓存命中)、$0.28/M 输出
缓存命中 vs 未命中:输入便宜 50 倍
托管商缓存价差: 22 家从 $0.0028 到 $0.078 每 1M(28 倍)
最低输入价: DeepInfra $0.09/M,但是 fp4 量化
盈亏平衡: 约 77% 缓存命中率决定走官方还是走第三方
slug 陷阱: deepseek/deepseek-v4-flash 是旧的 0423 版
思考模式: 默认开启,effort 为 high,按输出价计费
2026 年 8 月 6 日,DeepSeek 在定价页挂出通知:计划近期上调 DeepSeek API 服务的整体价格,预计涨幅显著,请据此规划用量。没有数字,没有日期。r/DeepSeek 上那条讨论帖一天内跑到 115 条评论,最高赞的回应只有两个词。
有用的反应不是连夜迁移。大多数在跑 V4 Flash 的人本来就在多付好几倍的钱,而原因跟价目表毫无关系。这里面有六个原因今天就能改,赶在新价格落地之前。
哪些杠杆真的能压账单?
缓存行为和托管商选择,按这个顺序。价目表反而最不重要。 下面按每个杠杆能撬动多少钱排序,依据是本文后面的价格数据。
| 杠杆 | 影响量级 | 改造成本 |
|---|---|---|
| 缓存命中 vs 未命中 | 输入 token 50 倍 | 中 |
| 托管商缓存读价 | 缓存输入最高 28 倍 | 低 |
| 思考模式开关 | 砍掉按输出价计费的推理 token | 低 |
| 选对模型版本 | 同价换新模型 | 低 |
| 量化与上下文 | 质量与截断风险 | 低 |
| Harness 选择 | 改变每个任务的 token 量 | 高 |
前两项互相纠缠,所以「谁最便宜」没有固定答案。按顺序过一遍。
值得为这件事花一下午吗?
如果你在 V4 Flash 上每月花超过约 $50,值得。低于这个数,做第 3 项和第 5 项就收工。 不是每种负载都撑得起这场审计。
整份清单都值得做的情况:
- 你在跑 agent,也就是长的多轮会话,同一段上下文要重放几十次。50 倍的缓存差距正是在这里滚成真金白银。
- 你的月度支出大到一旦涨 2 到 4 倍,就得找人谈预算。
- 你在用第三方托管商,而且从没查过它的缓存读价、量化精度和上下文上限。
不值得做的情况:
- 你发的是零散的一次性请求,没有共享前缀。没有缓存可命中,本文大部分内容对你不适用,挑输入价最低的然后继续干活。
- 你还在做原型。模型选择会在账单变重要之前先变。
- 你的流量已经走 DeepSeek 官方、前缀稳定、思考模式按任务调过。该做的你都做了。
停止规则: 如果你修好了 slug(第 3 节)、查过托管商的缓存读那一列(第 2 节),没发现异常,那么剩下几项的收益只有个位数百分比。回去发版吧。
1. 为什么缓存命中比未命中便宜 50 倍?
因为 DeepSeek 给缓存输入定价 $0.0028/M,而未命中是 $0.14/M。 这是整个页面上最大的一个倍数,把其他所有你能调的东西都盖过去了。
| 项目 | V4 Flash | V4 Pro |
|---|---|---|
| 输入,缓存命中 | $0.0028 | $0.003625 |
| 输入,缓存未命中 | $0.14 | $0.435 |
| 输出 | $0.28 | $0.87 |
| 上下文 | 1M | 1M |
| 最大输出 | 384K | 384K |
缓存默认开启,不需要改代码,但它的匹配规则比你在别家见过的前缀缓存更严,值得弄明白。
DeepSeek 存的是缓存前缀单元(cache prefix unit),一个请求只有在完整匹配其中某个单元时才算命中。单元会在请求边界(你的输入结尾和模型输出结尾)落盘,也会在长输入内部按固定 token 间隔落盘,还会在系统发现多个请求共享某段前缀时落盘。
实际后果常常让人踩空。追加是有效的:先发 A + B,再发 A + B + C,第二个请求命中第一个留下的单元。分叉则无效,至少不是立刻有效。先发 A + B,再发 A + C,第二个请求是完全未命中,哪怕两者都共享 A。真正发生的是系统注意到了共享的 A 并把它落成独立单元,于是第三个请求 A + D 才终于命中。
这意味着扇出模式,也就是一份长文档配许多个不同问题,前两次调用要付全价,从第三次才开始省。如果你用两个请求测缓存然后断定它不管用,原因就在这。
顺序仍然重要,因为一个永远不重复的单元永远不会被复用。
最常打断前缀的四件事,按出现频率粗排:
- system prompt 里的时间戳或日期。 写「Today is 2026-08-06T14:22:11Z」会让每一次调用都缓存失效。模型如果确实需要日期,把它放进最后一条 user 消息。
- 由 dict 或 set 生成的工具列表。 迭代顺序每次运行都不同,JSON 输出被打乱,前缀永远对不上。给列表排序。
- 检索结果被放在指令前面。 RAG 输出按设计每次都不一样,它该放在稳定的 system prompt 之后,而不是之前。
- 为了链路追踪注入的 session ID 或 request ID。 有用,而且挪到末尾不花一分钱。
修法在每种情况下都一样:稳定的内容在前,易变的内容在后。验证是否生效要读 usage 对象,别靠看排版猜。DeepSeek 会返回 prompt_cache_hit_tokens 和 prompt_cache_miss_tokens,两者的比值就是本文每个决策都依赖的那个数,测它只需要一个请求。
r/DeepSeek 上有位用户贴了七天账单:约 24M 输入、6M 输出,总共 $1.87,他把账单降了约 70% 归功于上下文缓存。拿它当基准之前值得先算一遍:按官方价,24M 输入加 6M 输出在 70% 命中率下大约是 $2.74,要压到 $1.87 需要命中率接近 96%。要么缓存表现比他报的更好,要么有一部分流量跑在别处。那条帖子下面最高赞的回复也值得读,来自一个每天烧 200M 输入 token 的人,他说 24M「差得还远」。两个数字都是真的,只是在描述两种活。
2. DeepSeek V4 Flash 哪家托管商最便宜?
跟你的缓存命中率匹配的那家,而答案在 77% 附近翻转。 OpenRouter 为 0731 版列出 22 家托管商,输入价和输出价都聚在 2 倍上下的区间里,缓存读不是。
| 托管商 | 输入 | 输出 | 缓存读 | vs 官方 | 量化 | 上下文 |
|---|---|---|---|---|---|---|
| DeepInfra | $0.09 | $0.18 | $0.018 | 6.4x | fp4 | 1M |
| GMICloud | $0.126 | $0.252 | $0.0252 | 9.0x | fp8 | 1M |
| BaseTen | $0.13 | $0.26 | $0.028 | 10x | fp8 | 1M |
| DeepSeek 官方 | $0.14 | $0.28 | $0.0028 | 1x | fp8 | 1M |
| Fireworks | $0.14 | $0.28 | $0.028 | 10x | 未知 | 1M |
| Cloudflare | $0.14 | $0.28 | $0.028 | 10x | fp8 | 384K |
| AkashML | $0.14 | $0.28 | $0.02 | 7.1x | fp8 | 131K |
| Parasail | $0.14 | $0.28 | $0.07 | 25x | fp8 | 1M |
| Io Net | $0.16 | $0.32 | $0.078 | 28x | fp8 | 262K |
| Phala | $0.20 | $0.40 | $0.07 | 25x | 未知 | 1M |
把 Parasail 那一行再看一遍。输入价跟走官方一样,输出价一样,缓存读贵 25 倍。没有任何一种负载适合选它。Phala、Io Net、Morph 同理。Reddit 上有帖子把这个现象归到 OpenRouter 头上,说是零数据留存路由导致的;更完整的解释来自一条回复:这些不过是别的公司在托管同一份权重,既没有 DeepSeek 的缓存基础设施,也没有它的利润空间。
真正在输入价上压过官方的是 DeepInfra、GMICloud 和 BaseTen。它们能不能帮你省钱,取决于你的流量形状:
| 输出占输入的比例 | 盈亏平衡缓存命中率(DeepInfra vs 官方) |
|---|---|
| 0% | 77% |
| 5% | 84% |
| 10% | 92% |
| 20%+ | 永远不会;DeepInfra 一直更便宜 |
低于平衡点选便宜的托管商,高于平衡点走官方。拿那条 Reddit 帖子的 24M/6M 形状在 70% 命中率下算:DeepInfra $2.03,官方 $2.74,Parasail $3.86。零缓存时:DeepInfra $3.24,官方 $5.04。
3. 你买到的真是你以为的那个模型吗?
多半不是,如果你用了那个最顺眼的 slug。 在 OpenRouter 上,deepseek/deepseek-v4-flash 指向的是 DeepSeek V4 Flash 0423。当前版本挂在 deepseek/deepseek-v4-flash-0731,是另一条独立条目。
deepseek/deepseek-v4-flash -> V4 Flash 0423 (older)
deepseek/deepseek-v4-flash-0731 -> V4 Flash 0731 (current)
~deepseek/deepseek-v4-flash-latest -> tracks current
0731 这一版正是 r/LocalLLaMA 和 r/DeepSeek 讨论帖里一直在夸的那个,说它修好了长 agent 会话里的上下文腐化。因为一个默认 slug 就用差不多的价钱买到四月版本,是这份清单里最便宜的一处错误。
4. fp4 和 131K 上下文实际让你付出什么?
发票上看不见的质量,以及会话跑到一半才发现的截断。 那些输入便宜的托管商卖的并不是同一件东西。
DeepInfra 的 $0.09 输入价是全表最低,跑的是 fp4 量化。Sail Research、Ambient、Ionstream 也是。其余大多数跑 fp8,还有几家报「未知」。DeepSeek 自家端点报的是 fp8。没有任何一家公布过自己 fp4 与 fp8 服务这个模型的基准差值,所以把 fp4 端点上 36% 的输入折扣当成一笔代价未测量的交易,而不是白捡的便宜。
上下文窗口的差异比价格差异还大:
- AkashML:131K
- CoreWeave、AtlasCloud、Io Net:262K
- Cloudflare:384K
- DeepSeek 官方及其余大多数:1M
如果你按输入价挑了托管商,然后 agent 悄无声息地在 131K 处开始截断,来源就在这里。模型支持 1M,卡住你的是托管商。
5. 该关掉思考模式吗?
有时候该,而且它默认开着、effort 是 high,多数人没意识到这点。 DeepSeek 文档写得很直白:思考模式默认启用,默认 effort 为 high。那些推理 token 按输出价计费。
# OpenAI format: disable thinking
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[...],
extra_body={"thinking": {"type": "disabled"}},
)
Anthropic 格式下的等价写法是 {"reasoning": {"effort": "none"}}。effort 档位在不同模型上的映射不同:在 V4 Flash 上,low 映射到 low,xhigh 向下映射到 high;而 V4 Pro 会把 low 向上映射到 high。
全局翻开关之前有两件事值得知道。思考模式会忽略 temperature、top_p、presence_penalty 和 frequency_penalty,而且设了也不报错,所以一份看起来调过参的配置可能什么都没做。另外关掉它会牺牲多步任务上的准确率,而多步任务恰恰是人们用 V4 Flash 干的事。抽取、分类、格式化时关掉;重构和调试时留着。
我们是通过网关而不是直连 DeepSeek 端点测的这项,数字被网关侧的参数处理搅浑了,所以这里不公布倍数。用你自己的 prompt、在你自己的流量上,读 usage 对象里的 completion_tokens_details.reasoning_tokens,前后各测一次。
在攒这份数据的期间有个好用的经验法则:如果一个人类审阅者不看推导过程就会接受这个答案,那么思考大概没挣回它的成本。从发票里抽字段、给工单打标签、重排 JSON、写 commit message,都落在这一档。而任何答错了代价高且错得不明显的活,涵盖了大部分重构和几乎所有调试,就是推理 token 值回票价的地方。按任务类型路由,别去翻一个全局开关,等新价格落地后再复查一遍,因为这些 token 计的正是输出价。
6. Harness 会改变账单吗?
比价目表改得更多,因为它决定每个任务花多少 token。 r/DeepSeek 上没人对选哪个达成一致,但所有人都同意这件事重要。
反复出现的名字是 OpenCode、Reasonix、Pi 和 Codex。一位用户说 Reasonix 靠更好的缓存命中把一个长任务「从 20 分钟压到 5 分钟」;另一位说它跟 Pi 或 OpenCode 比「还是有点毛病,也不好扩展」。第三位提到 DeepSeek 原生支持 Codex 之后就彻底不需要代理了。没有共识选项,诚实的结论是:harness 开销真实存在、量级不小,而且高度取决于你的负载。
真正值得内化的是机制:每一个 agent 回合都会重放整段对话。保持前缀稳定的 harness 命中缓存,重放部分按 $0.0028/M 计费;每回合重建上下文的 harness,同样这批 token 要按 $0.14/M 付。这就是第 1 节那个 50 倍,一次会话里被应用几十遍。
价格翻倍后这套算法会怎样?
走官方几乎在所有场景都不再占优,因为第三方托管商没有理由跟涨。 OpenRouter 上那些托管商是在自己的硬件上跑开源权重。DeepSeek 调价只动 DeepSeek 自己的端点,动不了它们,于是本文所有的盈亏平衡点会同时挪位。
倍数还没人知道,所以这里把同一份 24M 输入 / 6M 输出、70% 缓存命中率的负载放进三种情景,DeepInfra 保持不变作为第三方参照:
| 情景 | DeepSeek 官方 | DeepInfra | 更便宜的 |
|---|---|---|---|
| 今天 | $2.74 | $2.03 | DeepInfra |
| 官方价 2x | $5.47 | $2.03 | DeepInfra |
| 官方价 4x | $10.94 | $2.03 | DeepInfra |
这份负载今天就已经偏向第三方了,因为 24M 输入配 6M 输出算是输出偏重,足以让更便宜的输出价占主导。只有当输出只占输入的一小部分时,缓存优势才救得了走官方这条路。就算在那里地面也在动:纯输入流量下,对 DeepInfra 的盈亏平衡命中率今天约是 77%,如果官方价翻倍会升到约 94%。在这条线以上,你仍然想要官方端点那个 $0.0028 的缓存读;在这条线以下,你是在补贴一个自己没命中的缓存。
实操结论:如果你的缓存命中率确实高于 90% 且输出量很小,涨价会疼但走官方可能仍然占优。其他人都该在数字落地之前准备好一条测试过的第二路径。
什么时候干脆换模型?
等新价格落地、算下来不划算的时候,不是现在。 讨论帖里全是提前站队 GPT-5.6 Luna 的人,它确实是被点名最多的替代选项,也确实带视觉支持。把它放进候选名单是合理的,今天就拍板则是糟糕的决定,因为 DeepSeek 一个数字都还没公布。
关于这事能挪多远,有个参照:一位评论者回忆 DeepSeek 在四五月间降价约 75%,后来把降价转成永久,据此推断「显著」可能意味着大致回到旧价位,也就是涨 4 倍。那是一个人根据公开历史做的推断,不是内部消息。按区间做准备,别按某个数字。
现在就值得做的:
- 把你真实的缓存命中率打点出来。上面每个决策都依赖它,而几乎没人在测。
- 让第二家供应商在开关后面跑通,这样切换是改配置而不是立项。
- 新价格公布后重算盈亏平衡表。77% 这个数字只对今天的价格成立。
团队该怎么落这套东西?
托管商和思考策略集中决定,然后别再让个人各挑各的。 在团队里,故障模式不是一个错误选择,而是六个没人看得见的不同选择。
有三件事值得一次性达成一致:
- 把模型字符串钉在共享配置里,而不是各个服务里。 当四个服务各自硬编码自己的 slug 时,0423 与 0731 的问题会被乘以四。一个常量、一个位置,版本升级就变成一次评审。
- 按负载类别设思考策略,不是按开发者。 抽取和分类类服务关掉思考。agent 和重构类服务留着。把规则写下来,因为默认是开的,而没人会注意到一个默认值。
- 按服务而不是按组织统计缓存命中率。 聚合数字会盖住那个在 system prompt 里塞了时间戳、每次调用都在付 50 倍的服务。把
prompt_cache_hit_tokens和prompt_cache_miss_tokens跟现有请求指标一起打点,异常值立刻现形。
这件事做错的账单后果分布不均。一个配错的高流量服务可能比团队其他所有服务加起来还贵,而且从外面看跟配对了的一模一样。
怎么把第二条路径养着?
走一个两种协议都说的入口,这样兜底就只是换个模型字符串。 DeepSeek 同时提供 OpenAI 格式端点和位于 https://api.deepseek.com/anthropic 的 Anthropic 格式端点,这也是 V4 Flash 能不加转接层就塞进 Claude 形态工具链的原因。
如果你不想在局势明朗之前给每家供应商各开一个账号,ofox 上 V4 Flash 的价格与走官方相同,同样是 $0.14 / $0.28 / $0.0028,两种协议共用一把 key。它不比 DeepSeek 官方便宜,任何告诉你网关能在源站自家模型上比源站更便宜的人都在卖东西。它买到的是一次集成,新价格来了之后可以在后面换模型。
那些悄悄花钱的常见错误
| 错误 | 代价 | 修法 |
|---|---|---|
| system prompt 里有易变前缀 | 每个请求都是缓存未命中,50 倍 | 把时间戳和检索结果挪到末尾 |
| 只按输入价挑托管商 | 缓存输入最高 28 倍 | 查缓存读那一列 |
用 deepseek/deepseek-v4-flash | 拿到的是 0423 版 | 改用 -0731 的 slug |
| 默认哪里都是 1M 上下文 | 在 131K 处静默截断 | 查托管商的上下文那一列 |
| 抽取任务还开着思考 | 推理 token 按输出价计费 | 按任务类型关闭 |
| 在思考模式下调 temperature | 什么都不会发生,也不报错 | 思考模式下这些参数被忽略 |
| 相信那份高峰时段表 | 围着一份未公布的政策做规划 | 截至 2026-08-06 官方页上没有 |
值得考虑的替代方案
- DeepSeek 官方。 缓存读比次优托管商便宜 6.4 倍,fp8,完整 1M 上下文。最适合缓存密集的 agent 活。
- DeepInfra、GMICloud、BaseTen。 输入是真便宜。最适合一次性、低缓存的流量。先查量化精度。
- ofox。 与官方同价,两种协议一把 key,想要一条可切换路径时有用。不是折扣。
- GPT-5.6 Luna。 r/DeepSeek 点名最多的替代选项,带视觉支持。等 DeepSeek 公布数字后再比。
- 自托管。 权重是开放的。r/LocalLLaMA 上有人用 2 张 RTX 3090 加一台二手服务器跑 0731 版。只有在你已经拥有硬件时才划算。
至于完全不花钱的路径,我们单独写过 DeepSeek V4 Flash free: 4 zero-cost paths。完整价目表拆解(含 V4 Pro)见 DeepSeek V4 API pricing guide,Pro 上的钱到底花在哪见 cache miss and thinking costs。如果涨价后 Flash 不再是性价比之选,Flash 对决 Gemini 3.6 Flash 覆盖了最接近的预算型对手,如何降低 AI API 成本 则把上面这些缓存技巧做了推广。
来源
常见问题
- DeepSeek API 要涨价了吗?
- 是。截至 2026 年 8 月 6 日,官方定价页挂着这条通知:「We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected.」没给幅度,也没给生效日期。当前价格仍然有效:V4 Flash 缓存未命中 $0.14/M 输入,缓存命中 $0.0028/M,输出 $0.28/M。
- DeepSeek 是不是要按高峰时段收 2 倍?
- 截至 2026-08-06,官方定价页上没有这条。Reddit 上一条高赞评论引用了一份高峰/低谷政策,称北京时间 9:00-12:00 和 14:00-18:00 按 2 倍计价,但这段文字并不在线上的定价页上,页面上只有那条整体涨价通知。在 DeepSeek 正式公布之前,把这份高峰时段表当成未经证实的信息。
- 跑 DeepSeek V4 Flash 哪家托管商最便宜?
- 完全取决于你的缓存命中率。DeepInfra 输入报 $0.09/M,低于 DeepSeek 自家的 $0.14/M,但它的缓存读要 $0.018/M,而 DeepSeek 只要 $0.0028/M。缓存命中率大约低于 77% 时第三方托管商更划算,高于这条线走官方更划算。如果你的输出量超过输入量的约 20%,那么无论命中率如何,便宜的托管商都更划算。
- 为什么别家的缓存读贵这么多?
- 第三方托管商是在自己的基础设施上跑开源权重,既没有 DeepSeek 那套缓存栈,也没有它的定价补贴。OpenRouter 上 0731 版列出的 22 家托管商里,缓存读从每 1M $0.0028 到 $0.078,相差 28 倍,而输入价和输出价彼此只在 2 倍上下的区间内。
- 用 deepseek/deepseek-v4-flash 拿到的是最新模型吗?
- 不是。在 OpenRouter 上这个 slug 指向的是 DeepSeek V4 Flash 0423。当前版本是另一条独立条目 deepseek/deepseek-v4-flash-0731。挑那个看起来最顺眼的 slug,等于在价格差不多的前提下悄悄买了一个旧模型。
- 关掉思考模式能省钱吗?
- 能省下按输出价计费的那部分推理 token。按 DeepSeek 文档,思考模式默认开启,effort 默认是 high。OpenAI 格式下用 thinking type disabled 关闭,Anthropic 格式下用 reasoning effort none。多步任务上质量会掉,所以这是按任务决定的开关,不是全局开关。
- 涨价之后 GPT-5.6 Luna 会比 DeepSeek 便宜吗?
- 在 DeepSeek 公布数字之前无法判断。Luna 是 r/DeepSeek 涨价帖里被点名最多的替代选项,部分原因是它支持视觉。任何在新价格落地之前写出来的对比都是猜测。


