Opus 5.5 便宜了 40%?先分清单价和任务成本
拆解 Claude Opus 5.5 的输入、输出、缓存及 Fast 价格,用固定用量复算降幅,解释为什么官方的 40% 不是每笔账单保证。
Claude Opus 5.5 的 Anthropic 直连 API 普通输入价为每百万 token 4 美元,输出 20 美元,比 Opus 5 的对应单价低 20%。 发布公告中的 40% 指厂商估算的典型任务成本变化,还包含 token 用量变化。
以下依据 Anthropic 公告与定价文档,于 2026 年 9 月 23 日核对。价格单位为美元/百万 token,适用的额外费用另计;这不是 Ofox 报价。
三种降幅不要混用
| 项目 | Opus 5 | Opus 5.5 | 单价下降 |
|---|---|---|---|
| 普通输入 | 5 | 4 | 20% |
| 输出 | 25 | 20 | 20% |
| 缓存读 | 0.50 | 0.20 | 60% |
| 5 分钟缓存写 | 6.25 | 5 | 20% |
| 1 小时缓存写 | 10 | 8 | 20% |
经常读取缓存的任务,与主要消耗新输入和输出的任务,实际降幅不同。模型若使用更少 token,还可能继续降低成本,但你自己的工作流不一定复现厂商测试中的任务组合。
因此,“典型任务成本下降约 40%”要保留 Anthropic 归因;不能改成所有账单、订阅和网关统一便宜 40%。
固定用量复算一次
假设普通输入 20,000、缓存读 60,000、5 分钟缓存写 20,000、输出 5,000 token,分类互不重叠,两个版本使用相同数量。
| 项目 | Opus 5 | Opus 5.5 |
|---|---|---|
| 普通输入 | 0.100 美元 | 0.080 美元 |
| 缓存读 | 0.030 美元 | 0.012 美元 |
| 缓存写 | 0.125 美元 | 0.100 美元 |
| 输出 | 0.125 美元 | 0.100 美元 |
| 合计 | 0.380 美元 | 0.292 美元 |
固定用量下约便宜 23.2%,不是 40%。这与厂商的典型任务估算不矛盾:本例只隔离单价变化,没有假设输出或上下文变少。它是费用演示,不是 Opus 性能测试。
下载费用 CSV与计算器可复算;评估自己的应用时应换成真实计费用量,而非可见文字数。
缓存时长会改变写入价
5 分钟和 1 小时缓存的写入价格不同。选择时考虑后续是否会复用,并把第一次写入计入成本。只有一次使用的前缀,不能获得多次读取带来的节省。
普通输入、读、写应分开。若导出字段包含总输入和缓存细项,先读清定义,不能把缓存前缀同时算进普通输入和写入。也不能把 OpenAI 的 30 分钟缓存规则或长上下文门槛直接套给 Anthropic。
Fast 和 Batch 分别适合什么
Opus 5.5 Fast 的输入/输出价为每百万 token 8/40 美元;更快的生成服务不保证整个代理任务按固定倍数提速,工具执行、代码库检查和人工审阅也耗时。
Batch 的输入/输出价为 2/10 美元,面向异步任务。Fast 不能与 Batch 组合。完整预算还要核对缓存时长、可用模式和地域要求,不应只拿两项 token 单价推算所有场景。
交互任务要判断等待时间是否值得更高费率;离线任务则看异步完成是否符合截止时间。这些判断与“模型能否给出合格答案”分别验证。
订阅额度不能按 API 单价换算
发布公告另有五小时额度增加和可保存的限额重置权益。这不等于无限使用,也不能据此计算每个套餐一定能发多少条消息。
Claude Code 选模指南介绍入口和额度检查;Sol 与 Opus 5.5 对比按明确假设比较费用。购买网关服务前,仍需核对真实供应商报价和路由。
常见问题
- 所有 Opus 5.5 请求都便宜 40% 吗?
- 不是。40% 是厂商对典型任务成本的估计;普通输入与输出单价下降 20%,缓存读下降 60%。
- Fast 可以叠加 Batch 折扣吗?
- 不可以,两者是不同处理选项,不能组合使用。
- 例子为什么只省约 23.2%?
- 例子固定了所有 token 数量;厂商的典型任务估计还考虑了用量变化。


