Sonnet 5.5 API怎么收费?缓存、Batch和任务成本分别怎么算?
按官方价格计算 Sonnet 5.5 的输入、输出、缓存和 Batch 费用,用可复算示例区分单次请求价格与完成一项任务的总成本。
Claude Sonnet 5.5 在标准 Claude API 上的价格是每百万输入 token 2 美元、每百万输出 token 10 美元,缓存读取为每百万 token 0.20 美元。这是 2026 年 9 月 29 日核对的厂商公开价格,不是 Ofox 报价,也不是 Claude 订阅价格。做预算时,更需要弄清楚的是:应用完成一项符合验收要求的任务,实际用了多少计费 token。
如果你从 Sonnet 5 升级,价格表本身没有变化。Anthropic 所说的部分工作成本降低,涉及模型行为和 token 消耗,不能理解成所有请求统一打折。先看官方模型规格,再按自己的实际工作量估算。
Sonnet 5.5各项API价格
| token类别 | 每百万token价格(美元) | 统计范围 |
|---|---|---|
| 未缓存输入 | $2.00 | 未按缓存创建或读取计费的输入 |
| 输出 | $10.00 | 可计费输出,包括计费的思考用量 |
| 创建5分钟缓存 | $2.50 | 写入该缓存档位的token |
| 创建1小时缓存 | $4.00 | 写入该缓存档位的token |
| 缓存读取 | $0.20 | 实际从提示词缓存读取的token |
模型页面还列出了 Batch API 输入和输出 50% 的折扣,以及可缓存提示词的最低长度 512 token。达到长度不会自动创建缓存,需要配置缓存并核对 usage 字段。缓存 token 也不能再次计入普通输入,否则会重复计算。
工具、数据驻留选项和其他服务费用,需要另外查完整定价文档。不同供应商支持的功能、币种和计费规则可能不同,把厂商示例用于其他端点前,应核对该服务的现行条款。
一次小请求0.04美元,不等于整月预算
假设一次请求使用 10,000 个未缓存输入 token 和 2,000 个计费输出 token:
输入:10,000 / 1,000,000 × $2 = $0.02
输出: 2,000 / 1,000,000 × $10 = $0.02
合计: $0.04
如果每次用量完全相同,1,000 次请求就是 40 美元,尚未计入其他费用。这只是算术示例,不是对 Sonnet 典型回答长度的实测。思考过程变长、多一轮工具调用或发生重试,都会改变合计费用。用可见回答的字数乘上猜测的换算系数,不能可靠地估算账单。
缓存什么时候能改变费用
假设 10 次请求共用一个 100,000 token 的前缀,只创建一次 5 分钟缓存,后续 9 次都在有效期内实际命中,不考虑其他输入或输出。前缀的写入费用是 0.25 美元,读取费用是 9 × 0.02 美元,合计 0.43 美元;10 次全部按未缓存输入计费则是 2.00 美元。仅这个前缀节省 1.57 美元,即 78.5%。
这不代表整个应用打了 78.5% 的折扣。前缀变化、缓存未命中或大量输出,都可能降低整体节省比例。应逐次记录缓存创建与读取用量;提示词结构适合缓存,不代表供应商真的按缓存命中计费。
对于符合条件的非交互工作,单独评估 Batch。将其公开的输入/输出 50% 折扣应用于上面的未缓存 0.04 美元示例,在相同假设下得到 0.02 美元。这里没有把 Batch 与缓存叠加,也不代表所有组合都采用同一种计费方式。
按通过验收的任务算成本
修 Bug、写文档或做数据提取,都可以用下面的记录表:
任务ID | 模型 | Effort | 输入 | 缓存写入 | 缓存读取
输出 | 工具费用 | 尝试次数 | 是否通过验收 | 总费用(美元)
失败尝试和重试也要算进任务成本。先定义验收标准,例如测试通过、必填字段正确、交付物满足审核清单,再用总费用除以通过验收的任务数量。订阅用量单独记录;CLI 显示的 API 等价费用估算,不一定就是订阅账单上的扣款。
记录 effort 有实际意义。Artificial Analysis 发布时的评测发现 max 档输出消耗很高。但评测工作负载不能预测你的账单;测试还使用了受结构化输出问题影响的预发布部署,报告也说明相关评测将重跑。它提醒我们测量任务用量,不能据此认定 Sonnet 在所有场景都贵。
从 usage 记录还原账单
按上面的标准费率,完整的 token 费用公式是:
美元费用 =(2 × 普通输入
+ 2.5 × 五分钟缓存写入
+ 4 × 一小时缓存写入
+ 0.2 × 缓存读取
+ 10 × 计费输出)/ 1,000,000
这些是互斥的计费类别。Claude 的 usage 响应中,要区分 input_tokens、cache_creation_input_tokens 和 cache_read_input_tokens。如果混用缓存有效期,还要保留创建费用的分档明细。不要既计算缓存创建总数,又把五分钟、一小时的子项再算一次。网关若转换了响应格式,应以对应服务商的 usage 定义为准。字段缺失表示记录不完整,不能填成零费用。
假设一次请求包含 8,000 普通输入 token、40,000 五分钟缓存写入 token、60,000 缓存读取 token 和 3,000 输出 token。费用为 $0.016 + $0.100 + $0.012 + $0.030 = $0.158。输入上下文包含这三种输入类别,但它们并非全部按普通输入费率收费。把原始 usage 响应和计算结果保存在一起,之后对账才能定位具体类别,而不是凭提示词长度猜测。
另一个容易误算的部分是 thinking。可见答案很短,也可能包含较多计费思考 token;隐藏思考文本不会消除这部分用量。max_tokens 同时限制思考和文本输出,它是上限,不保证模型能在上限内正确完成任务。若因达到上限而中断,续跑之前要把这次未完成的尝试记入任务成本。
五分钟和一小时缓存,分别几次能回本?
仍以 100,000-token 前缀为例,不计其他用量。N 次调用全部不缓存,费用是 $0.20N。一次五分钟写入、随后 N−1 次真实命中,费用是 $0.25 + $0.02(N−1)。两次调用就比不缓存便宜:$0.27 对 $0.40。一小时写入则是 $0.40 + $0.02(N−1):两次共 $0.42,略贵于不缓存;三次为 $0.44,低于不缓存的 $0.60。
这个临界点假设只写入一次,随后都成功读取。不能只凭请求时间间隔推断命中,应查实际 usage。如果十次请求每次都重新写五分钟缓存,前缀成本是 $2.50,反而超过不缓存的 $2.00。只有减少的重写费用能够覆盖较高的创建费,一小时缓存才划算。
| 合成场景,仅计算前缀 | 费用 | 说明 |
|---|---|---|
| 10 次不缓存 | $2.00 | 每次 100K 输入的基线 |
| 1 次五分钟写入、9 次命中 | $0.43 | 只创建一次并复用 |
| 1 次一小时写入、9 次命中 | $0.58 | 创建更贵,读取费率相同 |
| 10 次分别写五分钟缓存 | $2.50 | 缓存不命中可能比不缓存更贵 |
把真正稳定的资料放在动态任务输入前面,但不要为了提高命中率而删掉必要上下文。缓存一大包无关代码仍可能浪费上下文;更小、未缓存的相关片段有时更合适。换模型也不等于能沿用旧模型的缓存:除非有对应服务支持和计费证据,否则不要在预算中假设跨模型复用。
三类可以自己复算的月度预算
下面使用标准同步 Claude API 费率,不含缓存、Batch 折扣和额外工具费。它们是预算算例,不是实际模型结果,也不是典型用量预测。
| 工作量假设 | 单任务计算 | 月任务量 | token 费用小计 |
|---|---|---|---|
| 短文本提取:4K 输入、500 输出 | $0.008 + $0.005 = $0.013 | 10,000 | $130 |
| 写作:12K 输入、4K 输出 | $0.024 + $0.040 = $0.064 | 1,000 | $64 |
| 编程循环:4 轮,每轮 30K 输入、2K 输出 | 4 × ($0.060 + $0.020) = $0.32 | 500 | $160 |
编程行每轮都计算输入费用。如果再次发送历史对话,后续轮次的输入可能增长,所以“四轮相同用量”只是简化假设。要做真实预测,应替换为逐轮实测 usage。工具返回内容可能进入下一轮输入;模型发出的工具调用、实际工具执行产生的独立费用,也属于不同收费项。
假设 500 个编程任务中有 100 个各增加一轮 $0.08 的调用,多付 $8,总额为 $168。最终只有 480 个通过验收,则每个合格任务的 token 成本为 $168 / 480 = $0.35。报告中保留 20 个失败任务:验收率是 96%,不能写成完成了 500 个任务。人工审阅、托管和外部工具费用仍不在这个小计中。
账单偏高时,先查最大的费用项
输出占大头,查 effort、真实 thinking 用量、截断和不必要的长回答;输入占大头,查重复历史和检索是否塞入过多无关材料;缓存创建占大头,核对写入与读取事件,不能只看“已经配置缓存”;重试占大头,分开记录无效请求、工具故障和验收不合格。Schema 错误需要修客户端,合法却不够好的答案才进入任务设计或模型选择调查。
费用保护要同时有应用层的单任务限额和单次请求输出上限。预算耗尽就停止并明确显示任务未完成。不要把应用限额说成官方速率限制,也不要静默换便宜模型后仍记录原模型名。采用 Batch 前,应确认任务可以接受异步完成且符合相应服务条件;低费率不意味着延迟返回适合交互用户。
接下来先查什么
如果价格表清楚、账单却不符合预期,先比较实际输出 token、缓存命中和重试次数,再考虑换供应商。调参可看 Sonnet 5.5 effort指南;选模型可看编程任务中Sonnet与Opus怎么选。
通过 Ofox 接入时,可在 Claude Sonnet 5.5 模型页核对模型 ID、当前供应商、价格和支持的协议。上面的算例采用 Anthropic 公布的费率,不代表每个供应商都支持 Anthropic 的全部功能。
常见问题
- Sonnet 5.5比Sonnet 5降价了吗?
- 没有。当前官方文档说明每 token 价格不变。但同一任务可能使用更多或更少 token,因此单价不变不代表总费用不变。
- Claude Pro或Team订阅包含API额度吗?
- 不要把订阅额度视为 API 余额。先确认客户端采用哪条计费路径,再分别核对对应套餐和 Claude API 价格表。
- max档一定是完成任务最省钱的方式吗?
- 没有普遍保证。用几个 effort 档位比较通过验收的结果,把重试和耗时一起记录。更高档位可能消耗更多输出,却没有提高验收通过率。


