Sonnet 5.5 API怎么收费?缓存、Batch和任务成本分别怎么算?

按官方价格计算 Sonnet 5.5 的输入、输出、缓存和 Batch 费用,用可复算示例区分单次请求价格与完成一项任务的总成本。

价格标签的艺术线稿,配有 Sonnet 5.5 API 标题。

Claude Sonnet 5.5 在标准 Claude API 上的价格是每百万输入 token 2 美元、每百万输出 token 10 美元,缓存读取为每百万 token 0.20 美元。这是 2026 年 9 月 29 日核对的厂商公开价格,不是 Ofox 报价,也不是 Claude 订阅价格。做预算时,更需要弄清楚的是:应用完成一项符合验收要求的任务,实际用了多少计费 token。

如果你从 Sonnet 5 升级,价格表本身没有变化。Anthropic 所说的部分工作成本降低,涉及模型行为和 token 消耗,不能理解成所有请求统一打折。先看官方模型规格,再按自己的实际工作量估算。

Sonnet 5.5各项API价格

token类别每百万token价格(美元)统计范围
未缓存输入$2.00未按缓存创建或读取计费的输入
输出$10.00可计费输出,包括计费的思考用量
创建5分钟缓存$2.50写入该缓存档位的token
创建1小时缓存$4.00写入该缓存档位的token
缓存读取$0.20实际从提示词缓存读取的token

模型页面还列出了 Batch API 输入和输出 50% 的折扣,以及可缓存提示词的最低长度 512 token。达到长度不会自动创建缓存,需要配置缓存并核对 usage 字段。缓存 token 也不能再次计入普通输入,否则会重复计算。

工具、数据驻留选项和其他服务费用,需要另外查完整定价文档。不同供应商支持的功能、币种和计费规则可能不同,把厂商示例用于其他端点前,应核对该服务的现行条款。

一次小请求0.04美元,不等于整月预算

假设一次请求使用 10,000 个未缓存输入 token 和 2,000 个计费输出 token:

输入:10,000 / 1,000,000 × $2  = $0.02
输出: 2,000 / 1,000,000 × $10 = $0.02
合计:                           $0.04

如果每次用量完全相同,1,000 次请求就是 40 美元,尚未计入其他费用。这只是算术示例,不是对 Sonnet 典型回答长度的实测。思考过程变长、多一轮工具调用或发生重试,都会改变合计费用。用可见回答的字数乘上猜测的换算系数,不能可靠地估算账单。

缓存什么时候能改变费用

假设 10 次请求共用一个 100,000 token 的前缀,只创建一次 5 分钟缓存,后续 9 次都在有效期内实际命中,不考虑其他输入或输出。前缀的写入费用是 0.25 美元,读取费用是 9 × 0.02 美元,合计 0.43 美元;10 次全部按未缓存输入计费则是 2.00 美元。仅这个前缀节省 1.57 美元,即 78.5%。

这不代表整个应用打了 78.5% 的折扣。前缀变化、缓存未命中或大量输出,都可能降低整体节省比例。应逐次记录缓存创建与读取用量;提示词结构适合缓存,不代表供应商真的按缓存命中计费。

对于符合条件的非交互工作,单独评估 Batch。将其公开的输入/输出 50% 折扣应用于上面的未缓存 0.04 美元示例,在相同假设下得到 0.02 美元。这里没有把 Batch 与缓存叠加,也不代表所有组合都采用同一种计费方式。

按通过验收的任务算成本

修 Bug、写文档或做数据提取,都可以用下面的记录表:

任务ID | 模型 | Effort | 输入 | 缓存写入 | 缓存读取
输出 | 工具费用 | 尝试次数 | 是否通过验收 | 总费用(美元)

失败尝试和重试也要算进任务成本。先定义验收标准,例如测试通过、必填字段正确、交付物满足审核清单,再用总费用除以通过验收的任务数量。订阅用量单独记录;CLI 显示的 API 等价费用估算,不一定就是订阅账单上的扣款。

记录 effort 有实际意义。Artificial Analysis 发布时的评测发现 max 档输出消耗很高。但评测工作负载不能预测你的账单;测试还使用了受结构化输出问题影响的预发布部署,报告也说明相关评测将重跑。它提醒我们测量任务用量,不能据此认定 Sonnet 在所有场景都贵。

从 usage 记录还原账单

按上面的标准费率,完整的 token 费用公式是:

美元费用 =(2 × 普通输入
          + 2.5 × 五分钟缓存写入
          + 4 × 一小时缓存写入
          + 0.2 × 缓存读取
          + 10 × 计费输出)/ 1,000,000

这些是互斥的计费类别。Claude 的 usage 响应中,要区分 input_tokens、cache_creation_input_tokens 和 cache_read_input_tokens。如果混用缓存有效期,还要保留创建费用的分档明细。不要既计算缓存创建总数,又把五分钟、一小时的子项再算一次。网关若转换了响应格式,应以对应服务商的 usage 定义为准。字段缺失表示记录不完整,不能填成零费用。

假设一次请求包含 8,000 普通输入 token、40,000 五分钟缓存写入 token、60,000 缓存读取 token 和 3,000 输出 token。费用为 $0.016 + $0.100 + $0.012 + $0.030 = $0.158。输入上下文包含这三种输入类别,但它们并非全部按普通输入费率收费。把原始 usage 响应和计算结果保存在一起,之后对账才能定位具体类别,而不是凭提示词长度猜测。

另一个容易误算的部分是 thinking。可见答案很短,也可能包含较多计费思考 token;隐藏思考文本不会消除这部分用量。max_tokens 同时限制思考和文本输出,它是上限,不保证模型能在上限内正确完成任务。若因达到上限而中断,续跑之前要把这次未完成的尝试记入任务成本。

五分钟和一小时缓存,分别几次能回本?

仍以 100,000-token 前缀为例,不计其他用量。N 次调用全部不缓存,费用是 $0.20N。一次五分钟写入、随后 N−1 次真实命中,费用是 $0.25 + $0.02(N−1)。两次调用就比不缓存便宜:$0.27 对 $0.40。一小时写入则是 $0.40 + $0.02(N−1):两次共 $0.42,略贵于不缓存;三次为 $0.44,低于不缓存的 $0.60。

这个临界点假设只写入一次,随后都成功读取。不能只凭请求时间间隔推断命中,应查实际 usage。如果十次请求每次都重新写五分钟缓存,前缀成本是 $2.50,反而超过不缓存的 $2.00。只有减少的重写费用能够覆盖较高的创建费,一小时缓存才划算。

合成场景,仅计算前缀费用说明
10 次不缓存$2.00每次 100K 输入的基线
1 次五分钟写入、9 次命中$0.43只创建一次并复用
1 次一小时写入、9 次命中$0.58创建更贵,读取费率相同
10 次分别写五分钟缓存$2.50缓存不命中可能比不缓存更贵

把真正稳定的资料放在动态任务输入前面,但不要为了提高命中率而删掉必要上下文。缓存一大包无关代码仍可能浪费上下文;更小、未缓存的相关片段有时更合适。换模型也不等于能沿用旧模型的缓存:除非有对应服务支持和计费证据,否则不要在预算中假设跨模型复用。

三类可以自己复算的月度预算

下面使用标准同步 Claude API 费率,不含缓存、Batch 折扣和额外工具费。它们是预算算例,不是实际模型结果,也不是典型用量预测。

工作量假设单任务计算月任务量token 费用小计
短文本提取:4K 输入、500 输出$0.008 + $0.005 = $0.01310,000$130
写作:12K 输入、4K 输出$0.024 + $0.040 = $0.0641,000$64
编程循环:4 轮,每轮 30K 输入、2K 输出4 × ($0.060 + $0.020) = $0.32500$160

编程行每轮都计算输入费用。如果再次发送历史对话,后续轮次的输入可能增长,所以“四轮相同用量”只是简化假设。要做真实预测,应替换为逐轮实测 usage。工具返回内容可能进入下一轮输入;模型发出的工具调用、实际工具执行产生的独立费用,也属于不同收费项。

假设 500 个编程任务中有 100 个各增加一轮 $0.08 的调用,多付 $8,总额为 $168。最终只有 480 个通过验收,则每个合格任务的 token 成本为 $168 / 480 = $0.35。报告中保留 20 个失败任务:验收率是 96%,不能写成完成了 500 个任务。人工审阅、托管和外部工具费用仍不在这个小计中。

账单偏高时,先查最大的费用项

输出占大头,查 effort、真实 thinking 用量、截断和不必要的长回答;输入占大头,查重复历史和检索是否塞入过多无关材料;缓存创建占大头,核对写入与读取事件,不能只看“已经配置缓存”;重试占大头,分开记录无效请求、工具故障和验收不合格。Schema 错误需要修客户端,合法却不够好的答案才进入任务设计或模型选择调查。

费用保护要同时有应用层的单任务限额和单次请求输出上限。预算耗尽就停止并明确显示任务未完成。不要把应用限额说成官方速率限制,也不要静默换便宜模型后仍记录原模型名。采用 Batch 前,应确认任务可以接受异步完成且符合相应服务条件;低费率不意味着延迟返回适合交互用户。

接下来先查什么

如果价格表清楚、账单却不符合预期,先比较实际输出 token、缓存命中和重试次数,再考虑换供应商。调参可看 Sonnet 5.5 effort指南;选模型可看编程任务中Sonnet与Opus怎么选。

通过 Ofox 接入时,可在 Claude Sonnet 5.5 模型页核对模型 ID、当前供应商、价格和支持的协议。上面的算例采用 Anthropic 公布的费率,不代表每个供应商都支持 Anthropic 的全部功能。

常见问题

Sonnet 5.5比Sonnet 5降价了吗?
没有。当前官方文档说明每 token 价格不变。但同一任务可能使用更多或更少 token,因此单价不变不代表总费用不变。
Claude Pro或Team订阅包含API额度吗?
不要把订阅额度视为 API 余额。先确认客户端采用哪条计费路径,再分别核对对应套餐和 Claude API 价格表。
max档一定是完成任务最省钱的方式吗?
没有普遍保证。用几个 effort 档位比较通过验收的结果,把重试和耗时一起记录。更高档位可能消耗更多输出,却没有提高验收通过率。