GPT-6 Sol API 怎么收费?缓存和长上下文别算错
按输入、输出、缓存读写拆解 GPT-6 Sol 费用,说明超过 272K 输入后的整次请求计价,并提供可下载的费用表与本地计算器。
GPT-6 Sol 在 OpenAI 直连 API 的 Standard 短上下文价格为:普通输入每百万 token 2 美元,输出 10 美元。 预算不能只乘这两项;缓存读写、输入长度和处理模式都会影响账单。
以下价格依据官方模型页和定价文档,于 2026 年 9 月 23 日核对。单位均为美元/百万文本 token,属于 OpenAI 直连报价,不是 Ofox 目录价格或订阅额度。
先选对价格档
| Standard 处理 | 普通输入 | 缓存读 | 缓存写 | 输出 |
|---|---|---|---|---|
| 输入不超过 272K | 2 | 0.20 | 2.50 | 10 |
| 输入超过 272K | 4 | 0.40 | 5 | 15 |
超过门槛后,长上下文费率用于整次请求,并非只对超出 272K 的部分加价。模型能容纳多长上下文是容量问题;账单从哪里涨价是另一件事。
Batch、Flex 是对应 Standard 费率的一半,Fast 是对应费率的两倍。这些处理模式不能随意叠乘。支持地域处理的情形还可能有附加费,当前 EU 数据驻留仅支持 Standard。应以实际请求使用的模式计算,而非事后从价格表挑最低一行。
缓存写入不能重复算普通输入
缓存文档将普通输入、缓存读和缓存写分开。按写入费率收费的 token,不应再算一次普通输入。
费用 = (普通输入 × 输入费率 + 缓存读 × 读取费率
+ 缓存写 × 写入费率 + 计费输出 × 输出费率) / 1,000,000
如果用量导出只有“总输入”和缓存细项,应先按供应商字段定义拆出互不重叠的数量。输出也应使用计费 token,包括适用时的推理用量,不能只数屏幕上看见的文字。
一个可以复算的例子
假设一次 Standard 短上下文请求有普通输入 20,000、缓存读 60,000、缓存写 20,000、计费输出 5,000 token。这些分类不重叠,例子是数学演示,不是模型实测。
| 项目 | 算式 | 美元 |
|---|---|---|
| 普通输入 | 20,000 × 2 / 1M | 0.040 |
| 缓存读 | 60,000 × 0.20 / 1M | 0.012 |
| 缓存写 | 20,000 × 2.50 / 1M | 0.050 |
| 输出 | 5,000 × 10 / 1M | 0.050 |
| 合计 | 四项相加 | 0.152 |
下载费率与例子 CSV或本地计算器可以复算。程序不联网,不读取你的账单,也不会预测缓存命中率。
若普通输入变为 300,000,输出为 5,000,需整次采用长上下文费率:0.3 × 4 + 0.005 × 15 = 1.275 美元,另计适用费用。把前 272K 仍按短上下文计价会低估这笔费用。
比旧版便宜,不代表账单必然减半
发布公告将 GPT-6 Sol 的普通输入/输出 2/10 美元,与 GPT-5.6 Sol 之前的促销价 4/20 美元对照;这两个字段确实下降 50%。但一次任务的上下文、推理、工具操作和重试次数可能变化。
历史账单保留历史费率。把旧用量代入新价格只能回答假设问题,不能改变实际已经支付的金额。升级时应比较同一验收目标下的总费用和人工修复量。
按完成的任务记账
记录精确模型、供应商、模式、输入长度、缓存分类、输出、工具费用和验收结果,失败尝试也要保留。只统计成功请求会漏掉被丢弃结果的成本。
Sol 与 Opus 5.5 对比提供同口径计算框架;GPT-6 选型讨论任务起点。若购买网关服务,必须再次核对实际路由报价,不能把 OpenAI 直连价格套到 Ofox。
常见问题
- 超过 272K 后只给超出部分加价吗?
- 不是。输入超过 272K 后,整次请求采用对应的长上下文费率。
- 缓存写入要再加一份普通输入费吗?
- 同一批 token 不重复收费。写入类别使用缓存写费率,普通输入必须与其分开。
- 单价减半,任务费用就减半吗?
- 不一定。总费用还取决于 token 用量、工具、失败重试和结果是否通过验收。


