GPT-5.6 Sol 要不要换成 GPT-6 Astra?多花的钱值不值?
GPT-6 Astra 每百万 $10/$50,GPT-5.6 Sol 是 $5/$30。多花的钱买到了什么、没买到什么,以及 Sol/Terra/Luna 的命名为什么没了。
在 Ofox,GPT-6 Astra 每个输入 token 的价格是 GPT-5.6 Sol 的两倍,输出贵 67%。 $10.00 / $50.00 对 $5.00 / $30.00。OpenAI 在 2026 年 9 月 3 日发布了它,而升级这道题异常好描述:价格涨了,所以产出必须更值钱。
先选接入渠道,再比较完成一项任务的成本
2026 年 9 月 16 日核对的价格,因供应商而异。 OpenAI 当前模型对比页列出的 Astra 输入/输出价是每百万 token $10/$50,Sol 是 $4/$20,两项均为 2.5 倍。Ofox 目录中的 Astra 为 $10/$50,Sol 为 $5/$30,对应输入 2 倍、输出约 1.67 倍。阅读下文历史评测时,要区分这两个口径;任何一个单价倍数都不能直接代表整项任务的账单倍数。
替换已经可用的 Sol 预设之前,用相同仓库快照、上下文、权限和验收测试做一次小范围对比。失败尝试和重试也计入成本,记录实际计费的输入、输出、缓存用量,同时比较每个通过验收结果的费用与耗时。新接入路径的文字、工具和流式响应检查通过之前,保留 Sol 作为回退。是否换 Astra,取决于自己任务中更好的结果或节省的时间能否抵得上实测增加的费用,不能单凭排行榜决定。
价格算例包含第一次缓存写入和两次追问;客户端配置指南说明不同供应商的模型 ID、Codex Responses 设置与迁移检查。下文独立指数采用 9 月 9 日报告;发布时的其他测量仍保留原日期。
先说结论
- 每一档费率都涨了。 输入 2 倍,输出 1.67 倍,缓存输入 2 倍。没有一行更便宜。
- 独立评测已显示更广泛的提升。 迁移前仍应测试自己的任务组合。
- 档位命名没了。 GPT-6 上没有 Sol、Terra、Luna,只有 Astra 和 Astra Pro。
- 上下文基本没变,1.05M 到 1.05M,输出上限同样是 128K。
- GPT-5.6 Sol 仍然可用,而且输入价仍然只有一半。
价格对比
| 每百万 token 费率 | GPT-5.6 Sol | GPT-6 Astra | 变化 |
|---|---|---|---|
| 输入 | $5.00 | $10.00 | 2.0 倍 |
| 输出 | $30.00 | $50.00 | 1.67 倍 |
| 缓存输入 | $0.50 | $1.00 | 2.0 倍 |
| 上下文窗口 | 1,050,000 | 1.05M | 约持平 |
| 最大输出 | 128K | 128K | 不变 |
两边数字都是 2026 年 9 月 5 日的 Ofox 实时目录,Astra 的费率与 OpenAI 标价一致。完整的 Astra 价目表里有这几行背后的 Fast 模式与单任务成本。
输入价翻倍对智能体负载的杀伤力比看上去大,因为智能体是输入重的:每一轮都要把系统提示、工具定义和累积的对话记录重发一遍。缓存输入从 $0.50 翻到 $1.00,作用方式一样。长对话也应合计输入、输出和缓存,不能默认某一列代表整张账单。
多花的钱买到了什么
OpenAI 的发布 benchmark 集中在一处,而且不是通用聊天:
| Benchmark | GPT-6 Astra |
|---|---|
| OSWorld 2.0(电脑操作) | 72.6% |
| Terminal-Bench 4.0 | 57.9% |
| ExploitBench | 100.0% |
| ExploitGym | 42.4% |
| SRE-Bench(单次尝试) | 88.0% |
| FrontierMath Tier 4 v2 | 97.6% |
| GPQA Diamond | 96.0% |
| ARC-AGI-3(adapter harness) | 99.9% |
| Humanity’s Last Exam(带工具) | 57.2% |
电脑操作、终端自动化、站点可靠性、漏洞挖掘。这些放在一起讲的是一个连贯的故事:这些成绩值得用实际任务验证,被调优的负载都是那种跑得久、反复调工具、最后要么完成要么失败的任务,而不是产出一段由人来打分的文字。
其中两个数字带着必须一起保留的限定:ARC-AGI-3 的 99.9% 是用 adapter harness 测的,Humanity’s Last Exam 的 57.2% 是带工具的。
adapter 这个限定分量很重。在 ARC Prize 自己的标准 harness 上,同一个模型只有 62.7%,而发布记分卡上并排印的 Sol 分数用的又是另一套 harness——OpenAI 自己此前估算过,Sol 在 adapter 设置下约 30%。我们的测评有完整的六档表格,以及这对读代际宣称意味着什么。
9 月 9 日更新的独立评测怎么看?
Artificial Analysis 9 月 9 日的报告已替代本文此前引用的旧数据,本次核对于 9 月 16 日。max 档 Astra 的智能指数为 53,比 Sol 高 6 分,与 Fable 5.1 持平;编程智能体指数为 62,比 Sol 高 7 分,也与 Fable 5.1 持平。报告中 Astra 对应的单任务成本分别为 $3.26(比 Sol 高约 60%)和 $7.09(比 Sol 高约 15%)。
这些费用属于具体评测环境,不是 API 统一报价,也不能直接预测自己仓库的账单。报告同时记录了 Astra 在 DeepSWE 上相对 Sol 的退步。综合分数更高,不代表每类任务都更好;应当测试自己实际需要完成的工作,也不要把新旧指数数值当成量尺不变的结果直接比较。
命名变了,配置会有反应
GPT-5.6 出的是 Sol、Terra、Luna,GPT-6 出的是 Astra 和 Astra Pro。
这件事的影响在运维层面而不是审美层面。任何按模式拼模型字符串的东西——加档位后缀的路由、写着 gpt-5.6-{tier} 的配置模板、假定存在三个档位的兜底链——在 GPT-6 上都找不到对应项。API 的模型 ID 就是 gpt-6-astra,没有后缀。
这跟 GPT-5.6 裸模型 ID 在网关上引发的问题是同一类:不带档位的 gpt-5.6 在要求显式档位的路由上返回 404。教训重复了一遍:模型命名方案不会跨代稳定,靠拼字符串而不是读目录的代码,每次发布都会断。
什么时候迁移,什么时候继续用 Sol?
当 Sol 达不到明确的验收标准时,可以试用 Astra,不必把范围限制在智能体任务;推理、编程和工具工作都可以按需比较。只有结果改善或节省的时间抵得上实测成本,才值得切换。如果 Sol 已经稳定通过验收,且总费用更低,就可以继续使用。输入单价不能直接预测完整 agent 账单,还要计算输出、缓存、重试和工具费用。
改模型字符串不等于完成迁移。按配置指南检查路由、支持的参数和工具续接,再用相同仓库快照对比一个边界明确的任务。适合的场景也可以比较 Fable,但不能继续用旧版“领先 Astra 五个指数点”的说法做当前选型。
来源
- https://artificialanalysis.ai/models/gpt-6-astra
- https://artificialanalysis.ai/models/gpt-6-astra-high
- https://llm-stats.com/models/gpt-6-astra
- https://ofox.run/models/openai/gpt-6-astra
- https://ofox.run/models/openai/gpt-5.6-sol
GPT-6 Astra 的 benchmark 是 OpenAI 2026 年 9 月 3 日的发布数字。两个模型的费率与上下文长度读取自 2026 年 9 月 5 日的 Ofox 实时 /v1/models 端点,也就是 GPT-6 Astra 上架当天。独立指数采用 9 月 9 日报告,核对于 9 月 16 日。
常见问题
- 该从 GPT-5.6 Sol 升到 GPT-6 Astra 吗?
- 只有负载是智能体类才该升。Astra 把输入价从每百万 $5.00 翻到 $10.00,输出从 $30.00 提到 $50.00,所以这次升级必须自己挣回成本。OpenAI 公布的提升集中在电脑操作、终端任务和安全工具上。如果是走量的通用推理,输入价只有一半的 GPT-5.6 Sol 仍然是合理默认。
- GPT-6 Astra 比 GPT-5.6 Sol 贵多少?
- 输入从每百万 $5.00 翻倍到 $10.00,输出从 $30.00 涨到 $50.00,缓存输入从 $0.50 翻倍到 $1.00。没有任何一行是 Astra 更便宜。两个模型的费率都是 2026 年 9 月 5 日的 Ofox 实时目录。
- 为什么没有 GPT-6 Sol、Terra 或 Luna?
- OpenAI 没把三档命名带进这一代。GPT-6 出的是 Astra 和 Astra Pro,不是 GPT-5.6 那套 Sol / Terra / Luna 的拆分。任何在 GPT-6 系列上拼档位后缀的配置或路由都会找不到对应模型。
- 在 benchmark 上 GPT-6 Astra 比 GPT-5.6 Sol 强吗?
- 9 月 9 日的独立报告显示,Astra 在两项综合指数上都高于 Sol。是否升级应当用实际任务比较验收结果、耗时与总计费用量;跑分提升不保证每项任务都更好或更省钱。
- GPT-5.6 Sol 到 GPT-6 Astra 之间上下文窗口变了吗?
- 几乎没变。Ofox 上 GPT-5.6 Sol 是 1,050,000 token 上下文,GPT-6 Astra 是 1.05M,两者的最大输出都是 128K。这次换代不是上下文窗口的故事。
- GPT-6 出了之后还能继续用 GPT-5.6 Sol 吗?
- 能。openai/gpt-5.6-sol 仍在 Ofox 目录里,输入 $5.00、输出 $30.00、缓存读 $0.50。OpenAI 没有在 GPT-6 发布的同时公布它的下线日期。


