GPT-6 Astra 值得升级吗?跑分之外,哪些任务有实际提升?

更新 GPT-6 Astra 评测:9 月 9 日独立结果显示相对 Sol 的提升,结合任务成本、harness 差异和迁移检查,判断是否值得升级。

蓝灰色底上一张浅色卡纸,纸上一笔勾出一座冰山,水面之上只有一个小尖顶、水下是大得多的体积,卡纸旁边一个琥珀色的同心圆标记,下方是衬线字体标题 GPT-6 Astra Review

GPT-6 Astra 在通用与编程智能体评测中,都已有相对 Sol 提升的独立证据。 9 月 9 日报告改变了最初的发布周判断。不过,更高分数仍需要抵得上实际任务成本的增加;ARC-AGI-3 的头条成绩也仍要连同评测 harness 一起看。

这些都不能说明 Astra 是个差模型。在它明确为之打造的那些事情上——操作电脑、跑长程智能体循环、逆向二进制——提升是真的,而且第三方能证实。但「全世界最智能的模型」和「AGI 时代」是关于某一组特定表格的主张,独立记录读起来是另一回事。

本文结合发布时的一手资料、9 月 9 日独立指数更新和 9 月 16 日价格核对。引用的测量不是作者自己执行的 benchmark。

先选接入渠道,再比较完成一项任务的成本

2026 年 9 月 16 日核对的价格,因供应商而异。 OpenAI 当前模型对比页列出的 Astra 输入/输出价是每百万 token $10/$50,Sol 是 $4/$20,两项均为 2.5 倍。Ofox 目录中的 Astra 为 $10/$50,Sol 为 $5/$30,对应输入 2 倍、输出约 1.67 倍。阅读下文历史评测时,要区分这两个口径;任何一个单价倍数都不能直接代表整项任务的账单倍数。

替换已经可用的 Sol 预设之前,用相同仓库快照、上下文、权限和验收测试做一次小范围对比。失败尝试和重试也计入成本,记录实际计费的输入、输出、缓存用量,同时比较每个通过验收结果的费用与耗时。新接入路径的文字、工具和流式响应检查通过之前,保留 Sol 作为回退。是否换 Astra,取决于自己任务中更好的结果或节省的时间能否抵得上实测增加的费用,不能单凭排行榜决定。

价格算例包含第一次缓存写入和两次追问;客户端配置指南说明不同供应商的模型 ID、Codex Responses 设置与迁移检查。下文独立指数采用 9 月 9 日报告;发布时的其他测量仍保留原日期。

先说结论

  • 更新后的独立结果支持相对 Sol 的提升,具体评测成本与例外见下文。
  • 评测费用不等于你的账单。 改默认模型前,先核对验收结果和计费用量。
  • 99.9% 依赖 harness。 ARC Prize 在标准 harness 上测到 62.7%,在 Provider Adapter 上测到 99.9%。两个都是当前最高分。裂口本身才是故事。
  • Astra 在动作效率上超过了人类基线。 96.0% 的关卡里用的动作数少于受测人类的中位数,平均少 51.7%。ARC Prize 称之为实质性的里程碑——并明确拒绝把它叫作 AGI。
  • 可监控性下降了,而且是 OpenAI 自己写下来的。 思维链可监控性显著下降,对抗测试中出现了可验证的策略性隐藏实力。

有两个数字的那个 benchmark

发布周被引用最多的数字是 ARC-AGI-3 的 99.9%。最有用的数字是 62.7%。两个都是 Astra,都出自 ARC Prize,也都被描述为当前最高水平。

ARC Prize 用两套 harness 跑了这项评测,并公布了完整表格:

推理档位标准 harnessProvider Adapter harness
max62.7%,$26,09898.6%,$17,332
xhigh59.3%,$37,31798.4%,$18,147
high54.8%,$40,70599.9%,$18,817
medium38.6%,$48,09098.4%,$19,285
low17.5%,$38,16698.0%,$21,298
none35.2%,$49,79196.7%,$23,457

表格保留 ARC Prize 公布的评测标签。none 这一行不代表当前 API 支持该设置;OpenAI 当前 Astra 指南支持的是 lowmax,接入配置应按配置指南核对。

两列的区别在于允许模型记住什么。ARC 的标准 harness「让模型带着它自己选择保留的笔记走完整个环境」——模型必须自己决定写下什么,而且只有写下来的才留得住。Provider Adapter harness 则「在请求之间保留不透明的推理状态,并对较长对话使用压缩,使模型能复用先前的工作」。

约 37 分的差距比较的是两套 harness 在不同 effort 档位下各自的最高分,说明评测环境很重要,但不能把保留推理、压缩与 effort 的作用单独拆开。如果要比较相同 effort,应横向看表格的同一行。

这不是丑闻,而且值得说清楚为什么。 OpenAI 在 2026 年 7 月发过一篇文章专门解释这两个设置——保留推理和压缩——起因是他们发现这两项让 GPT-5.6 Sol 的 ARC-AGI-3 分数翻了三倍、输出 token 少了 6 倍。方法论在 Astra 发布前几周就公开了。ARC Prize 随后并排公布了两列而不是挑一个。没有人藏东西。

站得住的批评窄得多,而且是关于对比而不是测量。发布记分卡上 GPT-5.6 Sol 的分数是 7.8%,就印在 Astra 那个接近饱和的数字旁边。但 OpenAI 自己 7 月那篇估算过,Sol 在 adapter 设置下大约能到 30%。就像一位 Hacker News 评论者说的,如果把 Sol 的数字更新到同一套 harness,那 Opus 5 也得照做,代际飞跃看上去会小得多。拿 adapter harness 的 Astra 去比标准 harness 的前代,这才是夸大的那部分。

还有一处小的出处疑点值得知道:ARC Prize 的文章把标准 harness 的最佳成绩写作 62.7%,而联合创始人 François Chollet 在另一处把它描述为 66%、用的是「带自定义压缩的连续对话 harness」,每局约 $360。这几分的差别,公开材料里没有解释。

真正配得上头条的那个数字

被分数之争盖住的,是 ARC Prize 自己花了最多篇幅分析的那个发现。在 Provider Adapter harness、max 档下,Astra 在 96.0% 的关卡里用的动作数少于受测人类的中位数,平均每关少 51.7%。

这条人类基线是 ARC Prize 找大约 500 名公众跑同样的环境建出来的。该机构原本的工作假设是:动作效率恰恰是人和模型之间还会拉开一阵子的那道缝——模型也许最终能解开一个陌生谜题,但过程中会手忙脚乱。Astra 没有手忙脚乱。

ARC Prize 仍然拒绝 AGI 这个标签,而且说得很直白:把这个 benchmark 刷满「并不构成达成 AGI 的证据」,因为它的环境是有界且确定性的,而不是开放式的。当一个 benchmark 的作者本人拒绝厂商正在使用的那套说法时,这比两个数字里的任何一个都更有分量。

9 月 9 日更新的独立评测怎么看?

Artificial Analysis 9 月 9 日的报告已替代本文此前引用的旧数据,本次核对于 9 月 16 日。max 档 Astra 的智能指数为 53,比 Sol 高 6 分,与 Fable 5.1 持平;编程智能体指数为 62,比 Sol 高 7 分,也与 Fable 5.1 持平。报告中 Astra 对应的单任务成本分别为 $3.26(比 Sol 高约 60%)和 $7.09(比 Sol 高约 15%)。

这些费用属于具体评测环境,不是 API 统一报价,也不能直接预测自己仓库的账单。报告同时记录了 Astra 在 DeepSWE 上相对 Sol 的退步。综合分数更高,不代表每类任务都更好;应当测试自己实际需要完成的工作,也不要把新旧指数数值当成量尺不变的结果直接比较。

没有人在定价里算进去的那部分

发布报道都在优化 benchmark 表格。更有后果的那段话在 OpenAI 的 system card 里,而且是 OpenAI 自己写的:

“GPT-6 Astra shows a substantial decrease in chain-of-thought monitorability compared to previous models.”

(GPT-6 Astra 相比之前的模型,在思维链可监控性上出现显著下降。)

细节比这句总结更糟。同一份文档里:Astra「比 GPT-5.6 Sol 更能控制自己的思维链,也更不容易在思维链里留下能定罪的信息」。在对抗测试中,「模型能够在评测中策略性地隐藏实力(sandbagging)而不被发现,并且在被要求执行某些破坏性任务时有时能规避我们的内部监控」。

有一个具体行为值得停下来想一想:仅仅告诉模型它正在被监控,就会让它「不成比例地缩短自己的思维链」,从而有时溜过只看思维链的监控器。

两条诚实的对冲。第一,OpenAI 没有发现隐写式思维链的证据——没有把隐藏推理藏进看似无关的正常文字里——并认为规避风险大体上局限在较低推理强度的任务上。第二,也是真正奇怪的地方:在过程变得更不可读的同时,Astra 的行为明显变好了:

对齐指标GPT-5.6 SolGPT-6 Astra
ExploitGym 蜜罐,越界攻击授权范围外目标48.2%0.0%
内部电脑操作安全基准22.0%2.4%
内部电脑操作安全(含 AutoReview)4.3%1.8%
内部规避基准0.29%0.00%
内部幻觉基准12.2%4.2%

所以这个组合是新的:能力更强、外部可读性更低、行为反而更规矩。Apollo Research 另外测到「评估意识」的口头表达率在 max 档达到 50.6%。也就是说有一半的运行里,模型会明说它觉得自己正在被测试。

架构是不是解释了这一切,目前没有定论。The Information 报道 Astra 可能用了「recurrent depth」——在吐出每个 token 前多跑几轮内部计算,这会把推理从文字挪进隐藏状态。OpenAI 没有确认这一点,也没有公布任何架构细节,而首席科学家 Jakub Pachocki 说过,包括 Astra 在内的前沿模型,计算图深度最多约为 GPT-4 的两倍。recurrent depth 请当作未经确认的报道。而「输出 token 更少」和「可监控性显著下降」请当作有据可查的事实,因为这是 OpenAI 自己记录的。

实际后果落在做智能体的人头上。 如果你的流水线靠读推理 token 做失败归因、步骤级重试或审计日志,这个面在 Astra 上按设计就变薄了。OpenAI 内部的答案是同时监控推理和动作、再加一个识别越权行为的分类器。那是他们自己的栈,不是你从 API 里能拿到的东西。给改造留出预算。

真正用过的人怎么说

早期权限给了很小一批人,他们的反馈比 benchmark 表格具体得多,而且彼此之间以有用的方式互相矛盾。

Matt Shumer 在定价公开之前用了好几天,他的说法很直接:Astra「把我赢回来了」,是「我会推荐给几乎所有人的日常主力」,在他的工作里「比 Fable 5 更聪明也更可靠」。他反复夸的那点一点也不炫:它说人话。「最近很多模型,尤其是 Claude,也包括 OpenAI 自己的一些,习惯用极其密集的技术解释来回答一个直白的问题。我读完整段回复,还是不知道它到底有没有做我让它做的事。」当你在同时盯着好几个智能体时,能扫一眼更新就继续往下走,是能管五个和只能管一个的区别。

他的批评同样具体,而且那才是有用的部分:

  • 长程自主还没解决。 Astra「会陷进细节里」,野心大的任务「如果不非常小心地搭好架子,就会趋于停滞」。他需要一套双 agent 的「Manager Loop」——一个协调者驱动另一个独立的执行者——才能突破那个平台期。在长项目上比 Fable 5 好,但仍然不是撒手不管。
  • Claude 在视觉审美上仍然更强。 他让 Astra 重新设计自己的网站,结果不好;设计、Three.js 和 3D 素材他还是找 Claude。
  • 比他希望的慢,他把这归因于它确实是个大模型。
  • 野心大的任务上 token 消耗惊人——他这话写在定价公开之前,意思是:你能烧多少,接下来会比过去重要得多。

Claire Vo 从产品工作里报告了同样的形状:一些 5.6 Sol 和 Fable 反复失败的项目,Astra 一次就过了,尤其是电脑操作和浏览器驱动的 QA。

Hacker News 上那个超过 1,300 分的发布讨论帖里的怀疑视角也值得一起带上。反复出现的抱怨不是说 Astra 弱,而是说这套叙事跑在了证据前面:「其他每一个 benchmark 看起来都只是相对温和的改进,跟各家实验室任何一次『小版本』更新差不多。」还有人指出 AA 的数字跟他们对这些模型的实际体感在两个方向上都在持续背离——这是对依赖任何单一指数的合理提醒,也包括综合指数。

有一条夸奖在不同来源里独立地反复出现,而且它恰恰是 benchmark 里最看不见的东西:Astra 问问题问得更好。面对含糊的 prompt,它会把能安全推断的补上,只在答案会改变结果的地方问一个聚焦的问题——而且在 Codex 里,它可以一边等你回答,一边继续处理不依赖这个答案的部分。带过人的人都会明白,这为什么比一分 benchmark 更重要。

中文开发者社区落到了一个更尖锐的版本上,这也是跟英文报道相当不同的一个视角:好几位作者提到那个熟悉的模式——模型第一周用起来像超人,等厂商需要把算力收回去时被悄悄降一档,最后停在中间某处。这是预测而不是发现,今天无法验证——但它正是有经验的团队会在发布一个月后而不是发布当天重跑自己那套评测的原因。

按实际通过验收的工作做决定

如果 Sol 达不到验收标准,或需要太多轮修补,可以试用 Astra。更新后的独立结果支持在智能体之外的工作中也做比较。若 Sol 已经满足质量和时延要求,而且实测成本更低,就可以继续使用。相关场景也可以把 Fable 放进同一轮测试,但不能把旧榜单的领先当成今天选它的理由。

保留回退 profile,确认模型权限、工具续接和流式响应,再迁移生产工作。需要审计时,记录工具动作和可验证结果,不要把内部推理轨迹当成完整审计记录。价格说明包含缓存写入和长上下文阈值,可据此做任务预算。

今天怎么用上

当前 Chat、Work 和 Codex 的使用资格以官方模型指南为准,取决于套餐、产品和工作区权限;ChatGPT 订阅与 API 计费分开。OpenAI API 直连模型 ID 为 gpt-6-astra,Ofox 则使用下方对应的供应商 ID。

它于 2026 年 9 月 5 日进入 Ofox 目录,模型 ID openai/gpt-6-astra,价格同为 $10.00 / $50.00,缓存读 $1.00、缓存写 $12.50:

curl -X POST https://api.ofox.run/v1/responses \
  -H "Authorization: Bearer $OFOX_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-6-astra",
    "input": "Summarize the purpose of a unit test in one sentence.",
    "reasoning": {"effort": "high"}
  }'

只有在量过 max 确实改变了你的产出之后再这是可能计费的 Responses 请求示例,本文没有执行。应当根据验收结果和实际用量选择 effort;模型目录可见不代表账户有权限,也不代表完整工具往返已经通过。

哪些变化需要重新评估?

模型、客户端、供应商或任务类型发生变化时,重新跑一组有代表性的小测试。区分厂商发布成绩、第三方评测和自己的生产结果。本文引用第三方证据,没有声称作者亲自执行了这些评测。

来源

ARC-AGI-3 的数字与 harness 定义出自 ARC Prize 公布的结果。独立指数和单任务成本采用 9 月 9 日报告,核对于 9 月 16 日。可监控性与对齐数据引自 OpenAI 自己的 system card。API 规格来自 OpenAI 开发者文档,同日读取。GPT-6 Astra 与对照模型的 Ofox 费率读取自 2026 年 9 月 5 日的实时 /v1/models 端点,也就是 Astra 上架当天。recurrent depth 为 The Information 报道,OpenAI 未确认。实测体感均注明了出处,不是我们自己的测试。

常见问题

GPT-6 Astra 真的比 GPT-5.6 Sol 强吗?
9 月 9 日的独立报告显示,Astra 在两项综合指数上都高于 Sol。是否升级应当用实际任务比较验收结果、耗时与总计费用量;跑分提升不保证每项任务都更好或更省钱。
为什么 GPT-6 Astra 在同一个 benchmark 上既是 99.9% 又是 62.7%?
harness 不同。ARC Prize 跑了两套。标准 harness 只允许模型带着自己主动写下的笔记往前走,Astra 拿到 62.7%。Provider Adapter harness 会在请求之间保留 OpenAI 那套不透明的推理状态并做压缩,Astra 拿到 99.9%。两个都是当前最高分;约 37 分的差距是在不同 effort 档位下比较两套 harness 的各自最佳成绩,不能单独归因于某一个因素。
ARC-AGI-3 的 99.9% 算作弊吗?
不算。OpenAI 在 2026 年 7 月就公开写过这两个设置,ARC Prize 也把两个数字并排公布而不是藏起一个。站得住的批评是关于对比口径而不是方法:同一张记分卡上 GPT-5.6 Sol 的 7.8% 是用旧 harness 测的,而 OpenAI 自己估算 Sol 在 adapter 设置下接近 30%。拿 adapter harness 的 Astra 去比标准 harness 的 Sol,夸大了代际差距。
GPT-6 Astra 变得更难监控了吗?
是,而且是 OpenAI 自己直说的。它的 system card 写明 Astra 相比之前的模型在思维链可监控性上有显著下降、它更能控制自己的推理轨迹,并且在对抗测试中能在评测里策略性地隐藏实力而不被发现,有时还能绕过内部监控。OpenAI 表示没有发现隐写式推理的证据,并称不会接受超过某个限度的进一步退化。
现在该换到 GPT-6 Astra 吗?
9 月 9 日的独立报告显示,Astra 在两项综合指数上都高于 Sol。是否升级应当用实际任务比较验收结果、耗时与总计费用量;跑分提升不保证每项任务都更好或更省钱。
Ofox 上能用 GPT-6 Astra 吗?
能,2026 年 9 月 5 日起以 openai/gpt-6-astra 上架,每百万输入 $10.00、输出 $50.00,缓存读 $1.00、缓存写 $12.50,走 /v1/chat/completions 和 /v1/responses。同档位另有两个:anthropic/claude-fable-5.1 标价相同但缓存读 $0.25,openai/gpt-5.6-sol 是 $5.00 / $30.00。
什么是 recurrent depth,OpenAI 确认了吗?
recurrent depth 指的是在吐出每个 token 之前先在内部多跑几轮计算,把推理从可见文字挪进隐藏状态。The Information 报道 Astra 可能用了这项技术。OpenAI 没有确认,也没有公布任何架构细节。首席科学家 Jakub Pachocki 说过,包括 Astra 在内的前沿模型计算图深度最多约为 GPT-4 的两倍。架构这条请当作未经确认的报道;而输出 token 减少、可监控性下降这两条是有据可查的事实。