Grok 4.7 与 4.6 标准单价相同,为什么任务费用会变?

查看 Grok 4.7 输入、输出、缓存及长上下文费率,分清 Fast 与地域费用,再按真实用量计算完整 Agent 任务账单。

鼠尾草绿色背景上是三张价签线稿,旁边有几何点缀,下方写有 Grok 4.7 Pricing。

Grok 4.7 沿用了 Grok 4.6 的标准 token 费率,但完成同一个任务未必花同样的钱。更多思考、重复上下文、重试和工具调用,都可能在单价不变时推高总费用。

因此需要同时回答两个问题:这次请求适用哪档费率,以及任务完成前累计产生了多少用量?下列价格核对于 2026 年 9 月 22 日,属于 xAI 公共价表,不是 Ofox 报价或编程工具的订阅额度。

标准版 token 价格

提示词长度未缓存输入/百万 token缓存输入/百万 token输出/百万 token
少于 200,000 token$2.00$0.50$6.00
大于或等于 200,000 token$4.00$1.00$12.00

官方定价页明确:提示词达到 200,000 token 后,整次请求中的全部 token 按长上下文费率计费,并非仅对超出的部分加价。这是计费条件,不是两种上下文容量。

模型上下文窗口为 500,000 token。能装下更多资料,不意味着窗口范围内的所有请求都适用低档价格。估算长上下文任务前,应核对模型卡

一个可重算的小例子

假设某次低档请求记录了 40,000 个未缓存输入 token、60,000 个缓存输入 token,以及 5,000 个计费输出 token:

未缓存输入:40,000 / 1,000,000 × $2.00 = $0.08
缓存输入:  60,000 / 1,000,000 × $0.50 = $0.03
输出:       5,000 / 1,000,000 × $6.00 = $0.03
token 费用合计:                         $0.14

这是根据假设用量计算的示例,不是实测账单,也未包含另计的工具或服务费用。如果其中 60,000 个输入 token 没有命中缓存,全部按普通输入计费,合计会变成 $0.23。重复相同文本不等于必然命中缓存,要看实际返回的用量分类。

如果服务商的“总输入”已经包含缓存输入,需要先减去缓存部分再计算未缓存费用,否则会重复计数。

Agent 费用为什么容易超出预期?

一个任务通常会调用多次模型。重试、复核和工具结果都可能触发下一轮。应记录从开始到验收通过的全部请求,包括失败尝试;只看最后一次成功响应,会漏掉前面的成本。

推理设置也要记录。不要拿设置不明的 4.6 与设置不明的 4.7 做对比。Artificial Analysis 在其 Grok 4.7 评估中观察到了更多输出 token,但这属于特定基准和配置的结果,不能直接变成你的应用费用倍率。

建议记录的字段用途
精确模型和推理档位确认比较的是哪些版本与设置
输入、缓存输入、计费输出复算 token 费用
工具费用及重试补齐最后一个答案之外的成本
验收结果区分低价失败和有效完成
人工修正时间判断是否真正减少工作量

Fast 和地域入口还会改变估算

Fast 有单独价表,仅通过 Cursor 和 Grok Build 提供,不是公共 API 型号。本次核对时,概览写了标准费率的两倍,但详细长上下文价表并不遵循该倍率。长提示词应核对当前 Fast 价表,不能把标准估算机械乘二。

美国地域接口另有 10% 的 token 费率溢价,见官方说明。不要把服务商未提供的组合也叠加计算。

网关还可能有自己的价格和活动期。某个平台的限时优惠不会改变 xAI 牌价,也不能证明其他平台支持同一模型。

是否值得从 4.6 升级?

固定一个有代表性的任务和验收测试,对比两版的完整运行。如果新版能完成旧版失败的任务,多消耗一些 token 可能有价值;如果两版都通过,就比较总费用、耗时和返工量,不必只因版本较新就切换。

先用入口指南选择产品,再按 API 接入说明保留用量和对话信息。更早的版本变化见 4.6 与 4.5 对比

常见问题

Grok 4.7 的 token 单价比 4.6 高吗?
公开标准费率相同,但每个任务的总用量可能不同。
文中的 $0.14 是真实账单吗?
不是,是按给定用量与标准低档价格计算的假设示例。