LLM API 服务商靠谱吗?如何核对模型、路由和账单

从模型 ID、回退策略、请求记录和费用明细核对 LLM API 服务商,区分可验证证据与模型自述,避免只凭价格判断。

浅色纸面上的双筒望远镜线稿,象征核查 API 服务。

核查 LLM API 服务商,要把文档里的模型与路由规则,同请求、响应元数据和账单逐项对上。 模型回答“我是 GPT”、价格很低或某次回答很好,都不能单独证明实际调用了哪套模型权重。

本文面向准备接入编码代理或生产应用的开发者,提供可重复使用的核查方法,不为 Ofox 或其他服务商出具认证。比较不同服务时,应使用同一套标准。

先确认模型 ID 和调用地址

保存请求使用的模型 ID、endpoint 和时间。原厂模型名与网关带命名空间的 ID 可能不同;别名本身不构成问题,但服务商应说明它对应什么、是否会变化。

OpenAI 官方模型目录中的模型名称与标识

截图来自 OpenAI 官方模型目录,拍摄于 2026 年 9 月 16 日,保留英文原始界面。它说明官方公布了哪些模型,不能证明第三方网关实际处理某次请求的模型。

在 Ofox 上,先查对应的模型页面,记录产品展示的供应商或路由。目录中的 endpoint、协议和定价字段回答不同问题;某个字段没有出现,不等于相关能力不受支持。

保留四层证据

层次需要保存单凭这一层不能证明什么
请求地址、模型、参数、时间服务端完整执行了全部参数
响应上报模型、请求 ID、结束状态、usage通过密码学验证实际使用的模型权重
路由回退规则、可见的实际供应商服务商未公开的路由历史
账单普通输入、输出、缓存、额外费用和最终扣费结果质量或任务是否完成

截图和支持工单中不要包含 API key、授权头或私密提示词。用脱敏请求 ID 和最小合成示例开始排查。OpenAI API 参考只定义其自身约定,兼容网关可能使用不同元数据;缺少 OpenAI 特有的响应头,不足以证明服务商违规。

比较任务表现,但不要把它当身份认证

选择与实际应用有关的小规模任务集,例如结构化输出、工具调用、长输入和有明确验收标准的复杂任务。在获得发送授权的前提下,固定提示词、参考材料和双方均支持的参数。

输出不同可能来自采样、系统指令、工具、上下文处理或实现差异;输出相似也不能证明权重相同。对编码任务,应查看 diff 并运行相关检查;对信息提取,应与标准字段对照。失败与人工修复要保留,不能只挑最好的一次。

同一模型在不同客户端表现不一致时,可先参考客户端差异排查,再判断是否与供应商有关。

把单次调用与扣费对上

确认精确模型、实际路由、币种和计费单位,分开普通输入、缓存读取、缓存写入、输出以及适用的工具费。不要把合并 token 数乘以一个输入单价。缓存费用计算说明如何避免重复计算。

请求超时也不代表上游没有处理或没有扣费。先查请求活动和账单,再决定重试;定位连接、响应和流中断可用超时排查清单

下面是空白记录模板,不是实测数据:

日期和时区:
服务商、endpoint、文档中的模型 ID:
请求模型与响应上报模型:
实际路由与回退规则(如可见):
请求 ID、结束状态:
普通输入、缓存读、缓存写、输出用量:
价格来源、币种、单位:
扣费与核算差异:
验收标准、结果、人工修复:
尚未披露或无法核实的字段:

遇到重要差异,先让服务商解释,再扩大用量。无法核验的信息应保留为未知,而不是填成“通过”。

常见问题

直接问模型自己是谁,能验证模型吗?
不能。生成的自我介绍不是身份凭证。应核对文档、请求参数、服务端元数据和路由记录;服务端上报的信息本身仍依赖对服务商的信任。
价格便宜就说明服务商换了模型吗?
不能。价格本身不足以证明模型替换。应核对所购买服务的合同、账单和实际表现,不能据此作出无证据的指控。
试用通过后可以直接迁移生产吗?
一次试用只说明已测试的任务。先做有限范围试运行并保留回退方案,再决定是否扩大使用。