Jev 评测表现怎么样?看懂得分、局限与适合的任务
解读 Jev 独立基准的具体得分和失败项,区分分类能力与 Agent 效果,并用可下载的评估表判断你的任务是否适合接入。
Jev 新公布的基准证据,值得让开发者认真评估它在有界分类和路由决策中的用途。但它没有证明 Jev 能替代通用大语言模型,也没有把置信度变成正确性保证,更不能说明给 Agent 加上 Jev 就一定省钱。真正有用的问题更具体:你要做的决策,与论文测量的任务是否相似?
本文面向考虑把 TypeSafe AI 的 Jev 接入工作流的开发者,分开呈现论文发现与我们的分析,并提供可填写的评估计划,帮助你在投入集成成本前确定验收条件。我们没有复跑论文,也没有为本文调用 Jev 推理接口。API 基础概念可先读 Jev 入门、价格与使用场景指南。
先确定你真正要比较的任务
给客服工单分类、让 Agent 选择获准使用的工具,以及撰写客户回复,是三种不同工作。模型选对队列之后,仍需其他组件生成回复。同样,选中工具名称,不代表参数正确、调用者有权限,或者工具已经执行成功。
把决策写成一份明确约定:给定哪些输入,从哪些输出中选择,选错会带来什么后果。如果输出要求自由文本、新程序、图片或视频,只评估 Jev 就选错了实验对象。应评估整个应用,包括负责剩余工作的生成模型或确定性代码。
| 你的任务 | 有价值的测量 | 容易误用的替代指标 |
|---|---|---|
| 把工单分给财务、技术支持或人工复核 | 自有工单上的各类别错误与路由覆盖率 | 通识问答得分 |
| 选择允许使用的工具 | 选项有效性、选择是否正确、权限与执行结果 | 仅能返回可解析 JSON |
| 筛选检索片段 | 证据保留情况与最终答案质量 | 商品推荐排序成绩 |
| 判断是否升级处理 | 放行错误、回退质量与总成本 | 单看减少了多少昂贵调用 |
这些是建议采用的评估标准,不是 Jev 已达到的性能。先确定标准,才能判断公开证据中哪些部分与你的应用有关。
独立基准增加了哪些证据
9 月 29 日的独立预印本,对 jev-1.13.0 在 37 个数据集上发起 346,009 次请求,并与 Qwen3.8-27B、Gemma-4-E4B 比较。这是研究者公布的结果,不是本站复现。参见 论文及公开材料。

2026 年 10 月 2 日采集的英文原始来源截图,用于确认所讨论的研究,不是 Ofox 测试界面。
公开评测可以成为评估决策模型的理由,不能直接代替上线验收。你的输入群体和验收规则,仍然决定这些表现有没有实际价值。
阅读论文时,也打开 作者代码仓库。引用成绩之前,找出数据集划分、请求模板、问题类型、模型版本、指标和不确定性区间。脱离这些条件的表格数字,可能回答的是另一个问题。
得分和薄弱项要一起看
下面是论文固定请求设置下的结果。准确率、平衡准确率和 F1 是不同指标,不能拿这些行排一个跨任务总榜。
| 数据集或对照 | 论文结果 | 对你的评估意味着什么 |
|---|---|---|
| Banking77,77 类意图分类 | 准确率 79.7% | 自动分配工单前,重点测试相近意图 |
| CLINC150,包含范围外选项 | 准确率 89.5% | 路由样本应纳入不支持的请求 |
| Belebele,122 种语言合并统计 | 准确率 86.7% | 汇总成绩不能批准某个具体语言上线 |
| LLM-AggreFact | 平衡准确率 78.6% | 只支持对该事实依据一致性数据集的判断,不是通用辨真能力证明 |
| UNFAIR-ToS | yes 概率阈值 0.5 时 micro-F1 为 0.499;调阈值后为 0.748 | 阈值选择会改变二元决策策略 |
| AGB-DE | F1 为 0.204,调阈值后不变 | 部分失败需要更好的区分能力,仅调整阈值无效 |
UNFAIR-ToS 使用的是 Noul yes 概率阈值,不是 Choice 置信度。Qwen 和 Gemma 未开启 thinking,使用的模板原本为 Jev 编写;每个请求仅运行一次。MMLU 探针没有排除记住问答对的可能。具体见 预印本的表 2、表 4 和局限说明。
决定是否接入时,这些条件与得分同样重要。快速完成有界分类,与允许模型对难题进行推理,是两类需要分别评估的产品。重复运行是否稳定、本地语言表现如何、严重错误有多少,都应进入验收计划,即使成绩摘要没有列出。未排除的解释不能被写成已经证实的数据污染,也不能反过来写成推理能力已经得到证明。
“Jev 对比 Qwen”并不存在一个通用答案
至少有三种合理比较方式。第一,在相同有界答案集合上比决策表现;第二,比交付相同合格结果的完整应用成本;第三,比部署方式、可复现性、数据是否允许离开环境等运营条件。它们对应不同采购决策。
不要把第一种比较里的分类得分,与第二种比较里的聊天生成价格拼起来,就宣布某个模型全面获胜。自托管模型还有硬件、利用率和维护费用,托管 token 单价无法涵盖;托管决策 API 也未必提供本地部署所需的全部控制。
实用的对照表应按完整任务逐行记录:输入群体、实际版本、允许输出、质量标准、重试、延迟与实际总费用。某个模型不支持所需输出时,应明确写“任务不匹配”,而不是给它一个很低的质量分。否则会把能力缺失误写成同类能力表现较弱。
类型正确,也可能选错含义
另一篇研究考察了把答案选项名称重新分配给判定定义后,会发生什么。托管 Jev 的结果对这类变更具有敏感性。有效标签并不能证明模型遵循了你希望它理解的语义。论文也评估了其他模型,不能把其他模型更大的变化幅度归到 Jev 身上。参见 选项命名研究第二版。
在 1,200 个问题中,重新分配 yes/no 名称与定义后,托管 Jev 有 32.5% 的决策发生翻转;中性的 0/1 对照为 2.08%。更高的 76.92% yes/no 翻转率属于 Laya,不是 Jev。这是故意让名称与定义冲突的测试,不代表日常 Jev 请求有 32.5% 会失败,也不同于前述基准里单纯旋转选项位置。
例如,你把 approve 标签挂在“需要人工复核”的规则下面,应用也许忠实执行了返回标签,但问题定义本身就有冲突。应避免名称与描述互相矛盾,并测试生产代码实际消费的映射。评估完成后,不要未经回归验证就翻译标签、重排规则或重命名选项。
有效测试集应包括普通案例、边界案例、信息缺失案例,以及会诱使模型跟随标签名而忽视定义的样本。人工构造的对抗样例与自然流量应分别报告。两者都需要,但压力测试集不能悄悄变成日常错误发生率的估计。
Agent 的效率要沿完整流程测
REFLEX 研究了一种架构:用 Jev 完成有界决策,在必要时回退到更强模型。论文在受控环境中报告了效率收益,但外部评估中,相对廉价生成模型级联的优势有限。这个反例说明,应和你实际会部署的经济方案比较,不能只挑昂贵的强模型直调系统作为基线。参见 REFLEX 论文。
在自己的系统中,只有最终结果满足所有架构共用的验收规则,才算任务成功。很快选出了路线,仍可能生成错误答案;回退可以提高可靠性,也会增加时间、token 和一次失败机会。工具报错、空响应与重试请求应留在统计分母中,不能从报告里消失。
Jev 路由成本指南提供比较用的计算器。有实际账单就优先采用,没有时明确标注示例费率只是条件假设。置信度验证教程则说明,如何测出候选阈值到底能放行多少流量。
建立团队可以复现的评估
下载 评估工作表与离线决策工具包。CSV 工作表用来记录以下决定,帮助别人检查验收条件;它不是另一份模型排行榜。
- 定义纳入哪些请求。 说明哪些流量进入实验,覆盖实际应用的语言、文档长度和模糊案例。排除困难流量,会改变最终结论适用的范围。
- 编写标注指南。 让标注者根据原始材料判断,先不看模型答案。解决分歧;材料确实不足时,应保留不确定类别。
- 按可能泄漏的单位划分。 同一客户对话、文档家族或近重复模板留在同一数据划分里。随机按行拆分,可能把几乎相同的案例分到调参与最终测试两边。
- 冻结系统。 记录模型 ID、问题文本、标签、回退规则与预处理。即使模型名没变,问题一改,实验就变了。
- 让替代方案面对相同输入。 可行时加入规则基线、廉价模型级联和现有系统,使用相同质量标准与测量边界。
- 接受平均值之前先看错误。 单列罕见但代价高的错误。整体准确率很高,也可能有某一类路由几乎不可用。
- 自动执行前先跑影子流量。 记录建议路线,同时仍以现有路径的结果为准。先比较结果与成本,不让未经验证的决策触发重要副作用。
最终应形成一份简短决策记录:哪些能自动化、哪些回退、哪些仍不支持,以及什么情况触发回滚。只有“平均表现提升了”,却没有样本范围和失败边界,结论还不完整。
自己的结果与论文不同,怎么排查
先检查是不是同一个任务,再核对模型版本、输入表示、选项措辞、语言构成和评分规则。公开基准与生产样本可能都测得没错,只是描述了不同群体。
准确率够用但覆盖率低时,检查问题是否混合了多项判断,或遗漏重要上下文。高置信度错误持续出现时,逐条查看案例,不要为了增加吞吐而先降阈值。决策本身正确而最终任务失败,则应检查下游处理器或回退路径。
一次结果不理想,不必扩大为“模型没有用”。保留准确的结论:这个版本和问题设计,没有满足这项任务的验收条件。同样,一次成功的路由测试,也不能证明其他语言、工具或工作负载都可用。
下一步应做什么
当答案空间有明确边界,而且一次决策能减少后续流程的实际工作时,Jev 值得作为候选。公开基准用来帮助选择实验,而不是跳过实验。如果任务需要生成内容,就把 Jev 作为其中一个组件,始终一起考察完整输出、成本与失败行为。
先填写工作表中的质量标准和回退策略。这两项明确之后,阈值测试才有意义,也能避免为一个与你的业务问题无关的漂亮成绩买单。
常见问题
- Jev 的基准成绩证明它能替代大语言模型吗?
- 不能。评测研究的是有界决策,并非通用文本生成或完整编程任务。选择模型前需要对齐任务、接口、对照系统和评估方法。
- 这是 Ofox 自己实测 Jev 的结果吗?
- 不是。本文分析已发表研究与官方文档。附件评估表是原创的评估辅助工具,不是新的模型实测。


