Jev:一个不会"说话"的模型,正在拆掉 Agent 最贵的一环

Jev:一个不会"说话"的模型,正在拆掉 Agent 最贵的一环

2026 年 9 月 15 日,一个不生成任何文字的模型发布。24 小时内,Vercel 上近 13% 的付费团队开始用它——平台历史上最快的采用纪录。

一、一个"哑巴"为什么能搅动行业

2026 年 9 月 15 日,硅谷没有发布会。

Diogo Almeida 只是在社交媒体上发了几条帖子,语气平淡得像在说"我把一个内部工具开放了"。他是 OpenAI 前研究员,RLHF 的主要作者之一——那项技术让 ChatGPT 学会了"好好说话",可能是当前 AI 时代最重要的训练方法。

然后数据开始动了。

Vercel AI Gateway 的后台曲线率先跳起来。上线 12 小时,Jev 超越了所有同期发布的模型。24 小时后,近 13% 的付费团队已经在使用它。36 小时内,14 万名开发者挤进了内测等待列表。

一个不生成任何文字的模型,凭什么?

先说一件看起来不相关的事。

过去几年,我在自己的数据管道里做过大量"胶水代码"——让上游模型的输出能被下游系统安全消费的那些琐碎环节:解析 JSON、校验字段、处理"模型说了句废话导致整条流水线崩掉"的异常。

某次做一个分类 demo,提示词写了四十多行,反复叮嘱"只输出一个词"。结果十次里有三次,它回复:“好的,根据内容分析,答案应该是正面。”——整条脚本因为多了一个句号就挂了。

那是“最会说话的模型”最荒谬的时刻。它把智力浪费在了社交礼仪上。

Jev 做的事情完全不同。你不给它写提示词,你给它写问题

  • Choice:从十二个工具里选一个
  • Score:这条客服消息的紧急度打几分
  • Noul:当前这一步是否满足终止条件

它不输出“好的,我来帮你判断”,它直接返回一个浮点数和选项编号。你拿到的东西不需要解析,因为它从来就不是“生成”出来的——它是算出来的。

官方给的延迟是 70 到 500 毫秒,对比前沿大模型动辄 3 到 329 秒的响应时间。输入成本每百万 token 0.042 美元,输出免费。拿它跑一个命令安全审查分类器,速度提升 5 到 18 倍,准确率还更高。

但真正让架构师们兴奋的,不是“快”,也不是“便宜”。

是它输出的“概率”是校准的。

传统大模型输出的“概率”是 token 层面的——它告诉你“正面”这个词出现的可能性是 87%,但这个数字跟“它判断对了吗”几乎没有关系。

Jev 的概率是校准的。TypeSafe 用了一套叫 RLCD(Reinforcement Learning for Calibrated Decisions) 的训练方法,奖励的不是“人类觉得这个回答好”,而是“你说的概率得和实际命中率对上”。

80% 置信度意味着:在一百次给出 80% 的预测里,大约八十次是对的。

这不是语气问题,这是统计契约。

二、七成开销花在“犹豫”上

Jev 的工程学意义,要放到 Agent 循环里才看得清。

先说一个我亲身踩过的坑。

2026 年春天,我用自研的网关搭了一条自动化写作流水线:让大模型读完一份中报,判断“毛利率是升是降”,再决定下一段写什么。单次调用约 1.8 秒,成本约 0.004 美元。听起来不贵。

但流水线跑起来后,每一步都在问大模型:这条命令危不危险?这个子任务派给谁?输出是否满足格式要求?测试失败了该重试还是换思路?

一天跑下来,真正用于“生成”的调用不到三成,剩下七成全是判断。

七成开销花在“犹豫”上,而不是“干活”上。

这不是我一个人的问题。传统 Agent 循环的结构性浪费,恰恰藏在每一次“犹豫”里。你让大模型做一次完整的自回归解码,只为回答“这个子任务该派给谁”,它消耗的算力与写一篇八百字分析几乎相同。

贵、慢,而且格式易崩——它可能给你返回一句“我认为应该派给……”而不是一个可路由的标签。于是你加正则、加重试、加解析层,系统越来越脆。

Jev 的工程学意义,就是把这类“犹豫”从生成任务里彻底剥离出去:跳过自回归解码,隐状态直接打分,单次前向计算完成全部判断。

但“快”只是表象。真正值得说的是另一个数字:结构化输出错误率 0%

传统大模型做判断时,即使你给了严格的 JSON schema,它仍可能吐出一个不存在的选项、一段无法解析的文本、或者一个格式对但语义荒谬的答案。这叫“格式幻觉”。

Jev 从根上消除了它——不是判断不出错,而是不会给你一个不存在的选项。输出空间被预先约束为带类型的集合,模型只在这个集合上打分。

这就像给一个话痨配了一把只能按固定键位的键盘,他再想跑题也跑不出去。

于是 Agent 架构里一条被忽视的分工线浮出水面:

昂贵的大模型负责“慢思考”——规划、生成、推理;轻量决策模型负责“快判断”——分类、选择、评分;Harness 层负责组装与调度。

我把它叫做“快慢分工”。

假设你是某电商平台的客服 Agent 负责人,每天要处理 50 万条用户消息。每一条都需要判断:紧急度、分类、是否转人工。用大模型做,单条成本约 0.0008 美元,50 万条就是 400 美元,延迟还让用户体验打折。换成 Jev 类决策模型,单条成本降到约 0.000002 美元,50 万条不到 1 美元,延迟从秒级压到百毫秒级。

省下的钱不是重点,重点是整个系统的吞吐量上了一个数量级。

一个反直觉的事实:限制 Agent 能力的,从来不是最慢的那一步,而是最快的那一步被重复了太多次。优化一个高频小判断的收益,可能远大于优化一次低频大生成。

三、三盆冷水:Jev 能做什么,不能做什么

这一节,我要用真实的数据把上一节的热情拆开。

3.1 它做对了什么

2026 年 9 月 20 日,有团队用 190 次中国财经判断任务实测了 Jev。材料取自监管部门和各公司中报原始公告,每道题反复问三到五遍。

  • 宏观政策与行业事件判断,18 次全对。“两新”政策、降准降息、煤炭供应冲击、汽车芯片短缺、光伏过剩、生猪周期,全部命中。
  • 公司中报基本面定性,32 次全对。宁德时代、比亚迪、万科、腾讯、茅台、美团、京东、泡泡玛特、安踏,九家公司的半年报,它读完能做方向判断。
  • 有一道题很有意思:青岛啤酒的材料里,单季和半年利润方向相反,问它半年累计是什么方向。5 次全对。这意味着它能处理材料内部的冲突信号,不是简单做关键词匹配。
  • 最让人意外的是“信息不足”那组。材料缺失关键数据,或者材料与问题无关时,20 次它都选了“信息不足”

这个能力听起来普通,但对一个只做选择的模型来说,知道“我不知道”是一种被训练过的克制

3.2 它做错了什么

然后看错题。

贴线计算,是它最明确的短板。

宁德时代、金山办公、茅台,用两年收入和成本判断毛利率方向。三家公司共 15 次测试,只对了 4 次

美的营业成本增速是否达到 17%,实际 16.83%。含新旧口径版本 5 次全错,只留两个数的版本 5 次全错。十次全错,而且每次报出的把握都很高。

这里出现了一个模式:把每道题的计算结果与最近的选项分界线做对比——

  • 金山办公毛利率,离分界线 0.06 个百分点,5 次全错
  • 宁德时代毛利率,离分界线 0.10 个百分点,5 次全错
  • 伊利收入增速,离分界线 0.13 个百分点,5 次全对

离分界线越近,它越容易算错,但把握度并不跟着降。

这比“算错”更麻烦。算错可以兜底,算错但自信,兜底的人不知道该不该信它。

3.3 准确率的硬数字

官方对比中,Jev 综合准确率 67.8%,对照模型 74.1%。差了 6 个百分点以上。

Sonnet 5 也是 67.8%,和 Jev 打平,但 Sonnet 5 每万次判断的成本是 1174 美元,Jev 是 4 美元

更快更便宜是真的,更准不是。

中文场景的另一组数据:50 条中文客服消息,Jev 完整准确率约 64% 到 65.2%,排在便宜小模型组第二。50 题成本约 0.002 美元,平均每题 0.73 秒,两项都是测试里最低的。

紧急度和分类基本可用,但严重度评分与实际人工标注存在偏差。有一道题它给出的严重度是 1.99,而人工介入阈值是 2.00。差了 0.01,规则判定为“不需要转人工”,但实际业务里这个单子应该转。

模型返回了精确的概率,不代表这个概率在业务阈值附近是可靠的。

3.4 所以“零幻觉”到底保证了什么

  • 保证答案落在你给的选项里
  • 保证不会吐出一个不存在的类别
  • 保证不会格式崩溃

不保证选中的那个是对的,不保证概率数字在阈值附近可信,不保证中文场景和英文场景一样好。

一个值得记住的判断:大模型的错误是“散”的——这次格式崩,下次语义偏;Jev 的错误是“聚”的——集中在那几个贴线计算上。一个错误模式可预测的模型,比一个错误模式随机的模型,在生产环境里更可管理,哪怕前者的准确率低几个百分点。

四、生态爆发:从 Jev 到 JevBench

Jev 发布后第四天,一个叫 APUS 的中国团队在 GitHub 上扔出了 MIT 协议的代码。

它选择的验证场景很刁钻——浏览器自动化,这是 Agent 跑任务时最容易翻车的地方。任何用过 Claude Code 的人都知道,让模型去点一个按钮,它有三成概率给你写出一个不存在的 CSS 选择器,然后整条链路崩溃重试。

APUS 的做法是把页面上所有可交互元素抓出来,编号,A、B、C、D,让 Qwen3.5-9B 单次前向计算直接打分,选字母就行

模型永远看不到“点击那个蓝色按钮”这种自由发挥的机会。它只能从给定选项里挑。选错了是智力问题;选不出来?不存在的,每个选项都对应一个 token 的 logit,概率归一化之后总有一个 argmax。

实测数据:Apple M2 Pro,32GB 统一内存,Qwen3.5-9B 的 4-bit 量化版本,内存占用约 5.95GB。维基百科端到端导航,中位耗时 18 到 30 秒。表单填报、站内导航这类更简单的任务,3 到 12 秒。单任务模型打分次数只有 4 次——从最初自回归方案动辄 14 次推理调用砍下来的。

这不是性能碾压,是架构选择带来的数量级差异。

4.1 JevBench:第一个针对决策模型的评测榜

JevBench v1.2 出现的时候,标题很朴素:“第一个针对 Jev 类模型的评测榜”。

21 个系统,534 道决策题,220 道 hard 档。 总分由智力、校准、速度、成本四项几何平均合成——几何平均的意思很简单:任何一项趋近于零,总分就被拽到零附近。

  • 你用 GPT-5.6 Luna 拿到 96.8 的智力分,但成本分只有 28.2,排名第十二
  • DeepSeek V4.1 Flash 智力 96.1、校准 96.7,成本分 17.1,排第十六

榜单在用数学语言说一件很残酷的事:在决策模型这个品类里,“聪明”只是入场券,不是竞争优势。

榜首不是官方 Jev——是 classifier.dev 的 fast tier,84.8 分。它后端跑的就是 Jev,智力分 90.1 对官方 Jev 的 90.4 基本持平,但 p50 延迟 0.39 秒对 0.65 秒,成本每千次 0.0033 美元对 0.041 美元。

同一颗大脑,套了一层更薄的壳,排名就换了位置。

紧随其后的是 SemIf(Qwen3.5-4B,没有任何微调,只是读取选项 token 的概率分布),74.6 分。第四名 djev 用的是 diffusion-gemma 架构。

五天内,官方 Jev 从“唯一”变成了“之一”。

4.2 一个细节值得盯着看

JevBench 有一个细节:open-alternative-jev 在 yes/no 判定题上,把选项顺序从“A. yes, B. no”改成“A. no, B. yes”,正确率从 72% 掉到 21%

51 个百分点的差距,只因为两个选项换了位置。

这说明 4B 级别的小模型在“理解选项语义”这件事上仍然脆弱,它的判断在相当程度上依赖于 token 位置和训练数据里的先验分布。

如果你打算在生产环境用任何一个 Jev 类模型,选项顺序的鲁棒性必须纳入你自己的评测清单。

4.3 校准,是这一层的入场券

JevBench 的 Calibration 项衡量的是一件事:模型说“80% 有把握”的时候,实际命中率是不是真的接近 80%。

这改变的是模型在系统里的定位。一个校准良好的决策模型可以这样用:

  • 置信度 > 0.9:自动执行
  • 0.6 到 0.9 之间:丢给大模型复核
  • 低于 0.6:直接转人工

程序不需要理解判断的内容,只需要读一个浮点数。

这就是“置信度路由”——它让决策模型变成了一个可以装配的零件,而不是一个需要被信任的智能体。

我在自己的网关里试过类似的逻辑,用 DeepSeek 做消息路由,判断一条微信消息该走哪个 agent 处理。但 DeepSeek 给的是文本回答,我还得写正则去解析。Jev 的 Noul 原语直接返回一个 0 到 1 之间的数,代码里写一个 if 就完事了。

省掉的不是那几行正则,是“解析失败”这个故障模式本身。

五、冲击波之后:决策层分化的长期含义

Jev 发布后的第三周,我在自己的 NAS 上跑了一次对照实验。

同一套 Agent 循环,同一批任务——从网页抓取、表单填报到本地文件归档——唯一的变量是决策节点。A 组用完整 LLM 调用完成每一次“重试还是换路”“这条命令危不危险”的判断,B 组换成本地小模型做单次前向打分。

结果不出意料:B 组端到端耗时降了六成,API 账单从每天四美元掉到不足一毛。

但真正让我愣住的不是数字,是失败模式的变化

  • A 组的错误往往是“格式崩了”——模型输出了一段无法解析的文字,整个循环卡死
  • B 组的错误则是“判断偏了”——分数打高了,选错了分支,但系统本身纹丝不动,继续往下跑

前者是工程事故,后者是决策偏差。前者让你熬夜修管道,后者让你白天改规则。

5.1 模型物种分化不是修辞,是架构事实

过去我们习惯用“大模型 vs 小模型”来讨论 AI,仿佛它们在同一条赛道上比谁跑得快。但 Jev 类决策模型的出现,让这条赛道裂成了两条

一条追求“更会生成”——写代码、写文章、写方案,参数越大越好,推理越深越好,System Two 的慢思考是它的命脉。

另一条追求“更快更准判断”——选哪个、打多少分、是不是,单次前向,隐状态直接映射到结构化输出,System One 的快反射是它的全部。

两者不是替代关系。你不会用 Jev 去写一封邮件,也不会用 GPT-5 去判断一条命令是否危险——那就像用计算器去写诗,用诗人去算账。

未来的 Agent 架构将默认包含两层:慢脑负责规划、生成、推理,快脑负责分类、选择、评分。Harness 层夹在中间,像神经系统的丘脑,决定哪些信号上行到皮层,哪些下行到脊髓。

这不是设计选择,是成本结构的必然。

一个值得记住的细节:有天深夜,我的知识管道在剪贴板里捕获了一段模糊的截图文字,本地小模型判定“信息不足,转人工”,而云端大模型在同一位置给出了一个看似合理实则编造的摘要。那一刻我意识到,快脑的真正优势不是便宜,是它被设计成“允许说不”。生成模型的本能是填满空格,决策模型的本能是承认边界。前者是才华,后者是诚实。

5.2 对个人开发者的意义

这对个人开发者的意义,怎么强调都不过分。

假设你是独立开发者,手头只有一台 M2 Pro 笔记本和一个 Go 二进制文件。过去你要构建一个能自主判断的 Agent,必须把每一次“该不该重试”“这条命令危不危险”都发给云端 API,延迟、费用、隐私三重压力让你只能做 demo,做不了日常工具。

现在,决策层轻量化之后,一个本地小模型就能接管全部高频判断,云端大模型只在真正需要“慢思考”时才被唤醒。一台消费级笔记本、一个本地模型、一个编排层,就能跑完过去需要大量云端调用才能完成的 Agent 判断循环。

“个人智能操作系统”的最后一环,正在补齐。

过去几年我们有了记忆层、执行层、连接层,但决策层一直悬在空中——要么依赖云端 API,要么靠硬编码规则。Jev 类模型的出现,让决策层可以像其他层一样,跑在本地、跑在离线、跑在一个 Go 二进制文件里。

这意味着什么?

  • 意味着你的个人 AI 系统可以在飞机上、在断网的咖啡馆、在没有 API key 的深夜,继续做判断
  • 意味着你的数据不出机器,判断也不出机器
  • 意味着“个人智能操作系统”不再是一个需要持续付费的订阅服务,而是一个可以随身携带的软件资产

5.3 冲击波尚未抵达的地方

但边界同样值得标记。

  • Jev 目前仅接受文本。图片要转文本,音频要转文本,视频更是要转文本。这意味着在视觉和听觉场景里,决策层仍然是瘸的。
  • 中文准确率待验证。官方对比中 67.8% 的准确率低于对照模型的 74.1%,中文 CJK 语言的表现可能更低。
  • 置信度校准在业务分布外是否可靠,仍是开放问题。你在财经判断上校准到 80% 的置信度,换到医疗问诊场景可能完全失准。

方向已经清晰,但路径仍需要每个人自己走一遍。

六、写在最后

不是所有智能都需要“说出来”。有些智能只需要“判断对”。

这句话听起来简单,但它拆掉的是一整个时代的默认假设——我们曾以为,AI 越像人越好,越能说会道越强

Jev 的冲击波告诉我们:在 Agent 的世界里,一个不会说话的判断者,可能比最会说话的生成者更有用

因为 Agent 不需要诗人。

Agent 需要一个能在十字路口果断打灯的人。