Jev:一个不会"说话"的模型,正在拆掉 Agent 最贵的一环
2026 年 9 月 15 日,一个不生成任何文字的模型发布。24 小时内,Vercel 上近 13% 的付费团队开始用它——平台历史上最快的采用纪录。
一、一个"哑巴"为什么能搅动行业
2026 年 9 月 15 日,硅谷没有发布会。
Diogo Almeida 只是在社交媒体上发了几条帖子,语气平淡得像在说"我把一个内部工具开放了"。他是 OpenAI 前研究员,RLHF 的主要作者之一——那项技术让 ChatGPT 学会了"好好说话",可能是当前 AI 时代最重要的训练方法。
然后数据开始动了。
Vercel AI Gateway 的后台曲线率先跳起来。上线 12 小时,Jev 超越了所有同期发布的模型。24 小时后,近 13% 的付费团队已经在使用它。36 小时内,14 万名开发者挤进了内测等待列表。
一个不生成任何文字的模型,凭什么?
先说一件看起来不相关的事。
过去几年,我在自己的数据管道里做过大量"胶水代码"——让上游模型的输出能被下游系统安全消费的那些琐碎环节:解析 JSON、校验字段、处理"模型说了句废话导致整条流水线崩掉"的异常。
某次做一个分类 demo,提示词写了四十多行,反复叮嘱"只输出一个词"。结果十次里有三次,它回复:“好的,根据内容分析,答案应该是正面。”——整条脚本因为多了一个句号就挂了。
那是“最会说话的模型”最荒谬的时刻。它把智力浪费在了社交礼仪上。
Jev 做的事情完全不同。你不给它写提示词,你给它写问题:
- Choice:从十二个工具里选一个
- Score:这条客服消息的紧急度打几分
- Noul:当前这一步是否满足终止条件
它不输出“好的,我来帮你判断”,它直接返回一个浮点数和选项编号。你拿到的东西不需要解析,因为它从来就不是“生成”出来的——它是算出来的。
官方给的延迟是 70 到 500 毫秒,对比前沿大模型动辄 3 到 329 秒的响应时间。输入成本每百万 token 0.042 美元,输出免费。拿它跑一个命令安全审查分类器,速度提升 5 到 18 倍,准确率还更高。
但真正让架构师们兴奋的,不是“快”,也不是“便宜”。
是它输出的“概率”是校准的。
传统大模型输出的“概率”是 token 层面的——它告诉你“正面”这个词出现的可能性是 87%,但这个数字跟“它判断对了吗”几乎没有关系。
Jev 的概率是校准的。TypeSafe 用了一套叫 RLCD(Reinforcement Learning for Calibrated Decisions) 的训练方法,奖励的不是“人类觉得这个回答好”,而是“你说的概率得和实际命中率对上”。
80% 置信度意味着:在一百次给出 80% 的预测里,大约八十次是对的。
这不是语气问题,这是统计契约。
二、七成开销花在“犹豫”上
Jev 的工程学意义,要放到 Agent 循环里才看得清。
先说一个我亲身踩过的坑。
2026 年春天,我用自研的网关搭了一条自动化写作流水线:让大模型读完一份中报,判断“毛利率是升是降”,再决定下一段写什么。单次调用约 1.8 秒,成本约 0.004 美元。听起来不贵。
但流水线跑起来后,每一步都在问大模型:这条命令危不危险?这个子任务派给谁?输出是否满足格式要求?测试失败了该重试还是换思路?
一天跑下来,真正用于“生成”的调用不到三成,剩下七成全是判断。
七成开销花在“犹豫”上,而不是“干活”上。
这不是我一个人的问题。传统 Agent 循环的结构性浪费,恰恰藏在每一次“犹豫”里。你让大模型做一次完整的自回归解码,只为回答“这个子任务该派给谁”,它消耗的算力与写一篇八百字分析几乎相同。
贵、慢,而且格式易崩——它可能给你返回一句“我认为应该派给……”而不是一个可路由的标签。于是你加正则、加重试、加解析层,系统越来越脆。
Jev 的工程学意义,就是把这类“犹豫”从生成任务里彻底剥离出去:跳过自回归解码,隐状态直接打分,单次前向计算完成全部判断。
但“快”只是表象。真正值得说的是另一个数字:结构化输出错误率 0%。
传统大模型做判断时,即使你给了严格的 JSON schema,它仍可能吐出一个不存在的选项、一段无法解析的文本、或者一个格式对但语义荒谬的答案。这叫“格式幻觉”。
Jev 从根上消除了它——不是判断不出错,而是不会给你一个不存在的选项。输出空间被预先约束为带类型的集合,模型只在这个集合上打分。
这就像给一个话痨配了一把只能按固定键位的键盘,他再想跑题也跑不出去。
于是 Agent 架构里一条被忽视的分工线浮出水面:
昂贵的大模型负责“慢思考”——规划、生成、推理;轻量决策模型负责“快判断”——分类、选择、评分;Harness 层负责组装与调度。
我把它叫做“快慢分工”。
假设你是某电商平台的客服 Agent 负责人,每天要处理 50 万条用户消息。每一条都需要判断:紧急度、分类、是否转人工。用大模型做,单条成本约 0.0008 美元,50 万条就是 400 美元,延迟还让用户体验打折。换成 Jev 类决策模型,单条成本降到约 0.000002 美元,50 万条不到 1 美元,延迟从秒级压到百毫秒级。
省下的钱不是重点,重点是整个系统的吞吐量上了一个数量级。
一个反直觉的事实:限制 Agent 能力的,从来不是最慢的那一步,而是最快的那一步被重复了太多次。优化一个高频小判断的收益,可能远大于优化一次低频大生成。
三、三盆冷水:Jev 能做什么,不能做什么
这一节,我要用真实的数据把上一节的热情拆开。
3.1 它做对了什么
2026 年 9 月 20 日,有团队用 190 次中国财经判断任务实测了 Jev。材料取自监管部门和各公司中报原始公告,每道题反复问三到五遍。
- 宏观政策与行业事件判断,18 次全对。“两新”政策、降准降息、煤炭供应冲击、汽车芯片短缺、光伏过剩、生猪周期,全部命中。
- 公司中报基本面定性,32 次全对。宁德时代、比亚迪、万科、腾讯、茅台、美团、京东、泡泡玛特、安踏,九家公司的半年报,它读完能做方向判断。
- 有一道题很有意思:青岛啤酒的材料里,单季和半年利润方向相反,问它半年累计是什么方向。5 次全对。这意味着它能处理材料内部的冲突信号,不是简单做关键词匹配。
- 最让人意外的是“信息不足”那组。材料缺失关键数据,或者材料与问题无关时,20 次它都选了“信息不足”。
这个能力听起来普通,但对一个只做选择的模型来说,知道“我不知道”是一种被训练过的克制。
3.2 它做错了什么
然后看错题。
贴线计算,是它最明确的短板。
宁德时代、金山办公、茅台,用两年收入和成本判断毛利率方向。三家公司共 15 次测试,只对了 4 次。
美的营业成本增速是否达到 17%,实际 16.83%。含新旧口径版本 5 次全错,只留两个数的版本 5 次全错。十次全错,而且每次报出的把握都很高。
这里出现了一个模式:把每道题的计算结果与最近的选项分界线做对比——
- 金山办公毛利率,离分界线 0.06 个百分点,5 次全错
- 宁德时代毛利率,离分界线 0.10 个百分点,5 次全错
- 伊利收入增速,离分界线 0.13 个百分点,5 次全对
离分界线越近,它越容易算错,但把握度并不跟着降。
这比“算错”更麻烦。算错可以兜底,算错但自信,兜底的人不知道该不该信它。
3.3 准确率的硬数字
官方对比中,Jev 综合准确率 67.8%,对照模型 74.1%。差了 6 个百分点以上。
Sonnet 5 也是 67.8%,和 Jev 打平,但 Sonnet 5 每万次判断的成本是 1174 美元,Jev 是 4 美元。
更快更便宜是真的,更准不是。
中文场景的另一组数据:50 条中文客服消息,Jev 完整准确率约 64% 到 65.2%,排在便宜小模型组第二。50 题成本约 0.002 美元,平均每题 0.73 秒,两项都是测试里最低的。
紧急度和分类基本可用,但严重度评分与实际人工标注存在偏差。有一道题它给出的严重度是 1.99,而人工介入阈值是 2.00。差了 0.01,规则判定为“不需要转人工”,但实际业务里这个单子应该转。
模型返回了精确的概率,不代表这个概率在业务阈值附近是可靠的。
3.4 所以“零幻觉”到底保证了什么
- 保证答案落在你给的选项里
- 保证不会吐出一个不存在的类别
- 保证不会格式崩溃
它不保证选中的那个是对的,不保证概率数字在阈值附近可信,不保证中文场景和英文场景一样好。
一个值得记住的判断:大模型的错误是“散”的——这次格式崩,下次语义偏;Jev 的错误是“聚”的——集中在那几个贴线计算上。一个错误模式可预测的模型,比一个错误模式随机的模型,在生产环境里更可管理,哪怕前者的准确率低几个百分点。
四、生态爆发:从 Jev 到 JevBench
Jev 发布后第四天,一个叫 APUS 的中国团队在 GitHub 上扔出了 MIT 协议的代码。
它选择的验证场景很刁钻——浏览器自动化,这是 Agent 跑任务时最容易翻车的地方。任何用过 Claude Code 的人都知道,让模型去点一个按钮,它有三成概率给你写出一个不存在的 CSS 选择器,然后整条链路崩溃重试。
APUS 的做法是把页面上所有可交互元素抓出来,编号,A、B、C、D,让 Qwen3.5-9B 单次前向计算直接打分,选字母就行。
模型永远看不到“点击那个蓝色按钮”这种自由发挥的机会。它只能从给定选项里挑。选错了是智力问题;选不出来?不存在的,每个选项都对应一个 token 的 logit,概率归一化之后总有一个 argmax。
实测数据:Apple M2 Pro,32GB 统一内存,Qwen3.5-9B 的 4-bit 量化版本,内存占用约 5.95GB。维基百科端到端导航,中位耗时 18 到 30 秒。表单填报、站内导航这类更简单的任务,3 到 12 秒。单任务模型打分次数只有 4 次——从最初自回归方案动辄 14 次推理调用砍下来的。
这不是性能碾压,是架构选择带来的数量级差异。
4.1 JevBench:第一个针对决策模型的评测榜
JevBench v1.2 出现的时候,标题很朴素:“第一个针对 Jev 类模型的评测榜”。
21 个系统,534 道决策题,220 道 hard 档。 总分由智力、校准、速度、成本四项几何平均合成——几何平均的意思很简单:任何一项趋近于零,总分就被拽到零附近。
- 你用 GPT-5.6 Luna 拿到 96.8 的智力分,但成本分只有 28.2,排名第十二
- DeepSeek V4.1 Flash 智力 96.1、校准 96.7,成本分 17.1,排第十六
榜单在用数学语言说一件很残酷的事:在决策模型这个品类里,“聪明”只是入场券,不是竞争优势。
榜首不是官方 Jev——是 classifier.dev 的 fast tier,84.8 分。它后端跑的就是 Jev,智力分 90.1 对官方 Jev 的 90.4 基本持平,但 p50 延迟 0.39 秒对 0.65 秒,成本每千次 0.0033 美元对 0.041 美元。
同一颗大脑,套了一层更薄的壳,排名就换了位置。
紧随其后的是 SemIf(Qwen3.5-4B,没有任何微调,只是读取选项 token 的概率分布),74.6 分。第四名 djev 用的是 diffusion-gemma 架构。
五天内,官方 Jev 从“唯一”变成了“之一”。
4.2 一个细节值得盯着看
JevBench 有一个细节:open-alternative-jev 在 yes/no 判定题上,把选项顺序从“A. yes, B. no”改成“A. no, B. yes”,正确率从 72% 掉到 21%。
51 个百分点的差距,只因为两个选项换了位置。
这说明 4B 级别的小模型在“理解选项语义”这件事上仍然脆弱,它的判断在相当程度上依赖于 token 位置和训练数据里的先验分布。
如果你打算在生产环境用任何一个 Jev 类模型,选项顺序的鲁棒性必须纳入你自己的评测清单。
4.3 校准,是这一层的入场券
JevBench 的 Calibration 项衡量的是一件事:模型说“80% 有把握”的时候,实际命中率是不是真的接近 80%。
这改变的是模型在系统里的定位。一个校准良好的决策模型可以这样用:
- 置信度 > 0.9:自动执行
- 0.6 到 0.9 之间:丢给大模型复核
- 低于 0.6:直接转人工
程序不需要理解判断的内容,只需要读一个浮点数。
这就是“置信度路由”——它让决策模型变成了一个可以装配的零件,而不是一个需要被信任的智能体。
我在自己的网关里试过类似的逻辑,用 DeepSeek 做消息路由,判断一条微信消息该走哪个 agent 处理。但 DeepSeek 给的是文本回答,我还得写正则去解析。Jev 的 Noul 原语直接返回一个 0 到 1 之间的数,代码里写一个 if 就完事了。
省掉的不是那几行正则,是“解析失败”这个故障模式本身。
五、冲击波之后:决策层分化的长期含义
Jev 发布后的第三周,我在自己的 NAS 上跑了一次对照实验。
同一套 Agent 循环,同一批任务——从网页抓取、表单填报到本地文件归档——唯一的变量是决策节点。A 组用完整 LLM 调用完成每一次“重试还是换路”“这条命令危不危险”的判断,B 组换成本地小模型做单次前向打分。
结果不出意料:B 组端到端耗时降了六成,API 账单从每天四美元掉到不足一毛。
但真正让我愣住的不是数字,是失败模式的变化。
- A 组的错误往往是“格式崩了”——模型输出了一段无法解析的文字,整个循环卡死
- B 组的错误则是“判断偏了”——分数打高了,选错了分支,但系统本身纹丝不动,继续往下跑
前者是工程事故,后者是决策偏差。前者让你熬夜修管道,后者让你白天改规则。
5.1 模型物种分化不是修辞,是架构事实
过去我们习惯用“大模型 vs 小模型”来讨论 AI,仿佛它们在同一条赛道上比谁跑得快。但 Jev 类决策模型的出现,让这条赛道裂成了两条。
一条追求“更会生成”——写代码、写文章、写方案,参数越大越好,推理越深越好,System Two 的慢思考是它的命脉。
另一条追求“更快更准判断”——选哪个、打多少分、是不是,单次前向,隐状态直接映射到结构化输出,System One 的快反射是它的全部。
两者不是替代关系。你不会用 Jev 去写一封邮件,也不会用 GPT-5 去判断一条命令是否危险——那就像用计算器去写诗,用诗人去算账。
未来的 Agent 架构将默认包含两层:慢脑负责规划、生成、推理,快脑负责分类、选择、评分。Harness 层夹在中间,像神经系统的丘脑,决定哪些信号上行到皮层,哪些下行到脊髓。
这不是设计选择,是成本结构的必然。
一个值得记住的细节:有天深夜,我的知识管道在剪贴板里捕获了一段模糊的截图文字,本地小模型判定“信息不足,转人工”,而云端大模型在同一位置给出了一个看似合理实则编造的摘要。那一刻我意识到,快脑的真正优势不是便宜,是它被设计成“允许说不”。生成模型的本能是填满空格,决策模型的本能是承认边界。前者是才华,后者是诚实。
5.2 对个人开发者的意义
这对个人开发者的意义,怎么强调都不过分。
假设你是独立开发者,手头只有一台 M2 Pro 笔记本和一个 Go 二进制文件。过去你要构建一个能自主判断的 Agent,必须把每一次“该不该重试”“这条命令危不危险”都发给云端 API,延迟、费用、隐私三重压力让你只能做 demo,做不了日常工具。
现在,决策层轻量化之后,一个本地小模型就能接管全部高频判断,云端大模型只在真正需要“慢思考”时才被唤醒。一台消费级笔记本、一个本地模型、一个编排层,就能跑完过去需要大量云端调用才能完成的 Agent 判断循环。
“个人智能操作系统”的最后一环,正在补齐。
过去几年我们有了记忆层、执行层、连接层,但决策层一直悬在空中——要么依赖云端 API,要么靠硬编码规则。Jev 类模型的出现,让决策层可以像其他层一样,跑在本地、跑在离线、跑在一个 Go 二进制文件里。
这意味着什么?
- 意味着你的个人 AI 系统可以在飞机上、在断网的咖啡馆、在没有 API key 的深夜,继续做判断
- 意味着你的数据不出机器,判断也不出机器
- 意味着“个人智能操作系统”不再是一个需要持续付费的订阅服务,而是一个可以随身携带的软件资产
5.3 冲击波尚未抵达的地方
但边界同样值得标记。
- Jev 目前仅接受文本。图片要转文本,音频要转文本,视频更是要转文本。这意味着在视觉和听觉场景里,决策层仍然是瘸的。
- 中文准确率待验证。官方对比中 67.8% 的准确率低于对照模型的 74.1%,中文 CJK 语言的表现可能更低。
- 置信度校准在业务分布外是否可靠,仍是开放问题。你在财经判断上校准到 80% 的置信度,换到医疗问诊场景可能完全失准。
方向已经清晰,但路径仍需要每个人自己走一遍。
六、写在最后
不是所有智能都需要“说出来”。有些智能只需要“判断对”。
这句话听起来简单,但它拆掉的是一整个时代的默认假设——我们曾以为,AI 越像人越好,越能说会道越强。
Jev 的冲击波告诉我们:在 Agent 的世界里,一个不会说话的判断者,可能比最会说话的生成者更有用。
因为 Agent 不需要诗人。
Agent 需要一个能在十字路口果断打灯的人。